Convertisseur de VOX en SPH
Convertissez vos fichiers vox en sph en ligne et gratuitement
vox
sph
Comment convertir un fichier VOX en fichier SPH
Sélectionnez des fichiers depuis l'ordinateur, Google Drive, Dropbox, une URL ou glissez-les sur la page.
Choisissez sph ou tout autre format de sortie (plus de 200 formats supportés)
Laissez le fichier convertir et vous pourrez télécharger votre fichier sph juste après
À propos des formats
Le VOX est un format audio sans en-tête construit autour de l'encodage ADPCM Dialogic, largement adopté dans la téléphonie, les systèmes de réponse vocale interactive (SVI) et les plateformes de messagerie vocale depuis les années 1980. Chaque échantillon audio est compressé en 4 bits à l'aide d'un algorithme développé par Oki Electric et implemente en matériel sûr les cartes d'interface téléphonique de Dialogic Corporation. Les fichiers VOX utilisent généralement une fréquence d'échantillonnage de 6000 où 8000 Hz, produisant dès enregistrements extrêmement compacts optimisés pour l'intelligibilite vocale plutôt que la fidélité musicale. Comme le format né comporte pas d'en-tête, le logiciel de lecture doit connaitre à l'avancé la fréquence d'échantillonnage et les paramètres d'encodage — un compromis qui réduit la surcharge mais exige une gestion rigoureuse dès fichiers. L'avantage principal du VOX est l'efficacité de stockage : un enregistrement vocal d'une minute à 8 kHz occupe environ 240 Ko, ce qui est pratique pour les systèmes stockant dès milliers de prompts. L'ADPCM Dialogic est conforme au standard UIT-T G.726, assurant l'interopérabilité entre les équipements téléphoniques de différents fabricants. Même à mesure que les centres d'appels modernes migrent vers dès systèmes IP avec dès codecs comme Opus), de vastes bibliothèques d'enregistrements VOX persistent dans les deploiements SVI anciens et les archivés de conformite à travers le monde.
Le SPH est l'extension de fichier pour l'audio stocké dans le format NIST SPHERE (SPeech HEader REsources), un standard crée par le National Institute of Standards and Technology americain vers 1990. Conçu pour la recherché en parole, les fichiers SPH comportent un en-tête ASCII de 1024 octets riche en métadonnées — identifiants de basé de données, nombre de canaux, frequences d'échantillonnage, ordre dès octets et type de compression — rendant chaque enregistrement auto-descriptif. L'audio sous-jacent est typiquement du PCM linéaire 16 bits echantillonne à 16 kHz, bien que d'autres configurations soient autorisees. Les chercheurs du NIST, de la DARPA et dès universites du monde entier s'appuient sûr le SPH pour distribuer dès corpus de parole tels que TIMIT, Switchboard et les collections du LDC qui sous-tendent les systèmes modernes de reconnaissance automatique de la parole. Un avantage clé est que l'en-tête lisible par l'homme permet àux scripts d'analyser les métadonnées d'enregistrement sans décodage binaire. La standardisation stricte du format élimine également toute ambiguite lors du partagé de jeux de données entre institutions et plateformes. Comme les fichiers SPH stockent du PCM non compressé, ils préservent la pleine fidélité audio — essentiel lors de l'entrainement de modèles acoustiques où même de petits artéfacts peuvent fausser les résultats.