ForHosting KIT · Audio et voix

Synthèse vocale SSML

Ce point d’accès de synthèse vocale accepte le texte balisé en SSML que votre pipeline produit déjà, ainsi que du texte brut.

● Betapar requête + par 1 000 caractères$0.002
Utilisez-le depuis WebAPIE-mailTelegramApp bientôt

Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.

Il extrait les mots à prononcer du balisage et les synthétise en un audio à la voix naturelle, si bien qu’un flux SSML existant peut pointer ici sans d’abord retirer les balises pour revenir au texte brut. Soyons clairs sur la limite dès le départ : ce moteur prononce les mots, pas les réglages acoustiques fins que le SSML sait décrire.

Ce qu’est le SSML et pourquoi il existe

Le Speech Synthesis Markup Language est une norme du W3C conçue pour qu’un rédacteur décrive comment un moteur de voix doit dire quelque chose, et pas seulement quoi dire : où marquer une pause, quelle syllabe accentuer, comment prononcer un sigle, si une suite de chiffres est une date, un numéro de téléphone ou une simple quantité. C’est depuis des années la convention du secteur pour piloter la parole synthétisée, précisément parce que le texte brut est réellement ambigu — « 2/3 » peut être une date, une fraction ou un score, et seul le balisage tranche cela dans l’abstrait. C’est ce format que ce point d’accès accepte en entrée ; ce qu’il fait de chaque balise est décrit clairement dans la section suivante.

Comment fonctionnent la requête et la réponse

Vous envoyez du texte balisé en SSML (ou du texte brut) dans le corps de la requête. Le service extrait les mots à prononcer du balisage et les synthétise ; les balises elles-mêmes sont réduites à leur texte avant la synthèse. La tâche est mise en file de façon asynchrone et renvoie aussitôt un task_id ; l’audio produit est livré ensuite via un webhook signé ou un lien signé valable 24 heures. Comme ce sont les mots qui sont synthétisés, envoyer du SSML ou envoyer le texte brut équivalent produit la même narration naturelle — le balisage est accepté par compatibilité, non parce que chaque balise modifie le son.

Ce que ce moteur restitue et ce qu’il ne restitue pas

Voici la limite honnête, énoncée pour que rien sur cette page ne survende l’outil. Le moteur de voix actuel lit le contenu textuel et produit une parole naturelle et bien rythmée. Il n’applique pas de façon acoustique les réglages fins du SSML : l’emphase, la prononciation phonétique, la prosodie et les durées de pause exactes sont acceptées en entrée puis retirées, non restituées. Ainsi, une balise de pause de deux secondes ne retient pas la ligne pendant deux secondes, et une balise d’emphase n’accentue pas ce mot plus que le modèle ne le ferait de lui-même. Si votre usage dépend de la restitution précise de ces réglages, cette capacité n’est pas encore disponible sur ce moteur — ce point d’accès existe pour qu’un pipeline SSML produise de l’audio dès aujourd’hui sans branche de texte brut séparée.

L’intégrer à des contenus automatisés

Le SSML n’est que du texte structuré, donc facile à générer par programme — un pipeline de contenu peut envelopper des nombres dans des balises, insérer des pauses entre les sections ou annoter un nom d’un indice phonétique, sans intervention humaine. L’intérêt de ce point d’accès pour ce public est qu’il accepte tel quel le SSML qu’ils émettent déjà : pas besoin de construire et d’entretenir un second chemin de code qui réduit leur balisage à du texte brut avant l’envoi. Le tarif reflète la nature légère et ciblée de la tâche — une petite base par requête plus un tarif aux mille caractères du texte envoyé, les tâches en échec n’étant jamais facturées après les nouvelles tentatives automatiques.

Accès et traitement des résultats

Ce point d’accès exige un solde prépayé comme tous les autres de l’API ; une requête sans solde renvoie HTTP 402 plutôt qu’un résultat partiel ou dégradé. Le texte envoyé et l’audio généré sont supprimés à la fin de la période de conservation et ne servent jamais à entraîner des modèles — la livraison passe strictement par votre webhook ou un lien signé temporaire, et rien n’est conservé au-delà de cette fenêtre.

Remplacement direct pour un pipeline SSML existant

Faites pointer vers ce point d’accès un flux qui émet déjà du SSML et récupérez l’audio parlé sans écrire votre propre étape pour retirer d’abord les balises et revenir au texte brut.

Narration à partir de scripts générés

Transformez des scripts générés par algorithme en audio parlé à la voix naturelle, en une étape automatisée de plus dans un pipeline de contenu.

Texte long en audio

Convertissez articles, notes ou documentation en audio pour ceux qui préfèrent écouter le contenu plutôt que le lire.

Sortie vocale multilingue

Produisez de l’audio parlé dans les langues prises en charge à partir du même format de requête, piloté par le champ de langue.

Qu’est-ce que le SSML et comment cette api de synthèse vocale l’utilise-t-elle ?

Le SSML est une norme de balisage pour décrire la synthèse vocale. Ce point d’accès accepte du texte balisé en SSML, en extrait les mots à prononcer et les synthétise en audio naturel. Il accepte le format par compatibilité ; voyez la réponse suivante pour savoir quels réglages SSML sont réellement restitués.

Restitue-t-il les balises d’emphase, de phonème et de prosodie ?

Non — pas sur le moteur de voix actuel. Ces balises, ainsi que les durées de pause exactes, sont acceptées en entrée puis réduites à leur texte ; l’audio prononce les mots naturellement au lieu d’appliquer l’emphase, la prononciation ou les pauses balisées. La restitution acoustique précise de ces réglages n’est pas encore disponible.

Cette api de synthèse vocale est-elle gratuite ?

Il n’y a pas de palier gratuit — les paliers gratuits sont détournés et ralentissent tout le monde. L’accès repose sur un solde prépayé ForHosting KIT : rechargez à partir de $10.00 (il n’expire jamais) et chaque requête est facturée à son prix publié, si bien qu’un appel sans solde renvoie HTTP 402. Pas d’abonnement, pas de jetons ni de crédits inventés, et une tâche en échec n’est jamais facturée.

Combien cela coûte-t-il ?

Cela coûte $0.002 par requête plus $0.0025 par tranche de 1000 caractères du texte envoyé.

Ai-je besoin du SSML pour une synthèse vocale simple ?

Non. Si vous voulez seulement un audio à la voix naturelle à partir de texte brut, le point d’accès standard de synthèse vocale est plus simple et produit le même type de narration. Le texte brut comme le SSML ressortent ici en parole naturelle.

Comment récupérer l’audio généré ?

La tâche s’exécute de façon asynchrone et renvoie aussitôt un task_id ; l’audio terminé est livré via un webhook signé ou un lien signé valable 24 heures.

Que se passe-t-il si mon balisage SSML est invalide ?

Comme le balisage est réduit à son texte parlé avant la synthèse, des balises mal formées ne font pas échouer la requête — vous obtenez quand même l’audio des mots lisibles. Rien n’est rejeté parce qu’une balise est fausse, alors ne comptez pas sur ce point d’accès pour valider votre SSML.

Puis-je l’utiliser pour contrôler la prononciation de noms ou de sigles ?

Pas de façon acoustique — le contrôle par phonème n’est pas restitué sur ce moteur, donc une balise de phonème n’imposera pas une prononciation précise. Si un nom doit être dit d’une certaine manière, écrivez-le phonétiquement dans le texte lui-même pour que les mots portent la prononciation.

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/voice/tts-ssml

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/voice/tts-ssml \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"ssml":"<speak>Hola <break time=\"500ms\"/> mundo.</speak>"}'
{
  "ssml": "<speak>Hola <break time=\"500ms\"/> mundo.</speak>"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "voice.tts_ssml",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.002
par 1 000 caractères$0.0025

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

max_mb200
max_minutes180
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.

Consulter la documentation complète du KIT →