ForHosting KIT · Audio e voce

Sintesi vocale con SSML

Questo endpoint di sintesi vocale accetta il testo con i tag SSML che il tuo flusso già produce, e anche il testo semplice.

● Betaper richiesta + per 1.000 caratteri$0.002
Usalo da WebAPIEmailTelegramApp presto

Esegui questo sui nostri server con il tuo account. Gli strumenti gratuiti girano nel tuo browser; questo viene addebitato sul tuo saldo KIT al prezzo indicato sopra.

Legge le parole da pronunciare dentro alla marcatura e le sintetizza in un audio dalla voce naturale, così un flusso che usa già l'SSML può puntare qui senza prima togliere i tag per tornare al testo semplice. Meglio essere chiari sul limite fin da subito: questo motore pronuncia le parole, non i controlli acustici fini che l'SSML può descrivere.

Che cos'è l'SSML e perché esiste

Speech Synthesis Markup Language è uno standard del W3C nato perché chi scrive descriva come il motore di voce deve dire qualcosa, non solo cosa dire: dove mettere una pausa, quale sillaba accentare, come pronunciare una sigla, se una sequenza di cifre è una data, un numero di telefono o una semplice quantità. Da anni è la convenzione del settore per controllare il parlato sintetizzato, proprio perché il testo semplice è davvero ambiguo — «2/3» può essere una data, una frazione o un punteggio, e solo la marcatura lo risolve in astratto. È questo il formato che l'endpoint accetta in ingresso; cosa ne fa di ogni tag è spiegato con chiarezza nella sezione seguente.

Come funzionano la richiesta e la risposta

Invii il testo con i tag SSML (o il testo semplice) nel corpo della richiesta. Il servizio estrae dalla marcatura le parole da pronunciare e le sintetizza; i tag stessi vengono ridotti al loro testo prima della sintesi. Il compito viene messo in coda in modo asincrono e restituisce subito un task_id; l'audio pronto arriva dopo tramite un webhook firmato o un link firmato valido per 24 ore. Poiché a essere sintetizzate sono le parole, inviare l'SSML o inviare il testo semplice equivalente produce la stessa narrazione naturale: la marcatura è accettata per compatibilità, non perché ogni tag cambi il suono.

Cosa rende questo motore e cosa non rende

Questo è il limite onesto, detto perché niente in questa pagina prometta troppo. Il motore di voce attuale legge il contenuto testuale e produce un parlato naturale e ben ritmato. Non applica in modo acustico i controlli fini dell'SSML: enfasi, pronuncia fonetica, prosodia e durate esatte delle pause vengono accettate in ingresso e poi tolte, non rese. Così un tag di pausa da due secondi non tiene ferma la linea per due secondi, e un tag di enfasi non accenta quella parola più di quanto farebbe il modello da solo. Se il tuo uso dipende dal fatto che questi controlli siano resi con precisione, quella capacità non è ancora disponibile su questo motore: l'endpoint esiste perché un flusso con SSML generi audio oggi senza un ramo separato di testo semplice.

Come inserirlo in contenuti automatizzati

L'SSML è solo testo strutturato, quindi è facile generarlo in modo programmatico — un flusso di contenuti può avvolgere i numeri nei tag, inserire pause tra le sezioni o marcare un nome con un suggerimento fonetico, tutto senza intervento umano. Il valore di questo endpoint per quel pubblico è che accetta così com'è l'SSML che già emettono: non devono costruire e mantenere una seconda via di codice che riduca la marcatura a testo semplice prima di inviarla. Il prezzo riflette la natura leggera e mirata del compito — una piccola base per richiesta più una tariffa ogni 1000 caratteri del testo inviato, e i compiti falliti non vengono mai addebitati dopo i tentativi automatici.

Accesso e gestione dei risultati

Questo endpoint richiede un saldo prepagato come tutti gli altri dell'API; una richiesta senza saldo restituisce HTTP 402 invece di un risultato parziale o degradato. Il testo inviato e l'audio generato vengono eliminati alla fine del periodo di conservazione e non vengono mai usati per addestrare modelli — la consegna avviene esclusivamente tramite il tuo webhook o un link firmato temporaneo, e nulla resta oltre quella finestra.

Sostituzione diretta per un flusso con SSML

Fai puntare a questo endpoint un flusso che già emette SSML e ricevi l'audio parlato senza scrivere un tuo passaggio per togliere prima i tag e tornare al testo semplice.

Narrazione da copioni generati

Trasforma i copioni generati per via algoritmica in audio parlato dalla voce naturale, come un passaggio automatizzato in più di un flusso di contenuti.

Testo lungo in audio

Converti articoli, appunti o documentazione in audio per chi preferisce ascoltare il contenuto invece di leggerlo.

Uscita vocale multilingue

Genera audio parlato nelle lingue supportate dallo stesso formato di richiesta, in base al campo lingua.

Che cos'è l'SSML e come lo usa questa api di sintesi vocale?

L'SSML è uno standard di marcatura per descrivere la sintesi vocale. Questo endpoint accetta testo con i tag SSML, ne legge le parole da pronunciare e le sintetizza in audio naturale. Accetta il formato per compatibilità; guarda la risposta successiva per sapere quali controlli SSML vengono davvero resi.

Rende i tag di enfasi, fonema e prosodia?

No, non sul motore di voce attuale. Quei tag, insieme alle durate esatte delle pause, vengono accettati in ingresso e poi ridotti al loro testo; l'audio pronuncia le parole con naturalezza invece di applicare l'enfasi, la pronuncia o le pause marcate. La resa acustica precisa di questi controlli non è ancora disponibile.

Questa api di sintesi vocale è gratuita?

Non c'è un piano gratuito: i piani gratuiti vengono abusati e rallentano tutti. L'accesso funziona con un saldo prepagato ForHosting KIT: ricarichi a partire da $10.00 (non scade) e ogni richiesta viene addebitata al prezzo pubblicato, così una chiamata senza saldo restituisce HTTP 402. Nessun abbonamento, nessun token né crediti inventati, e un compito fallito non viene addebitato.

Quanto costa?

Costa $0.002 a richiesta più $0.0025 ogni 1000 caratteri del testo inviato.

Mi serve l'SSML per una sintesi vocale di base?

No. Se ti serve solo un audio dalla voce naturale a partire da testo semplice, l'endpoint standard di sintesi vocale è più semplice e produce lo stesso tipo di narrazione. Sia il testo semplice sia l'SSML escono qui come parlato naturale.

Come ricevo l'audio generato?

Il compito è asincrono e restituisce subito un task_id; l'audio finito arriva tramite un webhook firmato o un link firmato valido per 24 ore.

Cosa succede se la mia marcatura SSML non è valida?

Poiché la marcatura viene ridotta al suo testo parlato prima della sintesi, i tag malformati non fanno fallire la richiesta: ricevi comunque l'audio delle parole leggibili. Niente viene rifiutato per un tag sbagliato, quindi non contare su questo endpoint per validare il tuo SSML.

Posso usarlo per controllare la pronuncia di nomi o sigle?

In modo acustico no: il controllo per fonema non viene reso su questo motore, quindi un tag di fonema non impone una pronuncia precisa. Se un nome va detto in un certo modo, scrivilo foneticamente nel testo stesso, così sono le parole a portare la pronuncia.

Tutto quello che vedi in questa pagina è disponibile anche via API. Questa sezione è per i team che vogliono integrarlo nei propri sistemi; chi non ne ha bisogno può semplicemente usare lo strumento qui sopra.

POSThttps://api.kit.forhosting.com/voice/tts-ssml

Autenticazione con Bearer token: un POST mette in coda l'attività e il risultato arriva via webhook o link firmato.

curl -X POST https://api.kit.forhosting.com/voice/tts-ssml \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"ssml":"<speak>Hola <break time=\"500ms\"/> mundo.</speak>"}'
{
  "ssml": "<speak>Hola <break time=\"500ms\"/> mundo.</speak>"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "voice.tts_ssml",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L'API è asincrona: ricevi subito un task_id e puoi fare polling fino a 1 richiesta al secondo.

per richiesta$0.002
per 1.000 caratteri$0.0025

Prezzo pubblicato, senza token né crediti. Se l'attività fallisce, non paghi.

max_mb200
max_minutes180
HTTPCodiceSignificato
401unauthorizedChiave API mancante o non valida: controlla l'header Authorization.
402insufficient_balanceCredito esaurito: ricarica per continuare a eseguire attività.
404unknown_typeTipo di attività sconosciuto: controlla il campo type della richiesta.
429rate_limitedTroppe richieste in poco tempo: rallenta e riprova tra qualche secondo.

Leggi la documentazione completa del KIT →