ForHosting KIT · Audio e voce

Chi ha detto cosa? Separa le voci di una riunione

Una trascrizione risponde a cosa è stato detto; questo endpoint fa un primo passaggio dividendo una registrazione in turni.

● Betaper richiesta + per minuto$0.002
Usalo da WebAPIEmailTelegramApp presto

Esegui questo sui nostri server con il tuo account. Gli strumenti gratuiti girano nel tuo browser; questo viene addebitato sul tuo saldo KIT al prezzo indicato sopra.

Ascolta le pause tra i tratti di parlato e taglia l'audio in segmenti, etichettandoli come turni alternati (Interlocutore 1, Interlocutore 2) con tempo di inizio e fine. Diciamolo con franchezza: segmenta i turni in base al silenzio, non riconosce le voci né ricava il numero reale di interlocutori distinti.

Cosa fa davvero questa attività

Esegue una segmentazione leggera dei turni, non un riconoscimento acustico degli interlocutori. La registrazione viene trascritta e, dove c'è una pausa abbastanza lunga tra un segmento e l'altro, l'etichetta passa al turno successivo, alternando due sole marche. Ottieni così una struttura segmentata e con i tempi — un botta e risposta leggibile invece di un blocco indistinto — davvero utile come primo passaggio su una conversazione a due. Quello che non è: un modello che ascolta le caratteristiche della voce e decide chi è chi; le etichette nascono dal ritmo delle pause, non dal distinguere una voce dall'altra.

Cosa restituisce l'attività

Invia un file audio in POST a /audio/diarize e l'attività restituisce un elenco di turni: ogni turno porta un'etichetta di interlocutore (Interlocutore 1 o Interlocutore 2), il testo di quel tratto e il suo tempo di inizio e fine. Indica anche quante etichette distinte ha usato, che in questo approccio basato sulle pause sono al massimo due: quel conteggio è una proprietà della segmentazione, non una misura di quante persone ci sono davvero nella stanza. Insieme a una trascrizione ottieni una struttura simile a un copione, con i tempi, facile da scorrere.

Dove l'approccio a pause funziona e dove no

Funziona su uno scambio pulito a due — un'intervista, una chiamata uno a uno — dove gli interlocutori si alternano quasi sempre e le pause coincidono con il cambio di voce. Non funziona su una tavola rotonda con più partecipanti, con molte sovrapposizioni, né quando devi seguire ogni persona reale in modo coerente per tutta la registrazione: alternare due etichette in base al silenzio in quei casi sbaglia l'attribuzione. Se il tuo flusso ha bisogno che venga determinato il numero reale di interlocutori o che le voci siano collegate a identità, quella è un'attività diversa e più pesante di ciò che fa questo endpoint, e questa pagina non fingerà il contrario.

A cosa serve comunque una segmentazione dei turni

Anche senza un vero riconoscimento degli interlocutori, dividere una registrazione a due in turni con i tempi fa risparmiare lavoro vero: trasforma un muro di trascrizione in uno scambio leggibile che puoi scorrere, citare in base al tempo o passare a un passaggio di appunti. Un team di assistenza che rivede una singola chiamata operatore-cliente, un giornalista che ripulisce un'intervista uno a uno, un produttore che spezza un segmento a due conduttori in turni leggibili: tutti traggono valore da una struttura di primo passaggio che possono correggere a mano dove conta, invece di partire da un blocco indistinto.

Prezzo e come si fattura

Il costo è una piccola tariffa base a richiesta più una tariffa al minuto legata alla durata della registrazione, pubblicata su questa pagina: $0.002 a richiesta più $0.0055 al minuto. L'attività viene elaborata in modo asincrono — invia l'audio, ricevi subito un task_id e raccogli il risultato segmentato per turni tramite webhook firmato o da un link firmato valido 24 ore; un'attività fallita viene ritentata automaticamente fino a tre volte e non viene mai addebitata se comunque non riesce a completarsi.

Turni di un'intervista a due

Un giornalista passa nell'endpoint un'intervista registrata uno a uno per dividerla in turni con i tempi, trasformando una trascrizione grezza in un botta e risposta leggibile da correggere a mano.

Revisione di una chiamata operatore-cliente

Un team di assistenza divide una singola chiamata registrata in turni alternati per rendere più rapida la revisione, senza aspettarsi che lo strumento riconosca chi è chi dalla voce.

Pulizia di un segmento a due conduttori

Un produttore spezza una registrazione a due conduttori in turni con i tempi come primo passaggio prima di montare le note dell'episodio, correggendo a mano le etichette sbagliate.

Struttura di primo passaggio prima degli appunti

Un flusso segmenta una conversazione in turni e tempi prima di un passaggio di riassunto, dando alla fase successiva un input strutturato invece di un blocco piatto.

Cosa fa esattamente questo endpoint?

Segmenta una registrazione in turni rilevando le pause tra i tratti di parlato, e li etichetta come turni alternati (Interlocutore 1, Interlocutore 2) con tempo di inizio e fine. È una segmentazione dei turni basata sulle pause, non un riconoscimento acustico degli interlocutori.

Determina quanti interlocutori ci sono nella registrazione?

No. Alterna due etichette in base alle pause, quindi non ricava il numero reale di interlocutori distinti. Il conteggio di etichette che riporta è una proprietà della segmentazione, non una misura di quante persone sono presenti.

Identifica quale persona specifica sta parlando?

No. Le etichette nascono dal ritmo delle pause, non dal distinguere una voce dall'altra, quindi non identifica gli interlocutori né collega le voci alle identità. Su uno scambio pulito a due le etichette alternate di solito coincidono con i due interlocutori; con più voci o molte sovrapposizioni, no.

In cosa si differenzia dalla trascrizione?

La trascrizione produce le parole dette; questa attività aggiunge sopra una struttura di turni e i tempi, dividendo il testo in segmenti alternati con marcatura temporale perché una registrazione a due si legga come uno scambio e non come un blocco.

Questo endpoint è gratuito?

Non c'è un piano gratuito — i piani gratis vengono abusati e rallentano tutti. L'accesso funziona con un saldo prepagato ForHosting KIT: ricarichi a partire da $10.00 (non scade mai) e ogni richiesta è addebitata al prezzo pubblicato, quindi una chiamata senza saldo restituisce HTTP 402. Nessun abbonamento, nessun token, nessun credito inventato, e un'attività fallita non viene mai addebitata.

Come ricevo il risultato?

L'attività restituisce subito un task_id ed elabora in modo asincrono; i risultati arrivano tramite webhook firmato o da un link firmato valido 24 ore.

Quando i turni saranno sbagliati?

Su registrazioni con più di due interlocutori, con molte sovrapposizioni o con pause lunghe all'interno del parlato di una stessa persona, alternare due etichette in base al silenzio sbaglierà l'attribuzione dei turni. Tratta l'output come un primo passaggio da correggere, non come un'attribuzione definitiva.

Cosa succede se l'attività fallisce?

L'attività viene ritentata automaticamente fino a tre volte prima di restituire un errore chiaro, e una richiesta fallita non viene mai addebitata.

Tutto quello che vedi in questa pagina è disponibile anche via API. Questa sezione è per i team che vogliono integrarlo nei propri sistemi; chi non ne ha bisogno può semplicemente usare lo strumento qui sopra.

POSThttps://api.kit.forhosting.com/audio/diarize

Autenticazione con Bearer token: un POST mette in coda l'attività e il risultato arriva via webhook o link firmato.

curl -X POST https://api.kit.forhosting.com/audio/diarize \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":"https://ejemplo.com/audio.mp3"}'
{
  "audio": "https://ejemplo.com/audio.mp3"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "audio.diarize",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L'API è asincrona: ricevi subito un task_id e puoi fare polling fino a 1 richiesta al secondo.

per richiesta$0.002
per minuto$0.0055

Prezzo pubblicato, senza token né crediti. Se l'attività fallisce, non paghi.

max_mb200
max_minutes180
HTTPCodiceSignificato
401unauthorizedChiave API mancante o non valida: controlla l'header Authorization.
402insufficient_balanceCredito esaurito: ricarica per continuare a eseguire attività.
404unknown_typeTipo di attività sconosciuto: controlla il campo type della richiesta.
429rate_limitedTroppe richieste in poco tempo: rallenta e riprova tra qualche secondo.
422task_failedL'attività non è andata a buon fine: non ti viene addebitato nulla.

Leggi la documentazione completa del KIT →