ForHosting KIT · Áudio e voz

Quem falou o quê?

Uma transcrição responde o que foi dito; este endpoint dá um primeiro passo ao quebrar uma gravação em turnos.

● Betapor minutoUS$ 0,002
Use pelo WebAPIE-mailTelegramApp em breve

Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.

Ele escuta as pausas entre trechos de fala e corta o áudio em segmentos, rotulando-os como turnos alternados (Falante 1, Falante 2) com tempo de início e fim. Leia o limite com honestidade: ele segmenta turnos por silêncio, não identifica as vozes nem deduz o número real de falantes distintos.

O que esta tarefa realmente faz

Ela executa uma segmentação leve de turnos, não um reconhecimento acústico de falantes. A gravação é transcrita e, onde há uma pausa longa o bastante entre segmentos, o rótulo muda para o próximo turno, alternando entre duas marcas. Isso lhe dá uma estrutura segmentada e com tempos — um vai e volta legível em vez de um bloco indiferenciado — que é genuinamente útil como primeiro passo numa conversa de duas pessoas. O que ela não é: um modelo que escuta as características da voz e decide quem é quem; os rótulos vêm do ritmo das pausas, não de distinguir uma voz da outra.

O que a tarefa devolve

Envie um arquivo de áudio por POST para /audio/diarize e a tarefa devolve uma lista de turnos: cada turno traz um rótulo de falante (Falante 1 ou Falante 2), o texto daquele trecho e seu tempo de início e fim. Ela também informa quantos rótulos distintos usou, que nesta abordagem por pausas são no máximo dois — essa contagem é uma propriedade da segmentação, não uma medição de quantas pessoas há de fato na sala. Combinada com uma transcrição, você tem uma estrutura tipo roteiro, com tempos, fácil de percorrer.

Onde a abordagem por pausas encaixa e onde não

Ela encaixa num intercâmbio limpo de duas pessoas — uma entrevista, uma ligação um a um — onde os falantes quase sempre se revezam e as pausas coincidem com a troca de voz. Não encaixa num painel com vários participantes, com muita sobreposição de vozes, nem num caso em que você precise acompanhar cada pessoa real de forma consistente na gravação inteira: alternar dois rótulos por silêncio vai rotular errado nesses casos. Se o seu fluxo precisa que o número real de falantes seja determinado ou que as vozes sejam ligadas a identidades, essa é uma tarefa diferente e mais pesada do que a que este endpoint faz, e esta página não vai fingir o contrário.

Para que uma segmentação de turnos ainda serve

Mesmo sem reconhecimento real de falantes, dividir uma gravação de duas pessoas em turnos com tempos poupa trabalho de verdade: transforma um muro de transcrição num intercâmbio legível que você pode percorrer, citar pelo tempo ou passar a um passo de anotações. Uma equipe de suporte revisando uma única ligação de agente e cliente, um jornalista limpando uma entrevista um a um e um produtor picando um segmento de dois apresentadores em turnos legíveis — todos tiram valor de uma estrutura de primeiro passo que dá para corrigir a mão onde importa, em vez de partir de um bloco indiferenciado.

Preço e como é cobrado

O custo é uma pequena taxa base por solicitação mais uma tarifa por minuto atrelada à duração da gravação, publicada nesta página: US$ 0,002 por chamada mais US$ 0,0055 por minuto. A tarefa processa de forma assíncrona — envie o áudio, receba um task_id na hora e recolha o resultado segmentado por turnos via webhook assinado ou por um link assinado válido por 24 horas; uma tarefa que falha é repetida automaticamente até três vezes e nunca é cobrada se ainda assim não conseguir concluir.

Turnos de uma entrevista de duas pessoas

Um jornalista processa uma entrevista gravada um a um pelo endpoint para quebrá-la em turnos com tempos, transformando uma transcrição em bruto num vai e volta legível para corrigir a mão.

Revisão de ligação de agente e cliente

Uma equipe de suporte divide uma única ligação gravada em turnos alternados para agilizar a revisão, sem esperar que a ferramenta identifique quem é quem pela voz.

Limpeza de um segmento de dois apresentadores

Um produtor pica uma gravação de dois apresentadores em turnos com tempos como primeiro passo antes de editar as notas do episódio, corrigindo a mão os rótulos errados.

Estrutura de primeiro passo antes das notas

Um fluxo segmenta uma conversa em turnos e tempos antes de um passo de resumo, dando à etapa seguinte uma entrada estruturada em vez de um bloco plano.

O que este endpoint realmente faz?

Ele segmenta uma gravação em turnos detectando as pausas entre trechos de fala, e os rotula como turnos alternados (Falante 1, Falante 2) com tempo de início e fim. É uma segmentação de turnos por pausas, não um reconhecimento acústico de falantes.

Ele determina quantos falantes há na gravação?

Não. Ele alterna entre dois rótulos com base nas pausas, então não deduz o número real de falantes distintos. A contagem de rótulos que ele informa é uma propriedade da segmentação, não uma medição de quantas pessoas estão presentes.

Ele identifica qual pessoa específica está falando?

Não. Os rótulos vêm do ritmo das pausas, não de distinguir uma voz da outra, então ele não identifica falantes nem liga vozes a identidades. Num intercâmbio limpo de duas pessoas, os rótulos alternados costumam coincidir com os dois falantes; com mais vozes ou muita sobreposição, não.

Em que isto difere da transcrição?

A transcrição produz as palavras que foram ditas; esta tarefa acrescenta por cima uma estrutura de turnos e tempos, dividindo o texto em segmentos alternados com marca de tempo para que uma gravação de duas pessoas se leia como um intercâmbio e não como um bloco.

Este endpoint é gratuito?

Não há camada gratuita — camadas grátis são abusadas e deixam tudo mais lento. O acesso funciona com um saldo pré-pago do ForHosting KIT: recarregue a partir de US$ 10,00 (ele nunca expira) e cada solicitação é cobrada pelo preço publicado, então uma chamada sem saldo devolve HTTP 402. Sem assinatura, sem tokens, sem créditos inventados, e uma tarefa que falha nunca é cobrada.

Como recebo o resultado de volta?

A tarefa devolve um task_id na hora e processa de forma assíncrona; os resultados chegam por webhook assinado ou por um link assinado válido por 24 horas.

Quando os turnos vão sair errados?

Em gravações com mais de dois falantes, com muita sobreposição ou com pausas longas dentro da fala de uma mesma pessoa, alternar dois rótulos por silêncio vai rotular os turnos errado. Trate a saída como um primeiro passo para corrigir, não como uma atribuição definitiva.

O que acontece se a tarefa falhar?

A tarefa é repetida automaticamente até três vezes antes de devolver um erro claro, e uma solicitação que falha nunca é cobrada.

Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.

POSThttps://api.kit.forhosting.com/audio/diarize

Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.

curl -X POST https://api.kit.forhosting.com/audio/diarize \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":"https://ejemplo.com/audio.mp3"}'
{
  "audio": "https://ejemplo.com/audio.mp3"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "audio.diarize",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.

por chamadaUS$ 0,002
por minutoUS$ 0,0055

Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.

max_mb200
max_minutes180
HTTPCódigoO que significa
401unauthorizedToken ausente ou inválido. Confira o header Authorization.
402insufficient_balanceSaldo insuficiente para esta tarefa. Faça uma recarga e tente de novo.
404unknown_typeEsse tipo de tarefa não existe. Confira o campo type no catálogo.
429rate_limitedMuitas requisições em pouco tempo. Espere um instante e tente de novo.
422task_failedA tarefa falhou do nosso lado. Você não paga nada por ela.

Ver a documentação completa do KIT →