ForHosting KIT · Audio et voix

Qui parle, et quand ?

Une transcription répond à ce qui a été dit ; cet endpoint effectue un premier découpage de l’enregistrement en tours de parole.

● Betapar requête + par minute$0.002
Utilisez-le depuis WebAPIE-mailTelegramApp bientôt

Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.

Il repère les pauses entre les passages de parole et découpe l’audio en segments, qu’il étiquette en tours alternés (Intervenant 1, Intervenant 2) avec un début et une fin horodatés. Disons-le franchement : il segmente les tours d’après les silences, il n’identifie pas les voix et ne détermine pas le nombre réel d’intervenants distincts.

Ce que fait réellement cette tâche

Elle réalise une segmentation légère des tours de parole, pas une reconnaissance acoustique des locuteurs. L’enregistrement est transcrit et, partout où une pause est assez longue entre deux segments, l’étiquette bascule sur le tour suivant, en alternant entre deux marques. Vous obtenez ainsi une structure segmentée et horodatée — un échange lisible plutôt qu’un bloc indifférencié — réellement utile comme premier passage sur une conversation à deux. Ce n’est pas un modèle qui écoute les caractéristiques de la voix pour décider qui est qui : les étiquettes viennent du rythme des pauses, pas de la distinction d’une voix par rapport à une autre.

Ce que la tâche renvoie

Envoyez un fichier audio en POST vers /audio/diarize et la tâche renvoie une liste de tours : chaque tour porte une étiquette d’intervenant (Intervenant 1 ou Intervenant 2), le texte de ce passage et son horodatage de début et de fin. Elle indique aussi combien d’étiquettes distinctes elle a utilisées — au plus deux dans cette approche fondée sur les pauses ; ce compte est une propriété de la segmentation, pas une mesure du nombre réel de personnes présentes. Combinée à une transcription, vous obtenez une structure de type script, horodatée, facile à parcourir.

Où l’approche par pauses convient, et où elle ne convient pas

Elle convient à un échange à deux propre — un entretien, un appel en tête-à-tête — où les intervenants se relaient et où les pauses coïncident avec le changement de voix. Elle ne convient pas à une table ronde à plusieurs, à un fort chevauchement des voix, ni au cas où vous devez suivre chaque personne réelle de façon cohérente sur tout l’enregistrement : alterner deux étiquettes selon les silences produira alors des erreurs d’attribution. Si votre flux exige que le nombre réel d’intervenants soit déterminé ou que les voix soient reliées à des identités, il s’agit d’une tâche différente et plus lourde que celle de cet endpoint, et cette page ne prétendra pas le contraire.

Ce à quoi une segmentation des tours sert malgré tout

Même sans reconnaissance réelle des locuteurs, découper un enregistrement à deux en tours horodatés fait gagner un vrai temps : cela transforme un mur de transcription en un échange lisible que vous pouvez parcourir, citer par son horodatage ou transmettre à une étape de prise de notes. Une équipe support relisant un seul appel agent-client, un journaliste nettoyant un entretien en tête-à-tête, un producteur découpant un segment à deux voix en tours lisibles : tous tirent parti d’une structure de premier passage qu’ils corrigent à la main là où cela compte, plutôt que de partir d’un bloc indifférencié.

Tarif et facturation

Le coût est une petite redevance de base par requête plus un tarif à la minute lié à la durée de l’enregistrement, publié sur cette page : $0.002 par requête plus $0.0055 par minute. La tâche est traitée de façon asynchrone — envoyez l’audio, recevez un task_id immédiatement et récupérez le résultat segmenté en tours par webhook signé ou depuis un lien signé valable 24 heures ; une tâche en échec est relancée automatiquement jusqu’à trois fois et n’est jamais facturée si elle ne peut toujours pas aboutir.

Tours d’un entretien à deux

Un journaliste passe un entretien enregistré en tête-à-tête dans l’endpoint pour le découper en tours horodatés, transformant une transcription brute en un échange lisible à corriger à la main.

Relecture d’un appel agent-client

Une équipe support découpe un seul appel enregistré en tours alternés pour accélérer la relecture, sans attendre de l’outil qu’il identifie qui est qui à la voix.

Nettoyage d’un segment à deux animateurs

Un producteur découpe un enregistrement à deux animateurs en tours horodatés, en premier passage avant le montage des notes d’émission, en corrigeant à la main les erreurs d’étiquette.

Structure de premier passage avant les notes

Un pipeline segmente une conversation en tours et en horodatage avant une étape de résumé, offrant à l’étape suivante une entrée structurée au lieu d’un bloc plat.

Que fait réellement cet endpoint ?

Il segmente un enregistrement en tours en détectant les pauses entre les passages de parole, et les étiquette en tours alternés (Intervenant 1, Intervenant 2) avec un début et une fin horodatés. C’est une segmentation des tours fondée sur les pauses, pas une reconnaissance acoustique des locuteurs.

Détermine-t-il le nombre d’intervenants dans l’enregistrement ?

Non. Il alterne entre deux étiquettes selon les pauses, il ne détermine donc pas le nombre réel d’intervenants distincts. Le nombre d’étiquettes qu’il indique est une propriété de la segmentation, pas une mesure du nombre de personnes présentes.

Identifie-t-il quelle personne précise parle ?

Non. Les étiquettes viennent du rythme des pauses, pas de la distinction d’une voix par rapport à une autre ; il n’identifie donc pas les intervenants et ne relie pas les voix à des identités. Sur un échange à deux propre, les étiquettes alternées coïncident en général avec les deux intervenants ; avec plus de voix ou un fort chevauchement, non.

En quoi est-ce différent d’une transcription ?

La transcription produit les mots prononcés ; cette tâche ajoute par-dessus une structure de tours et un horodatage, en découpant le texte en segments alternés et horodatés pour qu’un enregistrement à deux se lise comme un échange et non comme un bloc.

Cet endpoint est-il gratuit ?

Il n’y a pas d’offre gratuite — les paliers gratuits sont détournés et ralentissent tout le monde. L’accès fonctionne avec un solde prépayé ForHosting KIT : rechargez à partir de $10.00 (il n’expire jamais) et chaque requête est facturée à son prix publié, donc un appel sans solde renvoie HTTP 402. Pas d’abonnement, pas de jetons, pas de crédits inventés, et une tâche en échec n’est jamais facturée.

Comment récupérer le résultat ?

La tâche renvoie un task_id immédiatement et se traite de façon asynchrone ; les résultats arrivent par webhook signé ou depuis un lien signé valable 24 heures.

Quand les tours seront-ils erronés ?

Sur des enregistrements à plus de deux intervenants, avec un fort chevauchement ou de longues pauses au sein de la parole d’une même personne, alterner deux étiquettes selon les silences produira des tours mal attribués. Traitez la sortie comme un premier passage à corriger, pas comme une attribution définitive.

Que se passe-t-il si la tâche échoue ?

La tâche est relancée automatiquement jusqu’à trois fois avant de renvoyer une erreur claire, et une requête en échec n’est jamais facturée.

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/audio/diarize

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/audio/diarize \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":"https://ejemplo.com/audio.mp3"}'
{
  "audio": "https://ejemplo.com/audio.mp3"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "audio.diarize",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.002
par minute$0.0055

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

max_mb200
max_minutes180
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.
422task_failedLa tâche a échoué : elle ne vous est pas facturée.

Consulter la documentation complète du KIT →