ForHosting KIT · Audio & Sprache

Wer spricht wann?

Ein Transkript beantwortet, was gesagt wurde; dieser Endpoint nimmt einen ersten Durchgang vor und zerlegt eine Aufnahme in Turns.

● Betapro Anfrage + pro Minute$0.002
Nutzen Sie es über WebAPIE-MailTelegramApp bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

Er achtet auf die Pausen zwischen Sprechabschnitten und schneidet das Audio in Segmente, die er als abwechselnde Turns (Sprecher 1, Sprecher 2) mit Anfangs- und Endzeit beschriftet. Sagen wir es ehrlich: Er segmentiert Turns anhand von Stille, er erkennt keine Stimmen und ermittelt nicht die tatsächliche Anzahl unterschiedlicher Sprecher.

Was diese Aufgabe tatsächlich tut

Sie führt eine schlanke Turn-Segmentierung durch, keine akustische Sprechererkennung. Die Aufnahme wird transkribiert, und überall dort, wo zwischen zwei Segmenten eine ausreichend lange Pause liegt, wechselt die Kennzeichnung zum nächsten Turn und wechselt dabei zwischen zwei Markierungen. So erhalten Sie eine segmentierte, mit Zeitstempeln versehene Struktur — ein lesbares Hin und Her statt eines undifferenzierten Blocks —, die als erster Durchgang bei einem Gespräch zu zweit wirklich nützlich ist. Was sie nicht ist: ein Modell, das die Stimmmerkmale abhört und entscheidet, wer wer ist; die Kennzeichnungen stammen aus dem Rhythmus der Pausen, nicht daraus, eine Stimme von einer anderen zu unterscheiden.

Was die Aufgabe zurückgibt

Senden Sie eine Audiodatei per POST an /audio/diarize, und die Aufgabe gibt eine Liste von Turns zurück: Jeder Turn trägt eine Sprecherkennzeichnung (Sprecher 1 oder Sprecher 2), den Text dieses Abschnitts sowie seine Anfangs- und Endzeit. Sie meldet außerdem, wie viele unterschiedliche Kennzeichnungen sie verwendet hat — bei diesem pausenbasierten Ansatz höchstens zwei; dieser Zähler ist eine Eigenschaft der Segmentierung, keine Messung dafür, wie viele Personen wirklich im Raum sind. Zusammen mit einem Transkript erhalten Sie eine skriptartige, mit Zeitstempeln versehene Struktur, die sich leicht überfliegen lässt.

Wo der pausenbasierte Ansatz passt und wo nicht

Er passt zu einem sauberen Gespräch zu zweit — einem Interview, einem Einzeltelefonat —, bei dem sich die Sprecher meist abwechseln und die Pausen mit dem Stimmwechsel zusammenfallen. Er passt nicht zu einer Runde mit mehreren Teilnehmern, zu starkem Durcheinanderreden oder zu einem Fall, in dem Sie jede reale Person über die ganze Aufnahme hinweg konsistent verfolgen müssen: Zwei Kennzeichnungen anhand von Stille abzuwechseln, führt dort zu Fehlzuordnungen. Wenn Ihr Ablauf verlangt, dass die tatsächliche Anzahl der Sprecher bestimmt oder Stimmen mit Identitäten verknüpft werden, ist das eine andere, aufwendigere Aufgabe als die dieses Endpoints, und diese Seite wird nicht so tun, als wäre es anders.

Wofür eine Turn-Segmentierung trotzdem nützlich ist

Auch ohne echte Sprechererkennung spart es echte Arbeit, eine Aufnahme zu zweit in mit Zeitstempeln versehene Turns aufzuteilen: Aus einer Wand von Transkript wird ein lesbarer Austausch, den Sie überfliegen, nach Zeit zitieren oder an einen Notizschritt weitergeben können. Ein Support-Team, das ein einzelnes Agent-Kunde-Gespräch durchsieht, ein Journalist, der ein Einzelinterview aufräumt, ein Produzent, der ein Segment mit zwei Moderatoren in lesbare Turns zerlegt — sie alle profitieren von einer Struktur aus dem ersten Durchgang, die sie dort von Hand korrigieren, wo es darauf ankommt, statt bei einem undifferenzierten Block zu beginnen.

Preis und Abrechnung

Die Kosten bestehen aus einer kleinen Grundgebühr pro Anfrage plus einem Minutentarif, der an die Länge der Aufnahme gekoppelt und auf dieser Seite veröffentlicht ist: $0.002 pro Anfrage plus $0.0055 pro Minute. Die Aufgabe wird asynchron verarbeitet — senden Sie das Audio, erhalten Sie sofort eine task_id und holen Sie das nach Turns segmentierte Ergebnis per signiertem Webhook oder über einen 24 Stunden gültigen signierten Link ab; eine fehlgeschlagene Aufgabe wird automatisch bis zu dreimal wiederholt und nie berechnet, wenn sie sich dennoch nicht abschließen lässt.

Turns eines Interviews zu zweit

Ein Journalist gibt ein aufgezeichnetes Einzelinterview durch den Endpoint, um es in Turns mit Zeitstempeln zu zerlegen, und verwandelt ein rohes Transkript in ein lesbares Hin und Her zum Korrigieren von Hand.

Durchsicht eines Agent-Kunde-Gesprächs

Ein Support-Team teilt ein einzelnes aufgezeichnetes Gespräch in abwechselnde Turns auf, um die Durchsicht zu beschleunigen, ohne zu erwarten, dass das Werkzeug anhand der Stimme erkennt, wer wer ist.

Aufräumen eines Segments mit zwei Moderatoren

Ein Produzent zerlegt eine Aufnahme mit zwei Moderatoren als ersten Durchgang in Turns mit Zeitstempeln, bevor er die Shownotes bearbeitet, und korrigiert Fehlkennzeichnungen von Hand.

Struktur aus dem ersten Durchgang vor den Notizen

Eine Pipeline segmentiert ein Gespräch vor einem Zusammenfassungsschritt in Turns und Zeiten und gibt der späteren Stufe eine strukturierte Eingabe statt eines flachen Blocks.

Was tut dieser Endpoint tatsächlich?

Er segmentiert eine Aufnahme in Turns, indem er die Pausen zwischen Sprechabschnitten erkennt, und beschriftet sie als abwechselnde Turns (Sprecher 1, Sprecher 2) mit Anfangs- und Endzeit. Es ist eine pausenbasierte Turn-Segmentierung, keine akustische Sprechererkennung.

Bestimmt er, wie viele Sprecher in der Aufnahme sind?

Nein. Er wechselt anhand der Pausen zwischen zwei Kennzeichnungen und ermittelt daher nicht die tatsächliche Anzahl unterschiedlicher Sprecher. Der gemeldete Zähler der Kennzeichnungen ist eine Eigenschaft der Segmentierung, keine Messung, wie viele Personen anwesend sind.

Erkennt er, welche konkrete Person spricht?

Nein. Die Kennzeichnungen stammen aus dem Rhythmus der Pausen, nicht daraus, eine Stimme von einer anderen zu unterscheiden; er erkennt daher keine Sprecher und verknüpft Stimmen nicht mit Identitäten. Bei einem sauberen Gespräch zu zweit fallen die abwechselnden Kennzeichnungen meist mit den beiden Sprechern zusammen; bei mehr Stimmen oder starkem Durcheinanderreden nicht.

Wie unterscheidet sich das von einer Transkription?

Die Transkription liefert die gesprochenen Wörter; diese Aufgabe legt darüber eine Turn-Struktur und Zeitangaben und teilt den Text in abwechselnde, mit Zeitstempeln versehene Segmente auf, damit sich eine Aufnahme zu zweit als Austausch liest und nicht als Block.

Ist dieser Endpoint kostenlos?

Es gibt keine kostenlose Stufe — kostenlose Stufen werden missbraucht und bremsen alle aus. Der Zugang läuft über ein vorausbezahltes ForHosting-KIT-Guthaben: Laden Sie ab $10.00 auf (es verfällt nie), und jede Anfrage wird zum veröffentlichten Preis berechnet, sodass ein Aufruf ohne Guthaben HTTP 402 zurückgibt. Kein Abo, keine Token, keine erfundenen Credits, und eine fehlgeschlagene Aufgabe wird nie berechnet.

Wie erhalte ich das Ergebnis zurück?

Die Aufgabe gibt sofort eine task_id zurück und verarbeitet asynchron; die Ergebnisse kommen per signiertem Webhook oder über einen 24 Stunden gültigen signierten Link.

Wann werden die Turns falsch sein?

Bei Aufnahmen mit mehr als zwei Sprechern, starker Überlappung oder langen Pausen innerhalb der Rede einer Person führt das Abwechseln zweier Kennzeichnungen anhand von Stille zu falsch zugeordneten Turns. Behandeln Sie die Ausgabe als ersten Durchgang zum Korrigieren, nicht als endgültige Zuordnung.

Was passiert, wenn die Aufgabe fehlschlägt?

Die Aufgabe wird automatisch bis zu dreimal wiederholt, bevor sie einen klaren Fehler zurückgibt, und eine fehlgeschlagene Anfrage wird nie berechnet.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/audio/diarize

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/audio/diarize \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":"https://ejemplo.com/audio.mp3"}'
{
  "audio": "https://ejemplo.com/audio.mp3"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "audio.diarize",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.002
pro Minute$0.0055

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_mb200
max_minutes180
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.
422task_failedDie Aufgabe ist fehlgeschlagen und wird nicht berechnet.

Vollständige KIT-Dokumentation lesen →