Whisper large-v3-turbo

OpenAI

Nur im Katalog Offene Gewichte

Souveränität und Hosting

Nur im Katalog

Dieses Modell ist als Referenz katalogisiert. Es wird noch nicht bei LLM EU gehostet, und kein Endpunkt aus erster Hand bedient es hier. Anfragen dazu gehen direkt an den Anbieter, zu dessen eigenen Bedingungen.

Zusammenfassung

Whisper large-v3-turbo ist eine destillierte Version von Whisper large-v3 mit 809M Parametern unter der MIT-Lizenz. Es behält das Empfangsfenster von 30 Sekunden und die mehrsprachige Abdeckung von large-v3, dekodiert aber schneller, was der Grund ist, es bei Latenzanforderungen zu bevorzugen. Die Modellkarte ist die gemeinsame Whisper-Karte und veröffentlicht keine eigene Benchmark-Tabelle für diese Variante.

Technische Daten

Anbieter
OpenAI (US)
Kontextfenster
Nicht verifiziert: Der Anbieter hat diese Angabe nicht belegt.
Modellparameter
0.81B
Modalitäten
audio
Lizenz
mit · licence
Offene Gewichte
yes
Veröffentlichungsdatum
01. Okt. 2024
Aufgaben
translation, multilingual-support, cheap

Sprachen

Stark: en, de, fr, es, it, pt, nl, pl

Ausreichend: sv, da, fi, cs, ro, el, uk, ru, tr, ar, zh, ja, ko, hi

Sprachen

Stark

  • en
  • de
  • fr
  • es
  • it
  • pt
  • nl
  • pl

Ausreichend

  • sv
  • da
  • fi
  • cs
  • ro
  • el
  • uk
  • ru
  • tr
  • ar
  • zh
  • ja
  • ko
  • hi

Nicht verifiziert: Der Anbieter hat diese Angabe nicht belegt. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.

Wann einsetzen

Stärken

  • roughly half the parameters of large-v3 at lower latency
  • MIT licence, more permissive than the Apache-2.0 parent
  • same multilingual transcription coverage as large-v3

Grenzen

  • a distillation of large-v3, so transcription accuracy is below the parent model
  • no benchmark table specific to this variant is published on the model card
  • fixed 30-second receptive field, so longer audio needs chunking logic