Whisper large-v3

OpenAI

Nicht gehostet — Mock-Backend Offene Gewichte

Souveränität und Hosting

Nicht gehostet — Mock-Backend

Auf dieser Bereitstellung nicht bei LLM EU gehostet: Anfragen beantwortet das eingebaute Mock-Backend in der Region dev-mock. Es laufen keine Gewichte.

Zusammenfassung

Whisper large-v3 ist OpenAIs mehrsprachiges Modell für Spracherkennung und Sprachübersetzung mit 1,54B Parametern unter Apache-2.0. Es hat ein festes Empfangsfenster von 30 Sekunden und verarbeitet längere Audios mit einem gleitenden Fenster; es nutzt 128 Mel-Frequenzbänder statt der 80 früherer Versionen. Die Modellkarte weist darauf hin, dass es auf etwa zehn Sprachen evaluiert wurde und vor dem Einsatz im Zielbereich geprüft werden sollte.

Technische Daten

Anbieter
OpenAI (US)
Kontextfenster
Nicht verifiziert: Der Anbieter hat diese Angabe nicht belegt.
Modellparameter
1.54B
Modalitäten
audio
Lizenz
apache-2.0 · licence
Offene Gewichte
yes
Veröffentlichungsdatum
07. Nov. 2023
Aufgaben
translation, multilingual-support, summarization

Sprachen

Stark: en, de, fr, es, it, pt, nl, pl

Ausreichend: sv, da, fi, cs, ro, el, uk, ru, tr, ar, zh, ja, ko, hi

Sprachen

Stark

  • en
  • de
  • fr
  • es
  • it
  • pt
  • nl
  • pl

Ausreichend

  • sv
  • da
  • fi
  • cs
  • ro
  • el
  • uk
  • ru
  • tr
  • ar
  • zh
  • ja
  • ko
  • hi

Nicht verifiziert: Der Anbieter hat diese Angabe nicht belegt. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.

Wann einsetzen

Stärken

  • one model for transcription and translation to English
  • long-standing tooling support across every major inference stack
  • Apache-2.0 licence

Grenzen

  • fixed 30-second receptive field; longer audio needs chunking logic
  • the card only claims strong recognition for about ten languages
  • the card advises against using it for classification or speaker attributes