Whisper large-v3
Souveränität und Hosting
Auf dieser Bereitstellung nicht bei LLM EU gehostet: Anfragen beantwortet das eingebaute Mock-Backend in der Region dev-mock. Es laufen keine Gewichte.
Zusammenfassung
Whisper large-v3 ist OpenAIs mehrsprachiges Modell für Spracherkennung und Sprachübersetzung mit 1,54B Parametern unter Apache-2.0. Es hat ein festes Empfangsfenster von 30 Sekunden und verarbeitet längere Audios mit einem gleitenden Fenster; es nutzt 128 Mel-Frequenzbänder statt der 80 früherer Versionen. Die Modellkarte weist darauf hin, dass es auf etwa zehn Sprachen evaluiert wurde und vor dem Einsatz im Zielbereich geprüft werden sollte.
Technische Daten
- Anbieter
- OpenAI (US)
- Kontextfenster
- Nicht verifiziert: Der Anbieter hat diese Angabe nicht belegt.
- Modellparameter
- 1.54B
- Modalitäten
- audio
- Lizenz
- apache-2.0 · licence
- Offene Gewichte
- yes
- Veröffentlichungsdatum
- 07. Nov. 2023
- Aufgaben
- translation, multilingual-support, summarization
Sprachen
Stark: en, de, fr, es, it, pt, nl, pl
Ausreichend: sv, da, fi, cs, ro, el, uk, ru, tr, ar, zh, ja, ko, hi
Sprachen
Stark
- en
- de
- fr
- es
- it
- pt
- nl
- pl
Ausreichend
- sv
- da
- fi
- cs
- ro
- el
- uk
- ru
- tr
- ar
- zh
- ja
- ko
- hi
Nicht verifiziert: Der Anbieter hat diese Angabe nicht belegt. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.
Wann einsetzen
Stärken
- one model for transcription and translation to English
- long-standing tooling support across every major inference stack
- Apache-2.0 licence
Grenzen
- fixed 30-second receptive field; longer audio needs chunking logic
- the card only claims strong recognition for about ten languages
- the card advises against using it for classification or speaker attributes