Phi-4-multimodal-instruct
Souveränität und Hosting
Dieses Modell ist als Referenz katalogisiert. Es wird noch nicht bei LLM EU gehostet, und kein Endpunkt aus erster Hand bedient es hier. Anfragen dazu gehen direkt an den Anbieter, zu dessen eigenen Bedingungen.
Zusammenfassung
Phi-4-multimodal-instruct ist ein 5,6B-Modell, das Text, Bilder und Sprache in einem Checkpoint verarbeitet, mit 128K Kontext und MIT-Lizenz. Die Modellkarte nennt 55,1 auf MMMU, 93,2 auf DocVQA und 62,4 auf MathVista und führt die unterstützten Sprachen getrennt je Eingabemodalität auf. Es ist eine kompakte Option für Dokument- und Sprachpipelines, die sonst zwei Modelle bräuchten.
Technische Daten
- Anbieter
- Microsoft (US)
- Kontextfenster
- 131k
- Modellparameter
- 5.57B
- Modalitäten
- text, vision, audio
- Lizenz
- mit · licence
- Offene Gewichte
- yes
- Veröffentlichungsdatum
- 24. Feb. 2025
- Aufgaben
- vision, summarization, multilingual-support, cheap
Sprachen
Stark: en, de, fr, es, it, pt
Ausreichend: nl, pl, sv, da, fi, cs, ru, uk, ar, zh, ja, ko, hi, tr
Sprachen
Stark
- en
- de
- fr
- es
- it
- pt
Ausreichend
- nl
- pl
- sv
- da
- fi
- cs
- ru
- uk
- ar
- zh
- ja
- ko
- hi
- tr
Nicht verifiziert: Der Anbieter hat diese Angabe nicht belegt. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.
Wann einsetzen
Stärken
- text, image and speech input at 5.6B parameters
- 128K-token context for document batches
- MIT licence
- 23 declared languages including most large EU languages
Grenzen
- modality-specific quality is below dedicated single-modality models
- English-centric training data
- no evaluation has been run by LLM EU