Phi-4-multimodal-instruct

Microsoft

Nur im Katalog Offene Gewichte

Souveränität und Hosting

Nur im Katalog

Dieses Modell ist als Referenz katalogisiert. Es wird noch nicht bei LLM EU gehostet, und kein Endpunkt aus erster Hand bedient es hier. Anfragen dazu gehen direkt an den Anbieter, zu dessen eigenen Bedingungen.

Zusammenfassung

Phi-4-multimodal-instruct ist ein 5,6B-Modell, das Text, Bilder und Sprache in einem Checkpoint verarbeitet, mit 128K Kontext und MIT-Lizenz. Die Modellkarte nennt 55,1 auf MMMU, 93,2 auf DocVQA und 62,4 auf MathVista und führt die unterstützten Sprachen getrennt je Eingabemodalität auf. Es ist eine kompakte Option für Dokument- und Sprachpipelines, die sonst zwei Modelle bräuchten.

Technische Daten

Anbieter
Microsoft (US)
Kontextfenster
131k
Modellparameter
5.57B
Modalitäten
text, vision, audio
Lizenz
mit · licence
Offene Gewichte
yes
Veröffentlichungsdatum
24. Feb. 2025
Aufgaben
vision, summarization, multilingual-support, cheap

Sprachen

Stark: en, de, fr, es, it, pt

Ausreichend: nl, pl, sv, da, fi, cs, ru, uk, ar, zh, ja, ko, hi, tr

Sprachen

Stark

  • en
  • de
  • fr
  • es
  • it
  • pt

Ausreichend

  • nl
  • pl
  • sv
  • da
  • fi
  • cs
  • ru
  • uk
  • ar
  • zh
  • ja
  • ko
  • hi
  • tr

Nicht verifiziert: Der Anbieter hat diese Angabe nicht belegt. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.

Wann einsetzen

Stärken

  • text, image and speech input at 5.6B parameters
  • 128K-token context for document batches
  • MIT licence
  • 23 declared languages including most large EU languages

Grenzen

  • modality-specific quality is below dedicated single-modality models
  • English-centric training data
  • no evaluation has been run by LLM EU