multilingual-e5-large
Souveränität und Hosting
Dieses Modell ist als Referenz katalogisiert. Es wird noch nicht bei LLM EU gehostet, und kein Endpunkt aus erster Hand bedient es hier. Anfragen dazu gehen direkt an den Anbieter, zu dessen eigenen Bedingungen.
Zusammenfassung
multilingual-e5-large ist ein Text-Embedding-Modell auf XLM-RoBERTa-Basis mit 560M Parametern, veröffentlicht unter der MIT-Lizenz und mit rund 100 Sprachen. Die Modellkarte verwendet eine maximale Sequenzlänge von 512 Token, die als effektive Grenze für Indexierung und Anfragen gilt. Es gibt kein Instruktionspräfix für Anfragen, Dokumente und Anfragen müssen also gleich eingebettet werden.
Technische Daten
- Anbieter
- Microsoft (US)
- Kontextfenster
- 512
- Modellparameter
- 0.56B
- Modalitäten
- embedding
- Lizenz
- mit · licence
- Offene Gewichte
- yes
- Veröffentlichungsdatum
- 30. Juni 2023
- Aufgaben
- rag, multilingual-support, private, cheap
Sprachen
Stark: en, de, fr, es, it, pt, nl, pl
Ausreichend: sv, da, fi, cs, ro, el, uk, ru, ar, hi, zh, ja, ko, tr
Sprachen
Stark
- en
- de
- fr
- es
- it
- pt
- nl
- pl
Ausreichend
- sv
- da
- fi
- cs
- ro
- el
- uk
- ru
- ar
- hi
- zh
- ja
- ko
- tr
Nicht verifiziert: Der Anbieter hat diese Angabe nicht belegt. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.
Wann einsetzen
Stärken
- MIT licence and roughly 100 languages declared
- runs on CPU for small indexes
- long-established baseline with community tooling
Grenzen
- 512-token input limit
- no instruction-aware query encoding
- no retrieval benchmark has been run by LLM EU