multilingual-e5-large
Suverænitet og hosting
Denne model er katalogiseret til reference. Den er ikke hostet på LLM EU endnu, og ingen førsteparts-endpoint betjener den her. Anmodninger til den går direkte til udbyderen, under den pågældende udbyders egne vilkår.
Resumé
multilingual-e5-large is an XLM-RoBERTa-based text embedding model with 560M parameters, published under the MIT licence and covering around 100 languages. The model card uses a maximum sequence length of 512 tokens, which is the effective limit for both indexing and querying. It has no instruction prefix for queries, so documents and queries must be embedded the same way.
Specifikationer
- Udbyder
- Microsoft (US)
- Kontekstvindue
- 512
- Parametre
- 0.56B
- Modaliteter
- embedding
- Licens
- mit · licence
- Åbne vægte
- yes
- Udgivelsesdato
- 30. jun. 2023
- Opgaver
- rag, multilingual-support, private, cheap
Sprog
Stærk: en, de, fr, es, it, pt, nl, pl
Tilstrækkelig: sv, da, fi, cs, ro, el, uk, ru, ar, hi, zh, ja, ko, tr
Sprog
Stærk
- en
- de
- fr
- es
- it
- pt
- nl
- pl
Tilstrækkelig
- sv
- da
- fi
- cs
- ro
- el
- uk
- ru
- ar
- hi
- zh
- ja
- ko
- tr
Ikke verificeret: udbyderen har ikke dokumenteret denne påstand. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.
Hvornår skal man bruge den
Styrker
- MIT licence and roughly 100 languages declared
- runs on CPU for small indexes
- long-established baseline with community tooling
Begrænsninger
- 512-token input limit
- no instruction-aware query encoding
- no retrieval benchmark has been run by LLM EU