multilingual-e5-large

Microsoft

Kun katalog Åbne vægte

Suverænitet og hosting

Kun katalog

Denne model er katalogiseret til reference. Den er ikke hostet på LLM EU endnu, og ingen førsteparts-endpoint betjener den her. Anmodninger til den går direkte til udbyderen, under den pågældende udbyders egne vilkår.

Resumé

multilingual-e5-large is an XLM-RoBERTa-based text embedding model with 560M parameters, published under the MIT licence and covering around 100 languages. The model card uses a maximum sequence length of 512 tokens, which is the effective limit for both indexing and querying. It has no instruction prefix for queries, so documents and queries must be embedded the same way.

Specifikationer

Udbyder
Microsoft (US)
Kontekstvindue
512
Parametre
0.56B
Modaliteter
embedding
Licens
mit · licence
Åbne vægte
yes
Udgivelsesdato
30. jun. 2023
Opgaver
rag, multilingual-support, private, cheap

Sprog

Stærk: en, de, fr, es, it, pt, nl, pl

Tilstrækkelig: sv, da, fi, cs, ro, el, uk, ru, ar, hi, zh, ja, ko, tr

Sprog

Stærk

  • en
  • de
  • fr
  • es
  • it
  • pt
  • nl
  • pl

Tilstrækkelig

  • sv
  • da
  • fi
  • cs
  • ro
  • el
  • uk
  • ru
  • ar
  • hi
  • zh
  • ja
  • ko
  • tr

Ikke verificeret: udbyderen har ikke dokumenteret denne påstand. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.

Hvornår skal man bruge den

Styrker

  • MIT licence and roughly 100 languages declared
  • runs on CPU for small indexes
  • long-established baseline with community tooling

Begrænsninger

  • 512-token input limit
  • no instruction-aware query encoding
  • no retrieval benchmark has been run by LLM EU