multilingual-e5-large

Microsoft

Ainult kataloogis Avatud kaalud

Suveräänsus ja majutamine

Ainult kataloogis

See mudel on loetletud viitamiseks. Seda ei majutata veel LLM EU-s ega teeninda seda siin ükski esimese osapoole lõpp-punkt. Päringud suunatakse otse pakkujale, pakkuja enda tingimustel.

Kokkuvõte

multilingual-e5-large is an XLM-RoBERTa-based text embedding model with 560M parameters, published under the MIT licence and covering around 100 languages. The model card uses a maximum sequence length of 512 tokens, which is the effective limit for both indexing and querying. It has no instruction prefix for queries, so documents and queries must be embedded the same way.

Tehnilised andmed

Pakkuja
Microsoft (US)
Konteksti aken
512
Parameetrid
0.56B
Modaalsused
embedding
Litsents
mit · licence
Avatud kaalud
yes
Avaldamiskuupäev
30. juuni 2023
Ülesanded
rag, multilingual-support, private, cheap

Keeled

Tugev: en, de, fr, es, it, pt, nl, pl

Piisav: sv, da, fi, cs, ro, el, uk, ru, ar, hi, zh, ja, ko, tr

Keeled

Tugev

  • en
  • de
  • fr
  • es
  • it
  • pt
  • nl
  • pl

Piisav

  • sv
  • da
  • fi
  • cs
  • ro
  • el
  • uk
  • ru
  • ar
  • hi
  • zh
  • ja
  • ko
  • tr

Verifitseerimata: pakkuja ei ole seda väidet dokumenteerinud. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.

Millal kasutada

Tugevused

  • MIT licence and roughly 100 languages declared
  • runs on CPU for small indexes
  • long-established baseline with community tooling

Piirangud

  • 512-token input limit
  • no instruction-aware query encoding
  • no retrieval benchmark has been run by LLM EU