DeepSeek-R1-Distill-Qwen-32B

DeepSeek

Csak katalógusban Nyílt súlyok

Szuverenitás és üzemeltetés

Csak katalógusban

Ez a modell referenciaként szerepel a katalógusban. Az LLM EU még nem üzemelteti, és itt egyetlen saját végpont sem szolgálja ki. A hozzá intézett kérések közvetlenül a szolgáltatóhoz mennek, annak saját feltételei szerint.

Összefoglaló

DeepSeek-R1-Distill-Qwen-32B is a 32B dense model distilled from DeepSeek-R1 into a Qwen2.5 base, published under the MIT licence. It keeps the reasoning behaviour of R1 at a size that fits on one 80GB accelerator, with a configuration maximum of 131,072 tokens. DeepSeek documents it as a distillation, so its ceiling is the teacher model’s reasoning, not a new training run.

Specifikációk

Szolgáltató
DeepSeek (CN)
Kontextusablak
131k
Paraméterek
32.76B
Modalitások
text
Licenc
mit · licence
Nyílt súlyok
yes
Megjelenés dátuma
2025. jan. 20.
Feladatok
reasoning, coding, cheap, summarization

Nyelvek

Erős: en, zh

Megfelelő: de, fr, es, it, pt, ru

Nyelvek

Erős

  • en
  • zh

Megfelelő

  • de
  • fr
  • es
  • it
  • pt
  • ru

Nincs ellenőrizve: a szolgáltató nem dokumentálta ezt az állítást. — a language is listed as strong only where a source claims it; the card links the evidence where one exists.

Mikor érdemes használni

Erősségek

  • fits a single 80GB accelerator
  • MIT licence
  • retains the R1 reasoning style that smaller base models usually lack

Korlátok

  • a distillation, so quality is bounded by the teacher
  • long reasoning traces increase output cost
  • no evaluation has been run by LLM EU