Različice modelov

2 min branja

0T

Skupno parametrov (V4 Pro)

0B

Aktivnih na token (V4 Pro MoE)

0M

Kontekstno okno (tokeni)

ParametriNajbolje za
R1-Distill-Qwen-1.5B1.5BMobilne naprave, robno računalništvo, hitri prototipi
R1-Distill-Qwen-7B7BUporabniške grafične kartice, lokalni razvoj, stroškovno občutljive postavitve
R1-Distill-Llama-8B8BUporabniške grafične kartice, združljivost z ekosistemom Llama
R1-Distill-Qwen-14B14BSrednjerazredne grafične kartice, uravnotežena kakovost in hitrost
R1-Distill-Qwen-32B32BVisokokakovostno lokalno sklepanje, profesionalne delovne postaje
R1-Distill-Llama-70B70BStrežniška postavitev, skoraj vrhunska kakovost ob nižjih stroških

Zgodovina modelov DeepSeek

DeepSeek LLM (V1)

Nov 2023

67B parametrov, prvi konkurenčni kitajski model LLM

DeepSeek V2

May 2024

Uvedel MoE + MLA; 236B skupno / 21B aktivnih

DeepSeek V2.5

Sep 2024

Združil klepet in programiranje v enoten model

DeepSeek V3

Jan 2025

671B/37B MoE; vrhunska zmogljivost za drobec stroškov

DeepSeek R1

Jan 2025

Model za razmišljanje; »trenutek DeepSeek«

R1-0528

May 2025

Posodobljeno razmišljanje z izboljšano natančnostjo

DeepSeek V3.1

Aug 2025

Hibridna arhitektura razmišljanja; en sam model podpira način razmišljanja in način brez razmišljanja

DeepSeek V3.2

Dec 2025

Izpopolnil V3 pri vseh nalogah

DeepSeek V4

Apr 2026

V4 Pro (1,6T/49B) in V4 Flash (284B/13B); kontekstno okno 1 milijon tokenov; odprtokodno izdano

Prednost arhitekture Mixture of Experts

Arhitektura MoE je razlog, da lahko DeepSeek ponuja vrhunsko kakovost ob občutno nižjih stroških. V4 Pro ima 1,6 bilijona parametrov, razporejenih v strokovne podmreže, a na vsak token se jih aktivira le okrog 49 milijard. V4 Flash uporablja 284 milijard skupno, aktivnih pa je le okrog 13 milijard. To pomeni znanjsko zmogljivost ogromnega modela ob računski ceni veliko manjšega.
Različice modelov | DeepSeek | NativeAI Hub