DeepSeek-V4.1-Flash: otevřený obr za pár centů, architektura, výkon, cena a vlastní hosting
DeepSeek-V4.1-Flash je nejzajímavější otevřený model září 2026. V agentním programování se podle čísel DeepSeek vyrovná Claude Opus 5, stojí zlomek ceny a jeho váhy si můžete stáhnout a provozovat sami pod licencí MIT. Na nejtěžší obecné agentní úlohy ale nestačí a hostované API běží v Číně.

DeepSeek vydal V4.1-Flash 10. září 2026 a váhy zveřejnil týž den, bez fáze náhledu. (Mungomash)
Pět věcí, které potřebujete vědět
- Obří, ale úsporný. 552 miliard parametrů v architektuře MoE, z nichž při zpracování vstupu pracuje jen 8 miliard a při generování 16 miliard.
- Nová architektura. Jako první model DeepSeek používá kauzální encoder-decoder; paměť KV cache je díky tomu zhruba čtvrtinová oproti V4-Flash.
- Milion tokenů kontextu a nativní zpracování textu i obrázků.
- Extrémně levné API. 0,30 USD za milion vstupních tokenů ve špičce, mimo špičku polovina; jediný zářijový model, který zlevnil vstup i výstup.
- Otevřené váhy pod MIT. Komerční použití bez omezení, vlastní hosting možný, ale na výkonném hardwaru.
Zdroje: Hugging Face: DeepSeek, Capital and Compute, MindStudio
01DeepSeek v roce 2026: odkud V4.1-Flash přichází
DeepSeek je soukromá firma z čínského Chang-čou, dceřiná společnost investičního fondu High-Flyer Capital Management. První model, DeepSeek-Coder, vydala 2. listopadu 2023 a V4.1-Flash je její 23. verzí. (Mungomash)
Poslední měsíce řady V4
| Datum | Událost |
|---|---|
| 14. 9. 2026 | Plánované přesměrování všech požadavků na V4-Pro na V4.1-Flash; rozhodnutí bylo zrušeno a V4-Pro zůstává v provozu |
| 10. 9. 2026 | Vydání DeepSeek-V4.1-Flash s otevřenými váhami, konec starších modelů Flash v přímém API |
| 13. 8. 2026 | Aktualizace DeepSeek V4-Pro-0813 a oznámení zdražení V4-Pro i V4-Flash (platné od 16. 8.) |
Proč DeepSeek řeší právě KV cache
Agenti pracují stále déle a s obřími vstupy, takže úlohy jsou čím dál víc „vstupně těžké“. Podle technické zprávy DeepSeek je dnes hlavní překážkou levnějšího provozu výpočetně drahé zpracování vstupu (prefill) a velké KV cache, které zatěžují paměť HBM, SSD disky i přenosovou kapacitu. V4.1-Flash je navržený přímo proti tomuto úzkému hrdlu. (Hugging Face Papers)
DeepSeek model popisuje jako nový výchozí bod pro další škálování architektury, předtrénování i dotrénování. (arXiv)
02Architektura do hloubky
V4.1-Flash kombinuje MoE s novým kauzálním encoder-decoderem a pěti triky na zmenšení KV cache. Výsledkem je 890 bajtů KV cache na token, zhruba čtvrtina oproti V4-Flash a 437× méně než původní DeepSeek V1. (Hugging Face: DeepSeek)
1. Mixture-of-Experts: 552 miliard, ale pracuje jen zlomek
Každá vrstva MoE má 1 sdíleného a 384 směrovaných expertů; na každý token se aktivuje 6 směrovaných expertů. Router tak pro každý token vybere jen malou, relevantní část sítě. (Hugging Face: DeepSeek) Pro plánování výkonu je proto důležitější počet aktivních parametrů než celkový. (MindStudio)
2. Kauzální encoder-decoder (CED)
Síť má 40 vrstev: 20vrstvý kauzální encoder a za ním 20vrstvý decoder. Globální KV cache decoderu se nepočítá z každé jeho vrstvy zvlášť, ale promítá se z výsledných stavů encoderu. Díky tomu model při zpracování vstupu aktivuje jen 8 miliard parametrů a při generování 16 miliard, což zlevňuje hlavně agentní úlohy s dlouhým vstupem. (Hugging Face: DeepSeek)
3. Compressed Sparse Attention 2 (CSA2)
Každá vrstva pozornosti má pevně jeden ze tří režimů: Full, Reindex nebo Reuse. Vrstvy tak sdílí hlavní KV i klíče indexeru a znovu používají indexy řídké pozornosti. V decoderu navíc hierarchický řídký indexer omezuje hlubší vrstvy na kandidáty vybrané první vrstvou v režimu Full, takže cena indexace neroste s délkou kontextu. První dvě vrstvy encoderu používají klouzavé okno pozornosti (SWA). (Hugging Face: DeepSeek, arXiv)
4. KV cache ve formátu FP4
Hlavní KV cache se ukládá ve 4bitovém formátu E2M1 s jedním škálovacím faktorem E4M3 na 16 kanálů. Spolu s CSA2 to dává zmíněných 890 bajtů na token. (Hugging Face: DeepSeek)
5. SWA Bounded Replay
Chybějící stavy klouzavého okna se nerekonstruují z disku, ale přehráním jen posledních tokenů. Trvalá KV cache (na SSD nebo v paměti hostitele) tak klesá zhruba na osminu oproti V4-Flash. (Hugging Face Papers)
Další součásti
- Single-Pass mHC: upravené míchání reziduálního proudu s rychlým jádrem Mega-mHC.
- Engram: podmíněná paměť se 196 miliardami parametrů, ke které model přistupuje řídce podle tokenů.
- DSpark: spekulativní dekódování s poloautoregresivním návrhem a ověřováním podle míry jistoty.
Zdroj: Hugging Face: DeepSeek
Trénink
Model je předtrénovaný na multimodálním korpusu o 45 bilionech tokenů a prošel rozsáhlým dotrénováním pro textové i multimodální agentní scénáře. (Hugging Face Papers)
03Specifikace
| Parametr | Hodnota |
|---|---|
| Vývojář | DeepSeek (Chang-čou, Čína) |
| Vydání | 10. 9. 2026 (váhy týž den) |
| Typ | Multimodální MoE Transformer, kauzální encoder-decoder |
| Celkové parametry | 552 mld. (páteř) + 196 mld. Engram |
| Aktivní parametry | 8 mld. (prefill), 16 mld. (dekódování) |
| Experti | 1 sdílený + 384 směrovaných, 6 aktivních na token |
| Vrstvy | 40 (20 encoder + 20 decoder) |
| Kontext | 1 milion tokenů |
| KV cache | 890 bajtů/token (FP4) |
| Vstup / výstup | Text a obrázky / text |
| Slovník | 129 280 tokenů |
| Předtrénink | 45 bilionů tokenů |
| ID v API | deepseek-flash |
| Hugging Face | deepseek-ai/DeepSeek-V4.1-Flash |
| Licence | MIT |
04Benchmarky a nezávislá měření
V4.1-Flash exceluje v terminálových úlohách, dlouhém programování a hledání zranitelností, v obecném agentním testu Terminal-Bench 4.0 ale výrazně zaostává za špičkou.
Výsledky podle DeepSeek
| Benchmark | Oblast | Výsledek |
|---|---|---|
| Codeforces (rating) | Programování | 3471 |
| DeepSWE v1.1 | Programování | 74,2 % |
| NL2Repo-Bench | Programování | 64,0 (changelog DeepSeek: 65,4) |
| ProgramBench (Almost@1) | Programování | 20,3 % |
| Terminal-Bench 2.1 | Terminál | 90,6 % |
| Terminal-Bench 3.0 | Terminál | 30,0 % |
| Terminal-Bench 4.0 | Terminál | 31,2 % |
| GPQA Diamond | Matematika a věda | 90,9 % |
| MathArena Apex | Matematika a věda | 65,6 % |
| HLE s nástroji | Matematika a věda | 63,9 % |
| AutomationBench | Agenti | 54,8 % |
| Agent's Last Exam | Agenti | 31,8 % |
| ZeroBench-main s nástroji (Pass@5) | Multimodalita | 49,0 % |
| CyberGym | Kybernetika | 88,1 % |
| SEC-Bench Pro | Kybernetika | 62,8 % |
| ExploitGym | Kybernetika | 15,3 % |
reasoning_effort=100, teplotou 1,0 a top_p 0,95; výsledky uvádí DeepSeek, NVIDIA je nezávisle neověřovala.Kde vede a kde ztrácí
| Benchmark | V4.1-Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| DeepSWE v1.1 | 74,2 % | 73,0 % | 74,0 % |
| Terminal-Bench 3.0 | 30,0 % | 34,4 % | 43,3 % |
| Terminal-Bench 4.0 | 31,2 % | 39,9 % | 51,8 % |
| CyberGym | 88,1 % | 84,5 % | neuvedeno |
| ExploitGym | 15,3 % | 33,7 % | 22,1 % |
Na CyberGym (88,1 %) překonal všechny modely, které mají v tabulce DeepSeek výsledek; Claude Opus 5 tam číslo nemá. (Hugging Face: DeepSeek) Pro srovnání: specializovaný Gemini 3.8 Flash Cyber má na stejném testu 86,2 %.
Praktické testy
Nezávislí testeři narazili na nedostatky mimo benchmarky. V simulaci Rubikovy kostky se barvy při tazích měnily chybně a při napodobení obrázku ve stylu Malování vznikl stylizovaný, ale málo detailní výsledek. Mezi silnými čísly a kvalitou v kreativních a prostorových úlohách je tedy mezera. (MindStudio)
05Srovnání s modely září 2026
V4.1-Flash patří mezi nejlepší v dlouhém programování a cenou mu v tabulce konkuruje jen Xiaomi MiMo-V2.6-Pro, jediný další model s otevřenými váhami. V obecných agentních úlohách je ve spodní polovině.
| Model | DeepSWE v1.1 | Terminal-Bench 4.0 | Cena vstup / výstup (USD za 1 mil.) | Otevřené váhy |
|---|---|---|---|---|
| Meta Muse Spark 1.3 | 75,4 % | neuvedeno | 1,25 / 4,25 | Ne |
| DeepSeek-V4.1-Flash | 74,2 % | 31,2 % | 0,30 / 1,20 (špička) | Ano (MIT) |
| GPT-6 Astra | 74,1 % | 57,9 % | 10 / 50 | Ne |
| Gemini 3.8 Flash | 73,7 % | 19,1 % | 0,75 / 3,75 (do konce 2026) | Ne |
| Xiaomi MiMo-V2.6-Pro | 71,9 % | 34,9 % | 0,435 / 0,87 | Ano (MIT) |
| Grok 4.7 | 71,0 % | 37,6 % | 2 / 6 | Ne |
| Claude Fable 5.1 | 67,4 % | 55,8 % | 10 / 50 | Ne |
Na Terminal-Bench 2.1 má V4.1-Flash 90,6 %, víc než Gemini 3.8 Flash (89,4 %), Xiaomi MiMo-V2.6-Pro (89,9 %) i Muse Spark 1.3 (88,8 %).
Podrobnosti o konkurentech najdete v průvodci GPT-6 Astra, průvodci Claude Fable 5.1, průvodci Gemini 3.8 Flash, průvodci Grok 4.7, rozboru Muse Spark 1.3 a článku o Xiaomi MiMo V2.6 Pro.
06Cena API: špička, mimo špičku a zlevnění
V4.1-Flash stojí ve špičce 0,30 USD za milion vstupních a 1,20 USD za milion výstupních tokenů; mimo špičku přesně polovinu. Byl to jediný zářijový model, který zlevnil vstup i výstup; Claude Fable 5.1 zlevnil jen čtení z cache. (Capital and Compute)
| Za 1 mil. tokenů | V4.1-Flash špička | V4.1-Flash mimo špičku | V4-Flash (dřívější) špička |
|---|---|---|---|
| Vstup | 0,30 USD | 0,15 USD | 0,44 USD |
| Výstup | 1,20 USD | 0,60 USD | 1,32 USD |
| Čtení z cache | 0,006 USD | 0,003 USD | 0,014 USD |
Oproti V4-Flash jde o 32% slevu na vstupu, 9% na výstupu a 57% na čtení z cache. (Capital and Compute) Pro představu: GPT-6 Astra a Claude Fable 5.1 stojí 10 USD za milion vstupních tokenů, tedy 33× víc než V4.1-Flash ve špičce.
Příběh s vyřazením V4-Pro
Při vydání DeepSeek oznámil, že od 14. září ve 4:00 UTC bude na každý požadavek na deepseek-v4-pro odpovídat V4.1-Flash. Rozhodnutí pak vzal zpět a V4-Pro dál běží za stávající ceny. (DeepSeek: changelog) Starší V4-Flash a V4-Flash-Vision-Exp ale v přímém API skončily a jejich názvy se přesměrovávají na V4.1-Flash; ID modelů a ceny u zprostředkovatelů je proto nutné kontrolovat zvlášť.
Tip na úsporu
Dávkové a neurgentní úlohy (noční analýzy, generování dat) spouštějte mimo špičku za poloviční cenu a držte stabilní prefix promptu kvůli cache za 0,006 USD.
07Otevřené váhy v praxi: vlastní hosting
V4.1-Flash si můžete stáhnout z Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) a provozovat komerčně pod licencí MIT. „Otevřený“ ale neznamená „zdarma“: potřebujete buď vlastní výpočetní kapacitu, nebo placené API. (MindStudio)
Co rozhoduje o hardwaru
- Úložiště vah musí pokrýt celých 552 miliard parametrů, i když se na token používá jen zlomek. Experti musí ležet někde dost rychle dostupní: ve VRAM, v RAM s odlehčováním, nebo na NVMe.
- Aktivní parametry (8 a 16 mld.) určují výpočet a propustnost na token; pro plánování rychlosti jsou důležitější než celkový počet.
- Kvantizace je pro menší hardware nutnost. Oficiální minimální požadavky na VRAM DeepSeek nezveřejnil.
Zdroj: MindStudio
Komunitní varianty
| Varianta | Velikost / nasazení | Poznámka |
|---|---|---|
| NVFP4 (NVIDIA) | Pro vLLM a SGLang, testováno na GB300 | Oficiální kvantizace NVIDIA, od 16. 9. 2026 |
| NVFP4 (s-zaizen) | 48 souborů, 527,3 GB celkem | Neoficiální konverze přes NVIDIA Model Optimizer |
| EXL3 2,0 bpw (diffbot) | 358 GB, 2× RTX PRO 6000 Blackwell (96 GB každá), vLLM | Kontext 512 tis. tokenů, spekulativní dekódování DSpark |
| GGUF (vcruz305) | Q2_K 246 GiB, Q3_K_M 323 GiB | Zatím jen ve forku llama.cpp, oficiální llama.cpp ho ještě nespustí |
Realistické cesty
- Pronajatá cloudová GPU s oficiálním inferenčním kódem DeepSeek: nejrychlejší start.
- Pracovní stanice se dvěma profesionálními GPU a silně kvantizovanou verzí: pro týmy, které chtějí data doma.
- Hostované API u třetí strany: bez vlastního hardwaru a mimo servery v Číně. Zkušební endpoint NVIDIA na build.nvidia.com je jen na testování: podmínky zakazují důvěrná a osobní data a použití se loguje.
Při vydání probíhala většina lokálních běhů na vícekartových serverech nebo v cloudu, ne na herních sestavách. (MindStudio)
08Rychlý start přes API
Přímé API DeepSeek používá ID deepseek-flash a kontext 1 milion tokenů. (Mungomash) API DeepSeek je kompatibilní s formátem OpenAI, takže stačí změnit základní URL a model:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.deepseek.com", # ověřte v dokumentaci DeepSeek
api_key=os.environ["DEEPSEEK_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "user", "content": "Projdi tento log a najdi příčinu chyby."}
],
)
print(response.choices[0].message.content)Základní URL a parametry uvažování ověřte v dokumentaci DeepSeek API před nasazením. U vlastního hostingu použijte endpoint svého serveru (vLLM i podobné nástroje nabízí rozhraní kompatibilní s OpenAI) a model deepseek-ai/DeepSeek-V4.1-Flash.
09Data, jurisdikce a bezpečnost
U DeepSeek je rozhodnutí o datech jednodušší než u uzavřených modelů: pokud nechcete posílat data do Číny, model si můžete hostovat sami.
Tři způsoby provozu z pohledu dat
| Způsob | Kam putují data | Vhodné pro |
|---|---|---|
| Přímé API DeepSeek | Na infrastrukturu firmy se sídlem v Číně | Veřejná a necitlivá data, prototypy |
| API třetí strany (cloudový poskytovatel) | K danému poskytovateli | Firmy, které chtějí jiného správce dat bez vlastního hardwaru; ověřte podmínky poskytovatele |
| Vlastní hosting | Nikam mimo vaši infrastrukturu | Citlivá a regulovaná data |
DeepSeek sídlí v čínském Chang-čou. (Mungomash) Konkrétní podmínky zpracování dat v přímém API si ověřte v zásadách DeepSeek a u citlivých dat konzultujte právníka; tabulka výše popisuje jen to, kde data fyzicky končí.
Bezpečnost modelu
- Silný v hledání zranitelností: 88,1 % na CyberGym, víc než GPT-5.6 Sol (84,5 %) i specializovaný Gemini 3.8 Flash Cyber (86,2 %).
- Slabší v tvorbě exploitů: 15,3 % na ExploitGym proti 33,7 % u GPT-5.6 Sol a 22,1 % u Claude Opus 5.
- Otevřené váhy znamenají žádné pojistky poskytovatele. Na rozdíl od Claude Fable nebo GPT-6 Astra u vlastního hostingu neexistuje centrální filtr, který by rizikové požadavky přesměroval. Odpovědnost za pravidla použití nese provozovatel.
Zdroje výsledků: Hugging Face: DeepSeek, NVIDIA, průvodce Gemini 3.8 Flash (Cyber)
10Rozhodovací průvodce
V4.1-Flash je výchozí volba, když rozhoduje cena nebo kontrola nad daty; na nejtěžší obecné agenty sáhněte jinam.
| Potřebujete… | Volba | Proč |
|---|---|---|
| Levné agentní programování ve velkém | V4.1-Flash | DeepSWE 74,2 % za 0,30 / 1,20 USD |
| Vlastní hosting a data doma | V4.1-Flash | Otevřené váhy pod MIT |
| Dlouhé dokumenty a agenty s obřím vstupem | V4.1-Flash | 1 mil. tokenů, malá KV cache, levný prefill |
| Hledání zranitelností v kódu | V4.1-Flash | CyberGym 88,1 % |
| Stabilitu starší integrace | V4-Pro | Zůstává v provozu za původní ceny |
| Obecného agenta a ovládání počítače | GPT-6 Astra nebo Claude Fable 5.1 | Terminal-Bench 4.0 kolem 56 až 58 % vs 31 % |
| Kreativní a prostorové úlohy | Uzavřené vlajkové modely | V praktických testech V4.1-Flash zaostával |
| Zvuk nebo video na vstupu | Jiný model | V4.1-Flash zpracuje jen text a obrázky |
11Často kladené otázky o DeepSeek-V4.1-Flash
Co je DeepSeek-V4.1-Flash?
Otevřený multimodální model MoE od čínského DeepSeek s 552 miliardami parametrů a kontextem 1 milion tokenů, vydaný 10. září 2026 pod licencí MIT.
Kolik parametrů model skutečně používá?
Při zpracování vstupu 8 miliard, při generování 16 miliard z celkových 552 miliard.
Kolik stojí API?
Ve špičce 0,30 USD za milion vstupních a 1,20 USD za milion výstupních tokenů, mimo špičku polovinu. Čtení z cache stojí 0,006 USD.
Můžu V4.1-Flash používat komerčně?
Ano, licence MIT komerční použití povoluje.
Rozjedu ho na jedné herní grafice?
Ne bez velkých kompromisů. I kvantizovaná verze potřebuje stovky GB pro váhy; realistické jsou vícekartové servery nebo cloud, komunitní verze EXL3 běží například na dvou kartách RTX PRO 6000 s 96 GB.
Je lepší než Claude nebo GPT?
V dlouhém programování se jim vyrovná za zlomek ceny. V obecných agentních úlohách (Terminal-Bench 4.0) výrazně zaostává.
12Verdikt
DeepSeek-V4.1-Flash dává špičkové programovací výsledky za haléře a k tomu otevřené váhy pod licencí MIT. Pro levné agentní programování, dlouhé vstupy a firmy, které chtějí data držet doma, je to jeden z nejsilnějších kandidátů. Nejbližším otevřeným soupeřem je Xiaomi MiMo V2.6 Pro, který má vyšší souhrnné hodnocení Artificial Analysis (46 proti 39 bodům), na DeepSWE ale zaostává (71,9 % proti 74,2 %).
Na obecné agenty, ovládání počítače a kreativní úlohy ale nestačí a přímé API vede do Číny. Chcete AI nasadit ve firmě a vybrat správný model? Pomůžeme v rámci AI implementace.
13Zdroje
- Hugging Face: DeepSeek-V4.1-Flash (oficiální model card)
- arXiv: DeepSeek-V4.1-Flash, technická zpráva
- Hugging Face Papers: abstrakt zprávy
- NVIDIA: model card DeepSeek-V4.1-Flash
- DeepSeek API: aktualizace
- DeepSeek API: ceník
- DeepSeek: oznámení V4.1-Flash
- MindStudio: jak provozovat V4.1-Flash lokálně
- Capital and Compute: modely a ceny září 2026
- Mungomash: přehled frontier modelů
- Local AI Zone: aktualizace modelů září 2026
- TeamDay: nejlepší AI modely 2026
- Hugging Face: NVFP4 od NVIDIA
- Hugging Face: NVFP4 konverze (s-zaizen)
- Hugging Face: GGUF (vcruz305)
- Hugging Face: EXL3 pro 2× RTX PRO 6000