Přeskočit na obsah
Umělá inteligence

DeepSeek-V4.1-Flash: otevřený obr za pár centů, architektura, výkon, cena a vlastní hosting

DeepSeek-V4.1-Flash je nejzajímavější otevřený model září 2026. V agentním programování se podle čísel DeepSeek vyrovná Claude Opus 5, stojí zlomek ceny a jeho váhy si můžete stáhnout a provozovat sami pod licencí MIT. Na nejtěžší obecné agentní úlohy ale nestačí a hostované API běží v Číně.

Obálka článku DeepSeek-V4.1-Flash: 552 miliard parametrů, kontext 1 milion tokenů a cena 0,30 USD za milion vstupních tokenů ve špičce

DeepSeek vydal V4.1-Flash 10. září 2026 a váhy zveřejnil týž den, bez fáze náhledu. (Mungomash)

Pět věcí, které potřebujete vědět

  1. Obří, ale úsporný. 552 miliard parametrů v architektuře MoE, z nichž při zpracování vstupu pracuje jen 8 miliard a při generování 16 miliard.
  2. Nová architektura. Jako první model DeepSeek používá kauzální encoder-decoder; paměť KV cache je díky tomu zhruba čtvrtinová oproti V4-Flash.
  3. Milion tokenů kontextu a nativní zpracování textu i obrázků.
  4. Extrémně levné API. 0,30 USD za milion vstupních tokenů ve špičce, mimo špičku polovina; jediný zářijový model, který zlevnil vstup i výstup.
  5. Otevřené váhy pod MIT. Komerční použití bez omezení, vlastní hosting možný, ale na výkonném hardwaru.

Zdroje: Hugging Face: DeepSeek, Capital and Compute, MindStudio

01DeepSeek v roce 2026: odkud V4.1-Flash přichází

DeepSeek je soukromá firma z čínského Chang-čou, dceřiná společnost investičního fondu High-Flyer Capital Management. První model, DeepSeek-Coder, vydala 2. listopadu 2023 a V4.1-Flash je její 23. verzí. (Mungomash)

Poslední měsíce řady V4

DatumUdálost
14. 9. 2026Plánované přesměrování všech požadavků na V4-Pro na V4.1-Flash; rozhodnutí bylo zrušeno a V4-Pro zůstává v provozu
10. 9. 2026Vydání DeepSeek-V4.1-Flash s otevřenými váhami, konec starších modelů Flash v přímém API
13. 8. 2026Aktualizace DeepSeek V4-Pro-0813 a oznámení zdražení V4-Pro i V4-Flash (platné od 16. 8.)
Zdroje: DeepSeek: novinky 13. 8., DeepSeek: novinky 10. 9., DeepSeek: changelog, Capital and Compute

Proč DeepSeek řeší právě KV cache

Agenti pracují stále déle a s obřími vstupy, takže úlohy jsou čím dál víc „vstupně těžké“. Podle technické zprávy DeepSeek je dnes hlavní překážkou levnějšího provozu výpočetně drahé zpracování vstupu (prefill) a velké KV cache, které zatěžují paměť HBM, SSD disky i přenosovou kapacitu. V4.1-Flash je navržený přímo proti tomuto úzkému hrdlu. (Hugging Face Papers)

DeepSeek model popisuje jako nový výchozí bod pro další škálování architektury, předtrénování i dotrénování. (arXiv)

02Architektura do hloubky

V4.1-Flash kombinuje MoE s novým kauzálním encoder-decoderem a pěti triky na zmenšení KV cache. Výsledkem je 890 bajtů KV cache na token, zhruba čtvrtina oproti V4-Flash a 437× méně než původní DeepSeek V1. (Hugging Face: DeepSeek)

1. Mixture-of-Experts: 552 miliard, ale pracuje jen zlomek

Každá vrstva MoE má 1 sdíleného a 384 směrovaných expertů; na každý token se aktivuje 6 směrovaných expertů. Router tak pro každý token vybere jen malou, relevantní část sítě. (Hugging Face: DeepSeek) Pro plánování výkonu je proto důležitější počet aktivních parametrů než celkový. (MindStudio)

2. Kauzální encoder-decoder (CED)

Síť má 40 vrstev: 20vrstvý kauzální encoder a za ním 20vrstvý decoder. Globální KV cache decoderu se nepočítá z každé jeho vrstvy zvlášť, ale promítá se z výsledných stavů encoderu. Díky tomu model při zpracování vstupu aktivuje jen 8 miliard parametrů a při generování 16 miliard, což zlevňuje hlavně agentní úlohy s dlouhým vstupem. (Hugging Face: DeepSeek)

3. Compressed Sparse Attention 2 (CSA2)

Každá vrstva pozornosti má pevně jeden ze tří režimů: Full, Reindex nebo Reuse. Vrstvy tak sdílí hlavní KV i klíče indexeru a znovu používají indexy řídké pozornosti. V decoderu navíc hierarchický řídký indexer omezuje hlubší vrstvy na kandidáty vybrané první vrstvou v režimu Full, takže cena indexace neroste s délkou kontextu. První dvě vrstvy encoderu používají klouzavé okno pozornosti (SWA). (Hugging Face: DeepSeek, arXiv)

4. KV cache ve formátu FP4

Hlavní KV cache se ukládá ve 4bitovém formátu E2M1 s jedním škálovacím faktorem E4M3 na 16 kanálů. Spolu s CSA2 to dává zmíněných 890 bajtů na token. (Hugging Face: DeepSeek)

5. SWA Bounded Replay

Chybějící stavy klouzavého okna se nerekonstruují z disku, ale přehráním jen posledních tokenů. Trvalá KV cache (na SSD nebo v paměti hostitele) tak klesá zhruba na osminu oproti V4-Flash. (Hugging Face Papers)

Další součásti

  • Single-Pass mHC: upravené míchání reziduálního proudu s rychlým jádrem Mega-mHC.
  • Engram: podmíněná paměť se 196 miliardami parametrů, ke které model přistupuje řídce podle tokenů.
  • DSpark: spekulativní dekódování s poloautoregresivním návrhem a ověřováním podle míry jistoty.

Zdroj: Hugging Face: DeepSeek

Trénink

Model je předtrénovaný na multimodálním korpusu o 45 bilionech tokenů a prošel rozsáhlým dotrénováním pro textové i multimodální agentní scénáře. (Hugging Face Papers)

03Specifikace

ParametrHodnota
VývojářDeepSeek (Chang-čou, Čína)
Vydání10. 9. 2026 (váhy týž den)
TypMultimodální MoE Transformer, kauzální encoder-decoder
Celkové parametry552 mld. (páteř) + 196 mld. Engram
Aktivní parametry8 mld. (prefill), 16 mld. (dekódování)
Experti1 sdílený + 384 směrovaných, 6 aktivních na token
Vrstvy40 (20 encoder + 20 decoder)
Kontext1 milion tokenů
KV cache890 bajtů/token (FP4)
Vstup / výstupText a obrázky / text
Slovník129 280 tokenů
Předtrénink45 bilionů tokenů
ID v APIdeepseek-flash
Hugging Facedeepseek-ai/DeepSeek-V4.1-Flash
LicenceMIT
Zdroje: Hugging Face: DeepSeek, NVIDIA, Mungomash, NVFP4 konverze

04Benchmarky a nezávislá měření

V4.1-Flash exceluje v terminálových úlohách, dlouhém programování a hledání zranitelností, v obecném agentním testu Terminal-Bench 4.0 ale výrazně zaostává za špičkou.

Výsledky podle DeepSeek

BenchmarkOblastVýsledek
Codeforces (rating)Programování3471
DeepSWE v1.1Programování74,2 %
NL2Repo-BenchProgramování64,0 (changelog DeepSeek: 65,4)
ProgramBench (Almost@1)Programování20,3 %
Terminal-Bench 2.1Terminál90,6 %
Terminal-Bench 3.0Terminál30,0 %
Terminal-Bench 4.0Terminál31,2 %
GPQA DiamondMatematika a věda90,9 %
MathArena ApexMatematika a věda65,6 %
HLE s nástrojiMatematika a věda63,9 %
AutomationBenchAgenti54,8 %
Agent's Last ExamAgenti31,8 %
ZeroBench-main s nástroji (Pass@5)Multimodalita49,0 %
CyberGymKybernetika88,1 %
SEC-Bench ProKybernetika62,8 %
ExploitGymKybernetika15,3 %
Zdroj: NVIDIA model card. Měřeno s reasoning_effort=100, teplotou 1,0 a top_p 0,95; výsledky uvádí DeepSeek, NVIDIA je nezávisle neověřovala.

Kde vede a kde ztrácí

BenchmarkV4.1-FlashGPT-5.6 SolClaude Opus 5
DeepSWE v1.174,2 %73,0 %74,0 %
Terminal-Bench 3.030,0 %34,4 %43,3 %
Terminal-Bench 4.031,2 %39,9 %51,8 %
CyberGym88,1 %84,5 %neuvedeno
ExploitGym15,3 %33,7 %22,1 %
Zdroj: srovnávací tabulka DeepSeek v model card na Hugging Face, údaje výrobce. Claude Opus 5 od 22. 9. 2026 nahradil Claude Opus 5.5.

Na CyberGym (88,1 %) překonal všechny modely, které mají v tabulce DeepSeek výsledek; Claude Opus 5 tam číslo nemá. (Hugging Face: DeepSeek) Pro srovnání: specializovaný Gemini 3.8 Flash Cyber má na stejném testu 86,2 %.

Praktické testy

Nezávislí testeři narazili na nedostatky mimo benchmarky. V simulaci Rubikovy kostky se barvy při tazích měnily chybně a při napodobení obrázku ve stylu Malování vznikl stylizovaný, ale málo detailní výsledek. Mezi silnými čísly a kvalitou v kreativních a prostorových úlohách je tedy mezera. (MindStudio)

05Srovnání s modely září 2026

V4.1-Flash patří mezi nejlepší v dlouhém programování a cenou mu v tabulce konkuruje jen Xiaomi MiMo-V2.6-Pro, jediný další model s otevřenými váhami. V obecných agentních úlohách je ve spodní polovině.

ModelDeepSWE v1.1Terminal-Bench 4.0Cena vstup / výstup (USD za 1 mil.)Otevřené váhy
Meta Muse Spark 1.375,4 %neuvedeno1,25 / 4,25Ne
DeepSeek-V4.1-Flash74,2 %31,2 %0,30 / 1,20 (špička)Ano (MIT)
GPT-6 Astra74,1 %57,9 %10 / 50Ne
Gemini 3.8 Flash73,7 %19,1 %0,75 / 3,75 (do konce 2026)Ne
Xiaomi MiMo-V2.6-Pro71,9 %34,9 %0,435 / 0,87Ano (MIT)
Grok 4.771,0 %37,6 %2 / 6Ne
Claude Fable 5.167,4 %55,8 %10 / 50Ne
Zdroje: NVIDIA (DeepSeek), Capital and Compute (cena DeepSeek), Xiaomi (MiMo), ostatní modely podle našich průvodců níže. Čísla pochází od různých výrobců a z různých prostředí, srovnání je orientační.

Na Terminal-Bench 2.1 má V4.1-Flash 90,6 %, víc než Gemini 3.8 Flash (89,4 %), Xiaomi MiMo-V2.6-Pro (89,9 %) i Muse Spark 1.3 (88,8 %).

Podrobnosti o konkurentech najdete v průvodci GPT-6 Astra, průvodci Claude Fable 5.1, průvodci Gemini 3.8 Flash, průvodci Grok 4.7, rozboru Muse Spark 1.3 a článku o Xiaomi MiMo V2.6 Pro.

06Cena API: špička, mimo špičku a zlevnění

V4.1-Flash stojí ve špičce 0,30 USD za milion vstupních a 1,20 USD za milion výstupních tokenů; mimo špičku přesně polovinu. Byl to jediný zářijový model, který zlevnil vstup i výstup; Claude Fable 5.1 zlevnil jen čtení z cache. (Capital and Compute)

Za 1 mil. tokenůV4.1-Flash špičkaV4.1-Flash mimo špičkuV4-Flash (dřívější) špička
Vstup0,30 USD0,15 USD0,44 USD
Výstup1,20 USD0,60 USD1,32 USD
Čtení z cache0,006 USD0,003 USD0,014 USD
Zdroje: DeepSeek: ceník, Capital and Compute. Špička je v pracovní dny 1:00 až 4:00 a 6:00 až 10:00 UTC, mimo čínské svátky.

Oproti V4-Flash jde o 32% slevu na vstupu, 9% na výstupu a 57% na čtení z cache. (Capital and Compute) Pro představu: GPT-6 Astra a Claude Fable 5.1 stojí 10 USD za milion vstupních tokenů, tedy 33× víc než V4.1-Flash ve špičce.

Příběh s vyřazením V4-Pro

Při vydání DeepSeek oznámil, že od 14. září ve 4:00 UTC bude na každý požadavek na deepseek-v4-pro odpovídat V4.1-Flash. Rozhodnutí pak vzal zpět a V4-Pro dál běží za stávající ceny. (DeepSeek: changelog) Starší V4-Flash a V4-Flash-Vision-Exp ale v přímém API skončily a jejich názvy se přesměrovávají na V4.1-Flash; ID modelů a ceny u zprostředkovatelů je proto nutné kontrolovat zvlášť.

Tip na úsporu

Dávkové a neurgentní úlohy (noční analýzy, generování dat) spouštějte mimo špičku za poloviční cenu a držte stabilní prefix promptu kvůli cache za 0,006 USD.

07Otevřené váhy v praxi: vlastní hosting

V4.1-Flash si můžete stáhnout z Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) a provozovat komerčně pod licencí MIT. „Otevřený“ ale neznamená „zdarma“: potřebujete buď vlastní výpočetní kapacitu, nebo placené API. (MindStudio)

Co rozhoduje o hardwaru

  • Úložiště vah musí pokrýt celých 552 miliard parametrů, i když se na token používá jen zlomek. Experti musí ležet někde dost rychle dostupní: ve VRAM, v RAM s odlehčováním, nebo na NVMe.
  • Aktivní parametry (8 a 16 mld.) určují výpočet a propustnost na token; pro plánování rychlosti jsou důležitější než celkový počet.
  • Kvantizace je pro menší hardware nutnost. Oficiální minimální požadavky na VRAM DeepSeek nezveřejnil.

Zdroj: MindStudio

Komunitní varianty

VariantaVelikost / nasazeníPoznámka
NVFP4 (NVIDIA)Pro vLLM a SGLang, testováno na GB300Oficiální kvantizace NVIDIA, od 16. 9. 2026
NVFP4 (s-zaizen)48 souborů, 527,3 GB celkemNeoficiální konverze přes NVIDIA Model Optimizer
EXL3 2,0 bpw (diffbot)358 GB, 2× RTX PRO 6000 Blackwell (96 GB každá), vLLMKontext 512 tis. tokenů, spekulativní dekódování DSpark
GGUF (vcruz305)Q2_K 246 GiB, Q3_K_M 323 GiBZatím jen ve forku llama.cpp, oficiální llama.cpp ho ještě nespustí
Zdroje: NVFP4 (NVIDIA), NVFP4 (s-zaizen), EXL3, GGUF

Realistické cesty

  1. Pronajatá cloudová GPU s oficiálním inferenčním kódem DeepSeek: nejrychlejší start.
  2. Pracovní stanice se dvěma profesionálními GPU a silně kvantizovanou verzí: pro týmy, které chtějí data doma.
  3. Hostované API u třetí strany: bez vlastního hardwaru a mimo servery v Číně. Zkušební endpoint NVIDIA na build.nvidia.com je jen na testování: podmínky zakazují důvěrná a osobní data a použití se loguje.

Při vydání probíhala většina lokálních běhů na vícekartových serverech nebo v cloudu, ne na herních sestavách. (MindStudio)

08Rychlý start přes API

Přímé API DeepSeek používá ID deepseek-flash a kontext 1 milion tokenů. (Mungomash) API DeepSeek je kompatibilní s formátem OpenAI, takže stačí změnit základní URL a model:

python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.deepseek.com",  # ověřte v dokumentaci DeepSeek
    api_key=os.environ["DEEPSEEK_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "user", "content": "Projdi tento log a najdi příčinu chyby."}
    ],
)

print(response.choices[0].message.content)

Základní URL a parametry uvažování ověřte v dokumentaci DeepSeek API před nasazením. U vlastního hostingu použijte endpoint svého serveru (vLLM i podobné nástroje nabízí rozhraní kompatibilní s OpenAI) a model deepseek-ai/DeepSeek-V4.1-Flash.

09Data, jurisdikce a bezpečnost

U DeepSeek je rozhodnutí o datech jednodušší než u uzavřených modelů: pokud nechcete posílat data do Číny, model si můžete hostovat sami.

Tři způsoby provozu z pohledu dat

ZpůsobKam putují dataVhodné pro
Přímé API DeepSeekNa infrastrukturu firmy se sídlem v ČíněVeřejná a necitlivá data, prototypy
API třetí strany (cloudový poskytovatel)K danému poskytovateliFirmy, které chtějí jiného správce dat bez vlastního hardwaru; ověřte podmínky poskytovatele
Vlastní hostingNikam mimo vaši infrastrukturuCitlivá a regulovaná data

DeepSeek sídlí v čínském Chang-čou. (Mungomash) Konkrétní podmínky zpracování dat v přímém API si ověřte v zásadách DeepSeek a u citlivých dat konzultujte právníka; tabulka výše popisuje jen to, kde data fyzicky končí.

Bezpečnost modelu

  • Silný v hledání zranitelností: 88,1 % na CyberGym, víc než GPT-5.6 Sol (84,5 %) i specializovaný Gemini 3.8 Flash Cyber (86,2 %).
  • Slabší v tvorbě exploitů: 15,3 % na ExploitGym proti 33,7 % u GPT-5.6 Sol a 22,1 % u Claude Opus 5.
  • Otevřené váhy znamenají žádné pojistky poskytovatele. Na rozdíl od Claude Fable nebo GPT-6 Astra u vlastního hostingu neexistuje centrální filtr, který by rizikové požadavky přesměroval. Odpovědnost za pravidla použití nese provozovatel.

Zdroje výsledků: Hugging Face: DeepSeek, NVIDIA, průvodce Gemini 3.8 Flash (Cyber)

10Rozhodovací průvodce

V4.1-Flash je výchozí volba, když rozhoduje cena nebo kontrola nad daty; na nejtěžší obecné agenty sáhněte jinam.

Potřebujete…VolbaProč
Levné agentní programování ve velkémV4.1-FlashDeepSWE 74,2 % za 0,30 / 1,20 USD
Vlastní hosting a data domaV4.1-FlashOtevřené váhy pod MIT
Dlouhé dokumenty a agenty s obřím vstupemV4.1-Flash1 mil. tokenů, malá KV cache, levný prefill
Hledání zranitelností v kóduV4.1-FlashCyberGym 88,1 %
Stabilitu starší integraceV4-ProZůstává v provozu za původní ceny
Obecného agenta a ovládání počítačeGPT-6 Astra nebo Claude Fable 5.1Terminal-Bench 4.0 kolem 56 až 58 % vs 31 %
Kreativní a prostorové úlohyUzavřené vlajkové modelyV praktických testech V4.1-Flash zaostával
Zvuk nebo video na vstupuJiný modelV4.1-Flash zpracuje jen text a obrázky
Doporučení vychází z čísel v tomto článku; před produkčním nasazením model otestujte na vlastních úlohách.

11Často kladené otázky o DeepSeek-V4.1-Flash

Co je DeepSeek-V4.1-Flash?

Otevřený multimodální model MoE od čínského DeepSeek s 552 miliardami parametrů a kontextem 1 milion tokenů, vydaný 10. září 2026 pod licencí MIT.

Kolik parametrů model skutečně používá?

Při zpracování vstupu 8 miliard, při generování 16 miliard z celkových 552 miliard.

Kolik stojí API?

Ve špičce 0,30 USD za milion vstupních a 1,20 USD za milion výstupních tokenů, mimo špičku polovinu. Čtení z cache stojí 0,006 USD.

Můžu V4.1-Flash používat komerčně?

Ano, licence MIT komerční použití povoluje.

Rozjedu ho na jedné herní grafice?

Ne bez velkých kompromisů. I kvantizovaná verze potřebuje stovky GB pro váhy; realistické jsou vícekartové servery nebo cloud, komunitní verze EXL3 běží například na dvou kartách RTX PRO 6000 s 96 GB.

Je lepší než Claude nebo GPT?

V dlouhém programování se jim vyrovná za zlomek ceny. V obecných agentních úlohách (Terminal-Bench 4.0) výrazně zaostává.

12Verdikt

DeepSeek-V4.1-Flash dává špičkové programovací výsledky za haléře a k tomu otevřené váhy pod licencí MIT. Pro levné agentní programování, dlouhé vstupy a firmy, které chtějí data držet doma, je to jeden z nejsilnějších kandidátů. Nejbližším otevřeným soupeřem je Xiaomi MiMo V2.6 Pro, který má vyšší souhrnné hodnocení Artificial Analysis (46 proti 39 bodům), na DeepSWE ale zaostává (71,9 % proti 74,2 %).

Na obecné agenty, ovládání počítače a kreativní úlohy ale nestačí a přímé API vede do Číny. Chcete AI nasadit ve firmě a vybrat správný model? Pomůžeme v rámci AI implementace.

13Zdroje

Tým LISTIFYWeby, aplikace a marketing z Prahy od roku 2008

Další články

Všechny články →
Umělá inteligence26. 9. 2026 · 12 min čtení

GPT-6 Astra (ChatGPT 6): technický průvodce, benchmarky, API, cena a přístup

Umělá inteligence26. 9. 2026 · 13 min čtení

Claude Fable 5.1: technický průvodce, benchmarky, API, cena a srovnání

Umělá inteligence26. 9. 2026 · 10 min čtení

Grok 4.7: technický průvodce, benchmarky, API, cena a srovnání

Sdílet stránku

E-mailem

Máte nápad? Za 15 minut víte, jak na něj.

Krátký hovor, žádná prezentace. Řekneme vám, co dává smysl, kolik to bude stát a jak rychle to zvládneme.

+420 771 166 199Po až Pá 8:30 až 16:00 · info@listify.cool

Kdy vám máme zavolat?

Vyberte den a časové rozmezí. Zavoláme my, hovor trvá zhruba 15 minut.

Den