DeepSeek-V4.1-Flash: otvorený obor za pár centov, architektúra, výkon, cena a vlastný hosting
DeepSeek-V4.1-Flash je najzaujímavejší otvorený model septembra 2026. V agentnom programovaní sa podľa čísel DeepSeeku vyrovná Claude Opus 5, stojí zlomok ceny a jeho váhy si môžete stiahnuť a prevádzkovať sami pod licenciou MIT. Na najťažšie všeobecné agentné úlohy však nestačí a hostované API beží v Číne.

DeepSeek vydal V4.1-Flash 10. septembra 2026 a váhy zverejnil v ten istý deň, bez fázy ukážky. (Mungomash)
Päť vecí, ktoré potrebujete vedieť
- Obrovský, ale úsporný. 552 miliárd parametrov v architektúre MoE, z ktorých pri spracovaní vstupu pracuje len 8 miliárd a pri generovaní 16 miliárd.
- Nová architektúra. Ako prvý model DeepSeeku používa kauzálny enkodér-dekodér; pamäť KV cache je vďaka tomu približne štvrtinová oproti V4-Flash.
- Milión tokenov kontextu a natívne spracovanie textu aj obrázkov.
- Mimoriadne lacné API. 0,30 USD za milión vstupných tokenov v špičke, mimo špičky polovica; jediný septembrový model, ktorý zlacnil vstup aj výstup.
- Otvorené váhy pod MIT. Komerčné použitie bez obmedzení, vlastný hosting je možný, ale na výkonnom hardvéri.
Zdroje: Hugging Face: DeepSeek, Capital and Compute, MindStudio
01DeepSeek v roku 2026: odkiaľ V4.1-Flash prichádza
DeepSeek je súkromná firma z čínskeho mesta Chang-čou a dcérska spoločnosť investičného fondu High-Flyer Capital Management. Svoj prvý model, DeepSeek-Coder, vydala 2. novembra 2023 a V4.1-Flash je jej 23. verziou. (Mungomash)
Posledné mesiace radu V4
| Dátum | Udalosť |
|---|---|
| 14. 9. 2026 | Plánované presmerovanie všetkých požiadaviek na V4-Pro na V4.1-Flash; rozhodnutie bolo zrušené a V4-Pro zostáva v prevádzke |
| 10. 9. 2026 | Vydanie DeepSeek-V4.1-Flash s otvorenými váhami, koniec starších modelov Flash v priamom API |
| 13. 8. 2026 | Aktualizácia DeepSeek V4-Pro-0813 a oznámenie zdraženia V4-Pro aj V4-Flash (platné od 16. 8.) |
Prečo DeepSeek rieši práve KV cache
Agenti pracujú čoraz dlhšie a s obrovskými vstupmi, takže úlohy sú stále viac „náročné na vstup“. Podľa technickej správy DeepSeeku je dnes hlavnou prekážkou lacnejšej prevádzky výpočtovo drahé spracovanie vstupu (prefill) a veľké KV cache, ktoré zaťažujú pamäť HBM, SSD disky aj prenosovú kapacitu. V4.1-Flash je navrhnutý presne proti tomuto úzkemu hrdlu. (Hugging Face Papers)
DeepSeek model opisuje ako nový východiskový bod pre ďalšie škálovanie architektúry, predtréningu aj dotrénovania. (arXiv)
02Architektúra do hĺbky
V4.1-Flash spája MoE s novým kauzálnym enkodérom-dekodérom a piatimi trikmi na zmenšenie KV cache. Výsledkom je 890 bajtov KV cache na token, približne štvrtina oproti V4-Flash a 437-krát menej ako pri pôvodnom DeepSeek V1. (Hugging Face: DeepSeek)
1. Mixture-of-Experts: 552 miliárd, no pracuje len zlomok
Každá vrstva MoE má 1 zdieľaného a 384 smerovaných expertov; na každý token sa aktivuje 6 smerovaných expertov. Router tak pre každý token vyberie len malú, relevantnú časť siete. (Hugging Face: DeepSeek) Pri plánovaní výkonu je preto dôležitejší počet aktívnych parametrov ako celkový počet. (MindStudio)
2. Kauzálny enkodér-dekodér (CED)
Sieť má 40 vrstiev: 20-vrstvový kauzálny enkodér a za ním 20-vrstvový dekodér. Globálna KV cache dekodéra sa nepočíta v každej jeho vrstve zvlášť, ale premieta sa z výsledných stavov enkodéra. Vďaka tomu model pri spracovaní vstupu aktivuje len 8 miliárd parametrov a pri generovaní 16 miliárd, čo zlacňuje najmä agentné úlohy s dlhým vstupom. (Hugging Face: DeepSeek)
3. Compressed Sparse Attention 2 (CSA2)
Každá vrstva pozornosti má pevne priradený jeden z troch režimov: Full, Reindex alebo Reuse. Vrstvy tak zdieľajú hlavnú KV aj kľúče indexera a opakovane využívajú indexy riedkej pozornosti. V dekodéri navyše hierarchický riedky indexer obmedzuje hlbšie vrstvy na kandidátov, ktorých vybrala prvá vrstva v režime Full, takže cena indexovania nerastie s dĺžkou kontextu. Prvé dve vrstvy enkodéra používajú pozornosť s posuvným oknom (SWA). (Hugging Face: DeepSeek, arXiv)
4. KV cache vo formáte FP4
Hlavná KV cache sa ukladá vo 4-bitovom formáte E2M1 s jedným škálovacím faktorom E4M3 na 16 kanálov. Spolu s CSA2 to dáva spomínaných 890 bajtov na token. (Hugging Face: DeepSeek)
5. SWA Bounded Replay
Chýbajúce stavy posuvného okna sa neobnovujú z disku, ale prehratím len posledných tokenov. Trvalá KV cache (na SSD alebo v pamäti hostiteľa) tak klesá približne na osminu oproti V4-Flash. (Hugging Face Papers)
Ďalšie súčasti
- Single-Pass mHC: upravené miešanie reziduálneho prúdu s rýchlym jadrom Mega-mHC.
- Engram: podmienená pamäť so 196 miliardami parametrov, ku ktorej model pristupuje riedko podľa tokenov.
- DSpark: špekulatívne dekódovanie s poloautoregresívnym návrhom a overovaním podľa miery istoty.
Zdroj: Hugging Face: DeepSeek
Tréning
Model je predtrénovaný na multimodálnom korpuse so 45 biliónmi tokenov a prešiel rozsiahlym dotrénovaním na textové aj multimodálne agentné scenáre. (Hugging Face Papers)
03Špecifikácia
| Parameter | Hodnota |
|---|---|
| Vývojár | DeepSeek (Chang-čou, Čína) |
| Vydanie | 10. 9. 2026 (váhy v ten istý deň) |
| Typ | Multimodálny MoE Transformer, kauzálny enkodér-dekodér |
| Celkové parametre | 552 mld. (jadro) + 196 mld. Engram |
| Aktívne parametre | 8 mld. (prefill), 16 mld. (dekódovanie) |
| Experti | 1 zdieľaný + 384 smerovaných, 6 aktívnych na token |
| Vrstvy | 40 (20 enkodér + 20 dekodér) |
| Kontext | 1 milión tokenov |
| KV cache | 890 bajtov/token (FP4) |
| Vstup / výstup | Text a obrázky / text |
| Slovník | 129 280 tokenov |
| Predtréning | 45 biliónov tokenov |
| ID v API | deepseek-flash |
| Hugging Face | deepseek-ai/DeepSeek-V4.1-Flash |
| Licencia | MIT |
04Benchmarky a nezávislé merania
V4.1-Flash exceluje v úlohách v termináli, dlhom programovaní a hľadaní zraniteľností, vo všeobecnom agentnom teste Terminal-Bench 4.0 však výrazne zaostáva za špičkou.
Výsledky podľa DeepSeeku
| Benchmark | Oblasť | Výsledok |
|---|---|---|
| Codeforces (rating) | Programovanie | 3471 |
| DeepSWE v1.1 | Programovanie | 74,2 % |
| NL2Repo-Bench | Programovanie | 64,0 (changelog DeepSeeku: 65,4) |
| ProgramBench (Almost@1) | Programovanie | 20,3 % |
| Terminal-Bench 2.1 | Terminál | 90,6 % |
| Terminal-Bench 3.0 | Terminál | 30,0 % |
| Terminal-Bench 4.0 | Terminál | 31,2 % |
| GPQA Diamond | Matematika a veda | 90,9 % |
| MathArena Apex | Matematika a veda | 65,6 % |
| HLE s nástrojmi | Matematika a veda | 63,9 % |
| AutomationBench | Agenti | 54,8 % |
| Agent's Last Exam | Agenti | 31,8 % |
| ZeroBench-main s nástrojmi (Pass@5) | Multimodalita | 49,0 % |
| CyberGym | Kybernetická bezpečnosť | 88,1 % |
| SEC-Bench Pro | Kybernetická bezpečnosť | 62,8 % |
| ExploitGym | Kybernetická bezpečnosť | 15,3 % |
reasoning_effort=100, teplotou 1,0 a top_p 0,95; výsledky uvádza DeepSeek, NVIDIA ich nezávisle neoverovala.Kde vedie a kde stráca
| Benchmark | V4.1-Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| DeepSWE v1.1 | 74,2 % | 73,0 % | 74,0 % |
| Terminal-Bench 3.0 | 30,0 % | 34,4 % | 43,3 % |
| Terminal-Bench 4.0 | 31,2 % | 39,9 % | 51,8 % |
| CyberGym | 88,1 % | 84,5 % | neuvedené |
| ExploitGym | 15,3 % | 33,7 % | 22,1 % |
- Claude Opus 551,8 %
- GPT-5.6 Sol39,9 %
- DeepSeek-V4.1-Flash31,2 %
Slabšia stránka V4.1-Flash. Zdroj: porovnávacia tabuľka DeepSeeku na Hugging Face
V CyberGym (88,1 %) prekonal všetky modely, ktoré majú v tabuľke DeepSeeku výsledok; Claude Opus 5 tam číslo nemá. (Hugging Face: DeepSeek) Pre porovnanie: špecializovaný Gemini 3.8 Flash Cyber má v rovnakom teste 86,2 %.
- DeepSeek-V4.1-Flash88,1 %
- Gemini 3.8 Flash Cyber86,2 %
- GPT-5.6 Sol84,5 %
Zdroje: Hugging Face, Gemini 3.8 Flash Cyber podľa Agentpedia
Praktické testy
Nezávislí testeri narazili na nedostatky mimo benchmarkov. V simulácii Rubikovej kocky sa farby pri ťahoch menili nesprávne a pri napodobnení obrázka v štýle Skicára vznikol štylizovaný, no málo detailný výsledok. Medzi silnými číslami a kvalitou v kreatívnych a priestorových úlohách je teda rozdiel. (MindStudio)
05Porovnanie s modelmi septembra 2026
V4.1-Flash patrí medzi najlepšie v dlhom programovaní a cenou mu v tabuľke konkuruje len Xiaomi MiMo-V2.6-Pro, jediný ďalší model s otvorenými váhami. Vo všeobecných agentných úlohách je v dolnej polovici.
| Model | DeepSWE v1.1 | Terminal-Bench 4.0 | Cena vstup / výstup (USD za 1 mil.) | Otvorené váhy |
|---|---|---|---|---|
| Meta Muse Spark 1.3 | 75,4 % | neuvedené | 1,25 / 4,25 | Nie |
| DeepSeek-V4.1-Flash | 74,2 % | 31,2 % | 0,30 / 1,20 (špička) | Áno (MIT) |
| GPT-6 Astra | 74,1 % | 57,9 % | 10 / 50 | Nie |
| Gemini 3.8 Flash | 73,7 % | 19,1 % | 0,75 / 3,75 (do konca 2026) | Nie |
| Xiaomi MiMo-V2.6-Pro | 71,9 % | 34,9 % | 0,435 / 0,87 | Áno (MIT) |
| Grok 4.7 | 71,0 % | 37,6 % | 2 / 6 | Nie |
| Claude Fable 5.1 | 67,4 % | 55,8 % | 10 / 50 | Nie |
- Meta Muse Spark 1.375,4 %
- DeepSeek-V4.1-Flash74,2 %
- GPT-6 Astra74,1 %
- Gemini 3.8 Flash73,7 %
- Xiaomi MiMo-V2.6-Pro71,9 %
- Grok 4.771,0 %
- Claude Fable 5.167,4 %
Čísla výrobcov, každý meral DeepSWE inak; porovnanie je orientačné. Zdroj pre DeepSeek: Hugging Face
V Terminal-Bench 2.1 má V4.1-Flash 90,6 %, viac ako Gemini 3.8 Flash (89,4 %), Xiaomi MiMo-V2.6-Pro (89,9 %) aj Muse Spark 1.3 (88,8 %).
Podrobnosti o konkurentoch nájdete v sprievodcovi GPT-6 Astra, sprievodcovi Claude Fable 5.1, sprievodcovi Gemini 3.8 Flash, sprievodcovi Grok 4.7, rozbore Muse Spark 1.3 a článku o Xiaomi MiMo V2.6 Pro.
Všetkých sedem septembrových modelov vedľa seba, s grafmi cien a benchmarkov, porovnávame vo veľkom porovnaní AI modelov septembra 2026.
06Cena API: špička, mimo špičky a zlacnenie
V4.1-Flash stojí v špičke 0,30 USD za milión vstupných a 1,20 USD za milión výstupných tokenov; mimo špičky presne polovicu. Bol to jediný septembrový model, ktorý zlacnil vstup aj výstup; Claude Fable 5.1 zlacnil len čítanie z cache. (Capital and Compute)
| Za 1 mil. tokenov | V4.1-Flash v špičke | V4.1-Flash mimo špičky | V4-Flash (predchádzajúci) v špičke |
|---|---|---|---|
| Vstup | 0,30 USD | 0,15 USD | 0,44 USD |
| Výstup | 1,20 USD | 0,60 USD | 1,32 USD |
| Čítanie z cache | 0,006 USD | 0,003 USD | 0,014 USD |
- V4-Flash (predchádzajúci), špička1,32 USD
- V4.1-Flash, špička1,20 USD
- V4.1-Flash, mimo špičky0,60 USD
Zdroje: DeepSeek: cenník, Capital and Compute
Oproti V4-Flash ide o zľavu 32 % na vstupe, 9 % na výstupe a 57 % na čítaní z cache. (Capital and Compute) Pre predstavu: GPT-6 Astra a Claude Fable 5.1 stoja 10 USD za milión vstupných tokenov, teda 33-krát viac ako V4.1-Flash v špičke.
Príbeh s vyradením V4-Pro
Pri vydaní DeepSeek oznámil, že od 14. septembra o 4:00 UTC bude na každú požiadavku na deepseek-v4-pro odpovedať V4.1-Flash. Rozhodnutie potom vzal späť a V4-Pro naďalej beží za doterajšie ceny. (DeepSeek: changelog) Staršie V4-Flash a V4-Flash-Vision-Exp však v priamom API skončili a ich názvy sa presmerúvajú na V4.1-Flash; ID modelov a ceny u sprostredkovateľov je preto potrebné kontrolovať zvlášť.
Tip na úsporu
Dávkové a neurgentné úlohy (nočné analýzy, generovanie údajov) spúšťajte mimo špičky za polovičnú cenu a držte stabilný prefix promptu, aby ste využili cache za 0,006 USD.
07Otvorené váhy v praxi: vlastný hosting
V4.1-Flash si môžete stiahnuť z Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) a prevádzkovať komerčne pod licenciou MIT. „Otvorený“ však neznamená „zadarmo“: potrebujete buď vlastnú výpočtovú kapacitu, alebo platené API. (MindStudio)
Čo rozhoduje o hardvéri
- Úložisko váh musí pokryť celých 552 miliárd parametrov, hoci sa na token používa len zlomok. Experti musia byť uložení niekde dostatočne rýchlo dostupní: vo VRAM, v RAM s odľahčovaním alebo na NVMe.
- Aktívne parametre (8 a 16 mld.) určujú výpočet a priepustnosť na token; pri plánovaní rýchlosti sú dôležitejšie ako celkový počet.
- Kvantizácia je pre menší hardvér nevyhnutnosť. Oficiálne minimálne požiadavky na VRAM DeepSeek nezverejnil.
Zdroj: MindStudio
Komunitné varianty
| Varianta | Veľkosť / nasadenie | Poznámka |
|---|---|---|
| NVFP4 (NVIDIA) | Pre vLLM a SGLang, testované na GB300 | Oficiálna kvantizácia od NVIDIA, od 16. 9. 2026 |
| NVFP4 (s-zaizen) | 48 súborov, spolu 527,3 GB | Neoficiálna konverzia cez NVIDIA Model Optimizer |
| EXL3 2,0 bpw (diffbot) | 358 GB, 2× RTX PRO 6000 Blackwell (po 96 GB), vLLM | Kontext 512 tis. tokenov, špekulatívne dekódovanie DSpark |
| GGUF (vcruz305) | Q2_K 246 GiB, Q3_K_M 323 GiB | Zatiaľ len vo forku llama.cpp, oficiálny llama.cpp ho ešte nespustí |
Realistické cesty
- Prenajaté GPU v cloude s oficiálnym inferenčným kódom DeepSeeku: najrýchlejší štart.
- Pracovná stanica s dvoma profesionálnymi GPU a silno kvantizovanou verziou: pre tímy, ktoré chcú mať údaje doma.
- Hostované API tretej strany: bez vlastného hardvéru a mimo serverov v Číne. Skúšobný endpoint NVIDIA na build.nvidia.com slúži len na testovanie: podmienky zakazujú dôverné a osobné údaje a používanie sa zaznamenáva.
Pri vydaní prebiehala väčšina lokálnych behov na serveroch s viacerými kartami alebo v cloude, nie na herných zostavách. (MindStudio)
08Rýchly štart cez API
Priame API DeepSeeku používa ID deepseek-flash a kontext 1 milión tokenov. (Mungomash) API DeepSeeku je kompatibilné s formátom OpenAI, takže stačí zmeniť základnú URL a model:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.deepseek.com", # overte v dokumentácii DeepSeeku
api_key=os.environ["DEEPSEEK_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "user", "content": "Prejdi tento log a nájdi príčinu chyby."}
],
)
print(response.choices[0].message.content)Základnú URL a parametre uvažovania si pred nasadením overte v dokumentácii DeepSeek API. Pri vlastnom hostingu použite endpoint svojho servera (vLLM aj podobné nástroje ponúkajú rozhranie kompatibilné s OpenAI) a model deepseek-ai/DeepSeek-V4.1-Flash.
09Údaje, jurisdikcia a bezpečnosť
Pri DeepSeeku je rozhodnutie o údajoch jednoduchšie ako pri uzavretých modeloch: ak nechcete posielať údaje do Číny, model si môžete hostovať sami.
Tri spôsoby prevádzky z pohľadu údajov
| Spôsob | Kam putujú údaje | Vhodné pre |
|---|---|---|
| Priame API DeepSeeku | Na infraštruktúru firmy so sídlom v Číne | Verejné a necitlivé údaje, prototypy |
| API tretej strany (cloudový poskytovateľ) | K danému poskytovateľovi | Firmy, ktoré chcú iného správcu údajov bez vlastného hardvéru; overte si podmienky poskytovateľa |
| Vlastný hosting | Nikam mimo vašej infraštruktúry | Citlivé a regulované údaje |
DeepSeek sídli v čínskom meste Chang-čou. (Mungomash) Konkrétne podmienky spracovania údajov v priamom API si overte v zásadách DeepSeeku a pri citlivých údajoch sa poraďte s právnikom; tabuľka vyššie opisuje len to, kde údaje fyzicky skončia.
Bezpečnosť modelu
- Silný v hľadaní zraniteľností: 88,1 % v CyberGym, viac ako GPT-5.6 Sol (84,5 %) aj špecializovaný Gemini 3.8 Flash Cyber (86,2 %).
- Slabší v tvorbe exploitov: 15,3 % v ExploitGym oproti 33,7 % pri GPT-5.6 Sol a 22,1 % pri Claude Opus 5.
- Otvorené váhy znamenajú žiadne poistky poskytovateľa. Na rozdiel od Claude Fable alebo GPT-6 Astra pri vlastnom hostingu neexistuje centrálny filter, ktorý by rizikové požiadavky presmeroval. Zodpovednosť za pravidlá používania nesie prevádzkovateľ.
Zdroje výsledkov: Hugging Face: DeepSeek, NVIDIA, sprievodca Gemini 3.8 Flash (Cyber)
10Rozhodovací sprievodca
V4.1-Flash je predvolená voľba, keď rozhoduje cena alebo kontrola nad údajmi; na najťažších všeobecných agentov siahnite inde.
| Potrebujete… | Voľba | Prečo |
|---|---|---|
| Lacné agentné programovanie vo veľkom | V4.1-Flash | DeepSWE 74,2 % za 0,30 / 1,20 USD |
| Vlastný hosting a údaje doma | V4.1-Flash | Otvorené váhy pod MIT |
| Dlhé dokumenty a agentov s obrovským vstupom | V4.1-Flash | 1 mil. tokenov, malá KV cache, lacný prefill |
| Hľadanie zraniteľností v kóde | V4.1-Flash | CyberGym 88,1 % |
| Stabilitu staršej integrácie | V4-Pro | Zostáva v prevádzke za pôvodné ceny |
| Všeobecného agenta a ovládanie počítača | GPT-6 Astra alebo Claude Fable 5.1 | Terminal-Bench 4.0 okolo 56 až 58 % oproti 31 % |
| Kreatívne a priestorové úlohy | Uzavreté vlajkové modely | V praktických testoch V4.1-Flash zaostával |
| Zvuk alebo video na vstupe | Iný model | V4.1-Flash spracuje len text a obrázky |
11Často kladené otázky o DeepSeek-V4.1-Flash
Čo je DeepSeek-V4.1-Flash?
Otvorený multimodálny model MoE od čínskeho DeepSeeku s 552 miliardami parametrov a kontextom 1 milión tokenov, vydaný 10. septembra 2026 pod licenciou MIT.
Koľko parametrov model v skutočnosti používa?
Pri spracovaní vstupu 8 miliárd, pri generovaní 16 miliárd z celkových 552 miliárd.
Koľko stojí API?
V špičke 0,30 USD za milión vstupných a 1,20 USD za milión výstupných tokenov, mimo špičky polovicu. Čítanie z cache stojí 0,006 USD.
Môžem V4.1-Flash používať komerčne?
Áno, licencia MIT komerčné použitie povoľuje.
Rozbehnem ho na jednej hernej grafickej karte?
Nie bez veľkých kompromisov. Aj kvantizovaná verzia potrebuje na váhy stovky GB; realistické sú servery s viacerými kartami alebo cloud, komunitná verzia EXL3 beží napríklad na dvoch kartách RTX PRO 6000 s 96 GB.
Je lepší ako Claude alebo GPT?
V dlhom programovaní sa im vyrovná za zlomok ceny. Vo všeobecných agentných úlohách (Terminal-Bench 4.0) výrazne zaostáva.
12Verdikt
DeepSeek-V4.1-Flash prináša špičkové výsledky v programovaní za pár centov a k tomu otvorené váhy pod licenciou MIT. Pre lacné agentné programovanie, dlhé vstupy a firmy, ktoré chcú mať údaje doma, je to jeden z najsilnejších kandidátov. Najbližším otvoreným súperom je Xiaomi MiMo V2.6 Pro, ktorý má vyššie súhrnné hodnotenie Artificial Analysis (46 oproti 39 bodom), v DeepSWE však zaostáva (71,9 % oproti 74,2 %).
Na všeobecných agentov, ovládanie počítača a kreatívne úlohy však nestačí a priame API vedie do Číny. Chcete nasadiť AI vo firme a vybrať správny model? Pomôžeme v rámci AI implementácie.
13Zdroje
- Hugging Face: DeepSeek-V4.1-Flash (oficiálna model card)
- arXiv: DeepSeek-V4.1-Flash, technická správa
- Hugging Face Papers: abstrakt správy
- NVIDIA: model card DeepSeek-V4.1-Flash
- DeepSeek API: aktualizácie
- DeepSeek API: cenník
- DeepSeek: oznámenie V4.1-Flash
- MindStudio: ako prevádzkovať V4.1-Flash lokálne
- Capital and Compute: modely a ceny september 2026
- Mungomash: prehľad frontier modelov
- Local AI Zone: aktualizácie modelov september 2026
- TeamDay: najlepšie AI modely 2026
- Hugging Face: NVFP4 od NVIDIA
- Hugging Face: konverzia NVFP4 (s-zaizen)
- Hugging Face: GGUF (vcruz305)
- Hugging Face: EXL3 pre 2× RTX PRO 6000