V skratke: Gauntlet Loop je agentické AI workflow, v ktorom vedúci agent rozdelí veľký cieľ na menšie úlohy, tvorcovia pripravia jednotlivé časti a čerství kritici ich opakovane porovnávajú s konkrétnou latkou kvality. Matt Shumer ho použil pri projekte Claude of Duty: z jedného krátkeho zadania vznikla kompletná hrateľná browserová FPS hra. Nejde o hotový komerčný titul kategórie Vysvetliť pojemAAA hraNeformálne označenie veľkorozpočtovej hry s rozsiahlym vývojom a marketingom; nejde o technickú normu ani automatickú záruku kvality.Viac v slovníku, ale o veľký posun od AI asistenta k autonómnemu produkčnému systému.
Ešte donedávna sa „programovanie pomocou AI“ často končilo funkciou, komponentom alebo prototypom, ktorý musel človek poskladať s ďalšími časťami. Gauntlet Loop ukazuje inú mierku. Jeden človek zadá ambíciu a latku kvality, vedúci AI agent vytvorí plán, pošle špecializovaných agentov na kód, grafiku, animácie, zvuk či testovanie a celý tím pracuje v opakovaných kontrolných slučkách.
Matt Shumer tento postup verejne opísal po vytvorení projektu Claude of Duty. Podľa jeho článku agenti pracovali celé hodiny bez priebežného usmerňovania a vytvorili približne 55-tisíc riadkov kódu aj herné materiály generované v kóde. Presné údaje o dĺžke behu, miere autonómie a rozsahu výstupu pochádzajú od Shumera; verejný repozitár neobsahuje úplný záznam každého kroku agentov.
Prečo je jeden prompt na celú hru obrovský krok vpred?
Rozdiel je v rozsahu koordinácie. Bežná hra spája programovanie, herný dizajn, 3D scénu, materiály, animácie, vizuálne efekty, zvuk, testovanie a technické vedenie. Generatívna AI už vedela pomôcť s mnohými z týchto úloh samostatne. Gauntlet Loop ukazuje, že agentický systém ich dokáže rozdeliť, rozbehnúť súbežne, priebežne hodnotiť a nakoniec spojiť do jedného hrateľného výsledku.
| Predchádzajúci model práce s AI | Agentická produkcia v Gauntlet Loope |
|---|---|
| Človek zadáva sériu čiastkových Vysvetliť pojemPromptTextový alebo iný vstup s pokynom, kontextom či príkladmi, ktorý používateľ alebo systém poskytne modelu, aby ovplyvnil jeho nasledujúci výstup.Viac v slovníku. | Človek zadá výsledok, obmedzenia a latku kvality. |
| AI vytvorí úryvok, obrázok alebo izolovaný prototyp. | Vedúci agent rozdelí celý projekt medzi špecialistov. |
| Človek kontroluje každú odpoveď a určuje ďalší krok. | Kritickí agenti kontrolujú reálny výstup a vracajú konkrétnu spätnú väzbu. |
| Integráciu drží v hlave človek. | Systém robí lokálne opravy aj záverečnú kontrolu celku. |
| Práca sa zastaví po jednej odpovedi. | Slučka pokračuje po schválenie, limit alebo rozhodnutie človeka. |
Toto tvrdenie netreba nafukovať prirovnaním k hotovej komerčnej hre. Browserová FPS nemá obsahový rozsah, testovanie na mnohých platformách, živú prevádzku ani produkčné zázemie veľkého štúdia. Nová schopnosť je inde: jednotlivec môže krátkym zadaním spustiť šírku koordinovanej digitálnej práce, na ktorú by predtým potreboval viac rolí a množstvo ručného riadenia.
Čo je Gauntlet Loop v jednej schéme?
Gauntlet Loop je séria ôsmich krokov, ktorá sa opakuje na menších častiach projektu a potom skontroluje výsledok ako celok:
- Človek určí cieľ a kontrolovateľnú latku. Nestačí „vytvor dobrú hru“. Agent potrebuje referenciu, test alebo pozorovateľné vlastnosti výsledku.
- Vedúci agent rozdelí prácu. Rozhodne, ktoré časti môže riešiť samostatne a ktoré môže poslať špecializovaným subagentom.
- Tvorca pripraví jednu časť. Môže ísť o hernú mechaniku, mapu, animáciu, obrazovku aplikácie alebo kapitolu dokumentu.
- Kritik v čerstvom kontexte otvorí skutočný výstup. Nečíta iba sebahodnotenie tvorcu. Pozerá renderovanú stránku, spustenú hru, výsledky testov alebo hotový text.
- Kritik pomenuje najväčšiu medzeru. Užitočná spätná väzba je konkrétna a zoradená podľa dopadu.
- Tvorca výstup opraví. Potom ho odošle do ďalšieho kola kontroly.
- Slučka sa zastaví podľa pravidla. Dôvodom môže byť splnenie podmienok, malý prínos ďalšieho kola, rozpočtový limit alebo rozhodnutie človeka.
- Integračná kontrola preverí celok. Lokálne dobré časti ešte nemusia vytvoriť súdržný produkt.
Shumerova publikovaná verzia promptu žiada Three.js FPS, rozdelenie práce medzi subagentov, opakovanú prácu v slučke, oddelených prísnych vizuálnych kritikov a slepé porovnanie vedľa referenčnej hry. Verejné zadanie dokladá plán. Samo osebe však nie je kompletným vykonávacím záznamom, ktorý by dokazoval, že každý kritik vykonal každý predpísaný krok.
Prečo nestačí prompt „urob to lepšie“?
Všeobecné prídavné meno neposkytuje agentovi test. Ak má slučka priniesť lepší výsledok, potrebuje dôkaz, podľa ktorého vie rozlíšiť zlepšenie od zmeny.
Konkrétna latka funguje lepšie než prídavné meno
Pojmy ako „úžasné“, „AAA“ alebo „pripravené do produkcie“ vyjadrujú ambíciu, nie overenie. Pri webovej stránke môže byť latkou schválený dizajn, zoznam podporovaných rozlíšení a test prístupnosti. Pri softvéri je to očakávané správanie, sada testov a bezpečnostné pravidlá. Pri článku je to zdrojový brief, zakázané tvrdenia a kontrola všetkých odkazov.
Referenčný produkt môže agentovi ukázať smer. Nemal by však podporovať kopírovanie cudzieho dizajnu, chránených postáv alebo značky. Vhodnejšia latka opisuje vlastnosti, ktoré má výsledok dosiahnuť: čitateľnosť, odozvu ovládania, súdržnosť vizuálu či absenciu konkrétnych chýb.
Kritik musí vidieť výsledok, nie vysvetlenie autora
Tvorca prirodzene pozná dôvody svojich rozhodnutí. Ak kritik dostane rovnaký kontext, môže prevziať jeho predpoklady a prehliadnuť tú istú chybu. Čerstvý agent má menšiu šancu nechať sa viesť interným príbehom tvorcu, no stále nemusí byť objektívny. Je to ďalšie modelové hodnotenie, nie nezávislý ľudský audit.
Preto mu treba ukázať artefakt: snímku stránky, bežiacu aplikáciu, výsledok testu, diff alebo hotový text. Tam, kde možno vlastnosť zmerať deterministicky, má test prednosť pred názorom modelu.
Menšie časti sa hodnotia presnejšie než celý projekt naraz
Kritik, ktorý dostane pokyn „nájdi chyby v celej hre“, ľahko preskočí medzi desiatkami problémov a neposkytne použiteľnú prioritu. Pri menšej časti vie pomenovať jeden zásadný nedostatok, tvorca ho opraví a slučka sa posunie ďalej. Neskoršia integračná kontrola je nutná, pretože samostatne kvalitná mapa, ovládanie a zvuk môžu spolu pôsobiť nesúrodo.
Ukazuje Claude of Duty opakovateľný postup alebo jeden vydarený trik?
Päť ďalších verejne dostupných hier podporuje názor, že princíp sa dá zopakovať. Matt Shumer vo svojom článku prepojil projekty iných tvorcov, ktoré vznikli po zverejnení jeho promptu alebo jeho úprav. Pri kontrole AIhelp.sk 29. júla 2026 boli všetky tieto hry dostupné:
- Kart Royale – pretekárska browserová hra,
- Der Koloss – zombie survival pre jedného hráča aj kooperáciu,
- Pastel Nuketown – farebná FPS aréna,
- Dream Logic – surrealistický herný experiment,
- Dungeon Crawler Carnage – akčná hra z podzemia.
Ich existencia je dôležitý signál. Rôzni ľudia dokázali dostať podobný pracovný vzor až k nasadenému hrateľnému artefaktu, takže Claude of Duty nie je jediný osamelý výstup. Tieto projekty však nie sú kontrolované benchmarky. Nepracovali nevyhnutne s identickým promptom, modelom, rozpočtom, počtom iterácií ani mierou ľudského zásahu. Nedajú sa preto použiť na výpočet úspešnosti či návratnosti metódy.
Čo je verejne doložené a čo ostáva pri atribúcii: Kód, prompt, architektonický dokument a hrateľné projekty sú verejne dostupné. Shumer zároveň uvádza jeden prompt, mnoho hodín autonómnej práce, približne 55-tisíc riadkov a zastavenie stále sa zlepšujúceho behu vlastným rozhodnutím. Verejný repozitár neobsahuje úplný prepis subagentov, tokenový či nákladový účet ani záznam každého ľudského zásahu. Ani pôvod súboru
ARCHITECTURE.mdv rámci samotného behu nemožno z verejnej histórie spoľahlivo určiť.
Je Gauntlet Loop nový algoritmus?
Nie. Dôležitý je spôsob, akým spája staršie agentické vzory do dostupného produkčného postupu a používa ich vo väčšej mierke.
Anthropic vo svojom prehľade agentov z roku 2024 opisuje evaluator–optimizer workflow: jeden model vytvorí výstup, druhý ho hodnotí a spätná väzba sa vracia do ďalšieho kola. Rovnaký prehľad vysvetľuje aj vzor orchestrator–workers, pri ktorom vedúci model dynamicky rozdelí zložitú úlohu medzi pracovné modely.
Výskumné práce Self-Refine a Reflexion už v roku 2023 skúmali opakované zlepšovanie pomocou jazykovej spätnej väzby. Self-Refine používa model ako tvorcu, poskytovateľa spätnej väzby aj opravára. Reflexion prenáša slovnú spätnú väzbu medzi pokusmi cez pamäť agenta.
Shumerov praktický prínos spočíva v zrozumiteľnej kombinácii: dynamické rozdelenie práce, externá referencia, oddelený kritik s čerstvým kontextom, kontrola reálneho artefaktu, lokálne slučky a záverečné uhladenie celého produktu. Prelom nie je vynález každej súčiastky. Je to schopnosť spustiť ich jedným vysokým zadaním a dostať na konci kompletný hrateľný výsledok.
Kde môže Gauntlet Loop pomôcť firme?
Najlepší prvý pilot má jasný výstup, lacnú kontrolu a obmedzený dosah chyby. Firma by nemala začínať právnym rozhodnutím, ostrým nasadením alebo automatickou komunikáciou so zákazníkmi.
| Úloha | Čo vytvorí agent | Čo skúma AI kritik | Pevná kontrola | Rozhodnutie človeka |
|---|---|---|---|---|
| Webová stránka | Funkčnú stránku | Screenshot oproti schválenému návrhu | Prístupnosť, Lighthouse, e2e testy | Dizajnér alebo majiteľ schváli vzhľad |
| Softvérová zmena | Kód a diff | Správanie spustenej funkcie | Testy, lint, typy, bezpečnostné kontroly | Vývojár schváli merge a nasadenie |
| Odborný článok | Návrh sekcií | Súlad so zdrojmi a argumentmi | Kontrola URL a zakázaných tvrdení | Editor schváli finálny text |
| Brandový vizuál | Banner alebo grafiku | Súlad s manuálom a referenciami | Rozmery, kontrast, pretečenie textu | Marketing schváli použitie |
| Extrakcia dát | JSON alebo tabuľku | Porovnanie s originálnym dokumentom | Schéma, súčty a povinné polia | Zodpovedný človek rieši výnimky |
Pri citlivých dátach treba pracovný priestor izolovať a obmedziť oprávnenia agentov. Praktické pravidlá rozoberáme v pripravovaných článkoch o bezpečnom používaní AI s firemnými dátami a internej smernici pre AI vo firme. V právnych, daňových, zdravotných, personálnych alebo iných závažných rozhodnutiach môže AI pripraviť podklady, nie nahradiť kvalifikovanú kontrolu.
Kedy sa z kontroly stane drahá slučka omylov?
Slučka bez limitu môže zvyšovať účet a pritom presúvať chyby z jedného miesta na druhé. Builder a kritik postavený na rovnakom modeli môžu zdieľať slepé miesta. Použitie rozdielnych modelov pomáha rozšíriť pohľad, no negarantuje nezávislosť.
Výskum Vysvetliť pojemVeľký jazykový model (LLM)Model strojového učenia trénovaný na veľkom množstve textu, ktorý pracuje s tokenmi a dokáže vytvárať alebo spracúvať jazyk; jeho odpovede nemusia byť pravdivé ani spoľahlivé.Viac v slovníku hodnotiteľov zdokumentoval sklon k pozičnému, dĺžkovému a sebapreferenčnému skresleniu. Model môže uprednostniť prvú odpoveď, dlhší text alebo výstup podobný vlastnému štýlu. Štúdie Judging LLM-as-a-Judge a Large Language Models Are Not Fair Evaluators preto podporujú opatrnosť pri slepých A/B porovnaniach. Výmenu poradia a viac hodnotení možno použiť ako zmiernenie, nie ako záruku správneho verdiktu.
Ďalšie riziko je lokálne zlepšovanie bez ohľadu na celok. Vizuálne krajšia obrazovka môže zhoršiť výkon. Prepracovaný modul môže rozbiť rozhranie so susedným modulom. Kritik, ktorý sleduje iba vzhľad, nemusí odhaliť funkčnú chybu, bezpečnostný problém ani zlú udržiavateľnosť kódu.
Agent môže navyše spracovať nedôveryhodný dokument, web alebo výstup obsahujúci prompt injection. Kritický agent preto nemá dostať zbytočne široké oprávnenia iba preto, že „kontroluje“ prácu iného agenta.
Ako nastaviť bezpečný Gauntlet Loop?
Bezpečný pilot potrebuje pravidlá ukončenia ešte pred prvým kolom. Týchto šesť krokov pokrýva najčastejšie slabiny:
- Opíšte artefakt a latku kontrolovateľne. Uveďte, čo má agent odovzdať a podľa čoho spoznáte prijateľný výsledok.
- Spojte AI úsudok s pevnými testami. Formát, dostupnosť, výpočty, schému, bezpečnostné pravidlá či regresie nenechávajte na slovný dojem modelu.
- Oddeľte kontext tvorcu a kritika. Pri dôležitých kontrolách zvážte aj druhý model, ale stále počítajte s možnými spoločnými slepými miestami.
- Nastavte strop. Určte maximálny počet kôl, časový a finančný limit, minimálne požadované zlepšenie a podmienky eskalácie.
- Logujte priebeh. Uchovajte prompty, verzie artefaktov, verdikty, náklady a dôvod zastavenia. Bez záznamu sa úspešný experiment ťažko zopakuje a chybný ťažko vysvetlí.
- Pred dôsledkom zastavte pri človeku. Publikovanie, nasadenie, odoslanie zákazníkovi a závažné rozhodnutia potrebujú výslovné schválenie.
Finančný limit nemá byť odhad naslepo. Sledujte skutočný počet modelových volaní, tokeny, infraštruktúru a čas ľudí. Až potom porovnajte pilot s dnešným postupom. Viac kontextu k rozpočtu pripravujeme v samostatnom prehľade nákladov na zavedenie AI do firmy.
Čo si z Gauntlet Loop odniesť?
Gauntlet Loop ukazuje, že jeden prompt už nemusí znamenať jednu odpoveď. Môže spustiť organizovaný digitálny tím, ktorý si prácu rozdelí, vytvorí ucelený artefakt a vracia sa k nemu dovtedy, kým neprejde stanovenou kontrolou alebo nenarazí na limit.
Pre firmy je dôležitý posun v úlohe človeka. Menej času môže venovať ručnému zadávaniu každého kroku a viac určeniu cieľa, referencií, hraníc a záverečného verdiktu. Claude of Duty a päť verejných nasledovníkov sú presvedčivé signály, že autonómna tvorba sa posunula za izolované ukážky kódu. Stále však potrebujeme merať kvalitu, čas aj celkové náklady pri konkrétnej úlohe.
Rozumný začiatok je jeden ohraničený proces. Vyberte úlohu, ktorú dnes koordinuje viac ľudí alebo nástrojov, určte dôkazy kvality a porovnajte agentický pilot s aktuálnym postupom. Ak chýba bezpečný spôsob zastavenia alebo človek, ktorý prevezme zodpovednosť za výsledok, pilot ešte nie je pripravený.
FAQ
Čo je Gauntlet Loop?
Gauntlet Loop je agentické workflow: vedúci agent rozdelí cieľ, tvorcovia pripravia časti, čerství kritici skontrolujú reálne výstupy a slučka ich opakovane zlepšuje podľa jasnej latky. Končí prijatím výsledku, limitom alebo rozhodnutím človeka.
Je Gauntlet Loop nový AI algoritmus?
Nie. Spája známe vzory orchestrator–workers, evaluator–optimizer a iteratívnu spätnú väzbu. Nový je názov a prakticky prístupná kombinácia, ktorá dokázala koordinovať veľký autonómny projekt z jedného vysokého zadania.
Prečo má výstup hodnotiť iný agent?
Čerstvý kritik nevidí vysvetlenia a predpoklady tvorcu, takže môže ľahšie nájsť prehliadnutú chybu. Stále však nie je objektívny. Pri merateľných vlastnostiach má rozhodovať test a pri dôležitom výsledku človek.
Musia tvorca a kritik používať rozdielne modely?
Nemusia. Rozdielne modely môžu znížiť niektoré spoločné slepé miesta, no negarantujú nezávislý úsudok. Dôležitejšie je oddeliť kontext, ukázať kritikovi reálny artefakt a výsledok podoprieť pevnými testami.
Je Claude of Duty porovnateľný s hotovou AAA hrou?
Nie v celkovom rozsahu. Je to hrateľná browserová FPS, nie komerčný titul s rovnakým objemom obsahu, testovania, podpory platforiem a živej prevádzky. Prelom spočíva v autonómnej koordinácii mnohých tvorivých a technických úloh.
Kedy treba slučku zastaviť?
Zastavte ju po splnení podmienok, pri malom prínose ďalšieho kola, po dosiahnutí časového alebo finančného limitu a vždy pred krokom, ktorý vyžaduje ľudské schválenie. Pravidlá ukončenia nastavte vopred.
Dá sa Gauntlet Loop použiť mimo programovania?
Áno, ak má úloha kontrolovateľný výstup. Vhodné sú napríklad webové návrhy, odborné texty, brandové vizuály alebo štruktúrovaná extrakcia. Právne, zdravotné, personálne a iné závažné rozhodnutia musia zostať pod kvalifikovanou ľudskou kontrolou.
Chcete otestovať agentický pilot vo firme?
Máte proces, na ktorom dnes pracuje viac ľudí alebo nástrojov? Napíšte nám cez kontaktný formulár. Spoločne môžeme preskúmať, či sa dá bezpečne ohraničiť, opísať merateľnou latkou a otestovať s agentmi. Prvú správu posudzujeme manuálne e-mailom; nič sa automaticky nenasadzuje ani neposiela zákazníkom.
Zdroje a redakčná metodika
Hlavným zdrojom je Shumerov opis Gauntlet Loopu, verejný repozitár Claude of Duty, jeho prompt a architektonický dokument. Päť následných hier používame ako verejne dostupný signál opakovateľnosti, nie ako kontrolované benchmarky.
Historický a technický kontext vychádza z článku Anthropic o agentických workflow a z pôvodných výskumných prác Self-Refine, Reflexion a LLM-as-a-judge. Všetkých päť hier aj hlavné zdroje v zozname bolo pri kontrole 29. júla 2026 verejne dostupných cez HTTP. Presné tvrdenia o jednom prompte, autonómnych hodinách, riadkoch kódu a priebehu tvorby pripisujeme Mattovi Shumerovi.
Spracované s pomocou AI na základe verejných zdrojov. Redakčne overené AIhelp.sk.
Vysvetlivky pojmov
- AAA
- Neformálne označenie veľkorozpočtovej hry s rozsiahlym vývojom a marketingom; nejde o technickú normu ani automatickú záruku kvality.
- promptov
- Textový alebo iný vstup s pokynom, kontextom či príkladmi, ktorý používateľ alebo systém poskytne modelu, aby ovplyvnil jeho nasledujúci výstup.
- LLM
- Model strojového učenia trénovaný na veľkom množstve textu, ktorý pracuje s tokenmi a dokáže vytvárať alebo spracúvať jazyk; jeho odpovede nemusia byť pravdivé ani spoľahlivé.


