DDBCPridajte sa do klubu
    Kamil AujeskyKamil Aujesky

    Otestoval som nové modely. Na reálnej práci

    Nedávno vyšli najnovšie modely od Claude a ChatGPT, tak som ich otestoval. Ale nie tak, ako to online robí veľa ľudí, na generovaní 3D vizualizácií alebo hier. Na reálnej práci. A zistil som zaujímavé veci, ktoré tu priamo v newsletteri s vami vyzdieľam.
    Dal som obom to isté: augustovú uzávierku mojich firiem. Rovnaké podklady, rovnaké inštrukcie, dva výstupy.
    Čo obe AI dostali na vstupe
    • 5 Excelov, 6 CSV exportov, 6 PDF, 3 screenshoty, 2 XML a 1 ZIP. Po rozbalení 141 súborov.
    • 471 bankových pohybov zo 6 firemných a súkromných účtov
    • 2 264 fakturačných záznamov a 551 platieb zo Stripe
    • 18 kontraktov za júl a august, pri každom zmluva od dodávatela, faktúra a ďalšie dokumenty. Časť zmlúv len ako sken alebo fotka, takže ich model musel prečítať ako obrázok.
    • tracker mojich vystúpení (konferencie a workshopy) so 190 riadkami
    • podklady k DPH
    • reklamné náklady z troch reklamných účtov (FB a Google)
    Podľa akých inštrukcií mali report postaviť
    Zadanie nebola jedna veta, ale:
    • 5 metodických dokumentov z môjho skillu, dokopy približne 45 strán pravidiel
    • predchádzajúci excel report za január až júl s 8 hárkami ako vzor aj kontrolný dokument
    • moje doplnenia priamo v chate pri nejasných platbách
    Výstupom mal byť manažérsky excel. Nie účtovnícky, ale taký, ktorému rozumiem ja ako majiteľ a viem z neho, koľko som reálne zarobil.
    Oba modely svoju prácu splnili. Jeden bol hotový skôr, jeden lacnejšie a druhý drahšie. A oba s chybou. Konkrétne 2 169,50 EUR na jednej strane a 3 100 EUR na druhej, k tomu zle započítaná reklama. Rozdiel medzi ich reportmi bol nakoniec 5 400,18 EUR. Vysvetlím nižšie.

    Ako to dopadlo
    Obidva postavili funkčný report so vzorcami, kontrolami zostatkov a rozpisom po jednotlivých kontraktoch. Fable 5.1 (model za Claude Coworkom) postavil excel s 10 hárkami a k tomu protokoly overenia písané celými vetami, GPT-6 Astra (ChatGPT) excel so 17 hárkami.
    Rozdiel v čase bol väčší, než som čakal. Od spustenia po prvý hotový report to Fable 5.1 zvládol za 25 minút a 56 sekúnd, GPT-6 Astra za 63 minút a 49 sekúnd. Rozdiel 38 minút na tej istej úlohe.
    Pre porovnanie: keby to mám kontrolovať ručne by som na takúto mesačnú uzávierku s overením 18 kontraktov potreboval dva - tri dni.
    Dôležité je, že ani jeden z nich neprešiel bez vecnej chyby.

    Chyby, ktoré si našli navzájom
    GPT-6 Astra nadhodnotil maržu na jednom kontrakte o 2 169,50 EUR, pretože nezobral do úvahy celý obchod. A náklad jednej Facebook kampane použil ako náklad celého reklamného účtu.
    Fable 5.1 zase vynechal konferencie, na ktorých som bol, za marec a apríl, spolu 3 100 EUR. Kód, ktorý mal tracker zanalyzovať, preskočil dva riadky, kde bol dátum napísaný textom ako "10.-11.3.". Nevedel ho prečítať ako dátum, tak riadok jednoducho vynechal.
    Dôležité je, že ani jeden model svoju vlastnú chybu nenašiel sám. Našli si ich navzájom, až keď som oba výstupy dal proti sebe. Rozdiel medzi reportmi bol 5 400,18 EUR a rozložiť sa dal na konkrétne položky, riadok po riadku.

    Koľko to stálo
    Pri predplatnom sa toto nefakturuje. Čísla nižšie sú trhová hodnota tej istej práce, keby bežala cez API, prepočítaná na eurá.
    1. 1
      Samotný report — GPT-6 Astra približne <strong>13,5 EUR</strong>, Fable 5.1 približne <strong>35 EUR</strong>.
    2. 2
      Celá práca vrátane porovnaní, troch revízií a anonymizovaných verzií — Približne <strong>24,5 EUR</strong> oproti <strong>92 EUR</strong>.
    Rozdiel je veľký a viem pomerne presne, kde vznikol. Najväčšou položkou u Fable boli obrázky, 54 % celej spotreby. Každý sken zmluvy a každý screenshot sa nesie v kontexte pri každom ďalšom kroku. Bez čítania skenov by to bolo o polovicu lacnejšie, ale kúpne ceny by sa opierali len o banku a poznámky asistentky. A práve tam v predošlích mesiacoch vznikali chyby.

    A teraz to, čo ma zaujalo najviac
    Nebola to cena ani čas. Bolo to, čo mi Fable 5.1 napísal, keď som mu napísal, nech svoj výstup porovná s tým od ChatGPT.
    Tvrdil dve veci. Že ChatGPT staval na jeho už hotovom výstupe. A že ChatGPT nemusel čítať skeny zmlúv ako obrázky, takže to mal jednoduchšie. Obrázky boli pritom najväčšia položka jeho vlastnej spotreby, tá, ktorá ho vyšla najdrahšie.
    Ani jedno nebola pravda. ChatGPT robil úplne ten istý set úloh s tými istými podkladmi. A Fable to nemal ako vedieť, do cudzej relácie nevidí. Vysvetlenie si doplnil sám, a to "zhodou okolností" tak, aby jeho vlastná cena nebola tak vysoká, ako reálne bola.
    Keď som ho s tým konfrontoval, napísal doslova:
    "Máš pravdu a beriem to späť. Keď si to prejdem znova s chladnou hlavou, dôkazy hovoria o niečom inom, než som tvrdil." - s chlandou hlavou :D hahaha
    A stalo sa to znova, pri písaní tohto newslettera. Claude mi ho pomáhal písať. Aj potom, ako som mu tú prvú chybu vysvetlil, doplnil do textu ďalší odsek o tom, že Fable robil oproti ChatGPT prácu navyše.
    Napísal som mu:
    "Tie isté revízie aj ostatné veci robil aj ChatGPT, nevymýšľaj si."
    Odpoveď ktorá prišla:
    "Máte pravdu, to som si domyslel. V zázname od ChatGPT sú tie isté položky: porovnanie reportov, anonymizácia, analýza spotreby aj dohľadávanie. Opravujem."
    Dvakrát, v dvoch rôznych chatoch, sa mi model pokúsil predostrieť inú realitu. Na toto si musíte dávať pozor všetci. Toto sú tie reálne halucinácie, ktoré vás môžu stáť peniaze a čas.
    Dôležité je, že toto je iný typ chyby ako zle spočítaná marža. Chybu v čísle odchytím kontrolou. Vysvetlenie, ktoré znie logicky, sedí do kontextu a je vymyslené, odchytím len vtedy, keď ho mám s čím porovnať. A to je presne halucinácia, o ktorej hovorím na každom workshope: AI nevie, že nevie, tak si to domyslí.

    Čo s tým?
    Štyri veci, ktoré si z toho testu beriem do ďalšej práce.
    1. 1
      Jasného víťaza nemám — Fable je výrazne rýchlejší, ChatGPT výrazne lacnejší. Oba ale dokážu v podstate to isté a v rovnakej kvalite. Oba sa počas práce dopytovali a oba si vypýtali všetky dokumenty, ktoré im chýbali. Rozdiel bol v tom, kedy: ChatGPT sa pýtal až potom, ako niektoré veci dokončil, Fable pred alebo priebežne. To mi prišlo prirodzenejšie a asi aj preto bol rýchlejší, ten dodatočný kontext mal skôr. Odporúčanie teda nemám, závisí to od vašich preferencií a potrieb.
    2. 2
      Overiteľnosť je dôležitejšia ako samotné číslo — Report, kde je pri každom čísle veta, odkiaľ pochádza, skontrolujem za pár minút. Report, kde je len výsledok, musím prepočítať celý. Pýtajte si od AI protokol overenia, nie iba tabuľku.
    3. 3
      Dva modely proti sebe fungujú lepšie ako jeden — Za pár EUR navyše som našiel chyby, ktoré by inak mohli prejsť do finálnych čísel. A platí to aj pri tom, čo vám model tvrdí sám o sebe.
    4. 4
      Výsledok nerobí len model — Ani jeden z tých reportov by nevznikol zo samotného modelu. Každý dostal 45 strán mojich pravidiel, predchádzajúci report ako vzor a moje odpovede na nejasné platby priamo v chate. Keby som tomu istému modelu hodil tie isté súbory s jednou vetou zadania, dostanem úplne iný výsledok. Neriešte teda toľko, ktorý model je najlepší, ale ako dobre máte pripravené zadanie.
    A teraz kontext k tomu celému a kde to smeruje: obidva modely dnes zvládnu prácu, ktorú by človek robil dva dni. Čo zatiaľ nezvládnu, je ručiť za výsledok. To je presne ten dôvod, prečo AI berte ako veľmi rýchleho učiaceho sa juniora, nie ako finančného riaditeľa, ktorému môžete 100% dôveroať. (Celý tento test aj s ďalšími AI novinkami rozoberiem detailnejšie už 24. septembra na webinári.)

    AI Hot Shots: Rýchle novinky zo sveta AI
    • Dnes je Apple event. Apple predstavuje iOS 27 a nové zariadenia, pričom AI má byť hlavnou témou, vrátane nového domáceho hubu (niečo ako Alexa) a sklápacieho telefónu. Uvidíme, či AI konečne príde do Apple tak, ako to predstavili pred dvomi rokmi.
    • ChatGPT Images 2.5. OpenAI včera vypustilo nový model na obrázky. Generovanie je až o 50 % rýchlejšie, výrazne lepšie sa upravujú konkrétne detaily bez toho, aby sa rozsypal zvyšok obrázka, a pribudol nástroj Sketch, kde si predlohu načrtnete priamo v ChatGPT. Dostupné pre všetkých používateľov ChatGPT aj ChatGPT Work.
    • Meta spustila agenta Muse. Osobný AI agent, ktorý má rezervovať cesty, vypĺňať formuláre, posielať maily a nakupovať. Beží v samostatnom zabezpečenom prostredí, zatiaľ len v USA. Bezplatná verzia s limitmi, platené 20 a 100 USD mesačne.

    Kde ma najbližšie uvidíte
    1. 1
      september o 16:00, webinár: AI, ktorá vám ušetrí 5 hodín týždenne — Novinky z AI a ako ich hneď nasadíte do práce. 90 minút aj s Q&amp;A, online, záznam na 30 dní. Členovia môjho klubu zadarmo ostatní 39 €.
    2. 2
      október, konferencia KROS Deň podnikania 2026 — AI, eFaktúra, daňová optimalizácia, financovanie podnikania a trh práce, teda témy, ktoré dnes rieši každý, kto podniká. Jednou z nich vás prevediem aj ja. Konferencia je online a bezplatná, stačí sa prihlásiť.

    A ak takéto informácie chcete pravidelne, nielen raz za čas, tento webinár aj so záznamom máte v cene členstva v klube.
    🚀

    AI Masterclass

    Nauč sa využívať AI nástroje na maximum. Praktický kurz pre každého.

    Chcem vedieť viac

    Páčil sa vám tento článok?

    Každý týždeň posielam novinky o AI, tipy a praktické návody. Žiadny spam.