Keď firma zvažuje nasadenie AI agenta, prvá otázka býva, koľko bude stáť vývoj. Je to pochopiteľné — je to jednorazová položka, dá sa naplánovať a schváliť. Otázka, ktorá sa kladie menej často, je, koľko bude agent stáť každý mesiac potom, keď už beží.
Rozdiel oproti klasickému softvéru je podstatný. Bežná webová aplikácia má prevádzkový náklad, ktorý je do veľkej miery fixný — hosting stojí zhruba rovnako, či ju používa dvadsať alebo tridsať ľudí. AI agent má náklad, ktorý sa mení s každou správou, a rastie inak, než väčšina ľudí čaká.
Z čoho sa účet skladá
Prevádzkový náklad agenta má tri zložky a každá sa správa inak.
Volania jazykového modelu. Toto je typicky najväčšia a najkolísavejšia položka. Účtuje sa podľa počtu tokenov — kúskov textu, ktoré do modelu vstúpia a ktoré z neho vyjdú. Vstup je zvyčajne lacnejší než výstup, ale vstupu býva rádovo viac.
Infraštruktúra. Server, databáza, fronta úloh, úložisko. Táto časť sa správa ako pri bežnej aplikácii a je predvídateľná.
Vektorová databáza a vyhľadávanie, ak agent pracuje s firemnou dokumentáciou. Náklad rastie s objemom dokumentov a s frekvenciou ich preindexovania, nie s počtom otázok. Princíp takéhoto riešenia sme rozobrali v článku o RAG a firemnej dokumentácii.
Čo skutočne ženie účet hore
Intuitívna odpoveď je „počet otázok". V praxi je hlavný faktor niekde inde: dĺžka kontextu, ktorý sa do modelu posiela pri každom volaní.
Agent si nepamätá konverzáciu sám od seba. Aby vedel, o čom sa hovorilo, posiela sa mu história spolu s novou otázkou. Ak sa posiela celá, každá ďalšia správa v tej istej konverzácii je drahšia než predchádzajúca — za tie isté vety sa platí znova pri každom volaní. Dlhá konverzácia tak stojí neúmerne viac než niekoľko krátkych.
To isté platí pre kontext z dokumentácie. Ak agent do každej otázky priloží dvadsať najdlhších nájdených úryvkov namiesto troch relevantných, platí za osemnásť zbytočných zakaždým.
| Faktor | Vplyv na účet | Dá sa ovplyvniť |
|---|---|---|
| Počet konverzácií | priamy, lineárny | ťažko — je to úspech, nie problém |
| Dĺžka jednej konverzácie | nadlineárny | áno — orezanie a zhrnutie histórie |
| Množstvo priloženého kontextu | priamy | áno — lepšie vyhľadávanie, menej úryvkov |
| Voľba modelu | násobný | áno — ale pozor na kvalitu |
| Opakované rovnaké otázky | priamy | áno — cache |
Čo s tým ide reálne spraviť
Prvá vec, na ktorú siahne väčšina ľudí, je lacnejší model. Je to legitímna páka, ale nie prvá — zhoršenie kvality odpovedí sa prejaví na eskaláciách a tie stoja čas ľudí, čo býva drahšie než ušetrené tokeny. Ako k výberu modelu pristúpiť, rozoberáme v článku o výbere jazykového modelu.
Účinnejšie je začať tým, čo sa do modelu vôbec posiela:
- Neposielať celú históriu. Staršie časti konverzácie sa dajú nahradiť krátkym zhrnutím. Pre agenta je podstatné, čo klient chce, nie doslovný prepis pozdravov.
- Posielať menej, ale relevantnejších úryvkov. Lepšie vyhľadávanie znamená kratší kontext a zároveň presnejšiu odpoveď — jediné miesto, kde ide kvalita a cena rovnakým smerom.
- Cache na opakované otázky. V zákazníckej podpore je veľká časť dopytov takmer identická. Odpoveď, ktorá už raz vznikla, sa nemusí generovať znova.
- Nepúšťať do modelu to, čo model nepotrebuje. Otázka „aké máte otváracie hodiny" nepotrebuje jazykový model. Jednoduchý filter pred agentom vyrieši časť dopytov za nulový náklad.
- Zvoliť model podľa úlohy, nie jeden na všetko. Triedenie a klasifikácia zvládne menší model; formulácia odpovede zákazníkovi si zaslúži lepší.
Monitoring: čo merať od prvého dňa
Bez merania sa optimalizovať nedá a chyba sa zistí až z faktúry. Minimum, ktoré má zmysel sledovať:
- Spotreba tokenov za deň, rozdelená na vstup a výstup.
- Priemerná dĺžka kontextu na volanie — ak rastie v čase, niečo sa hromadí.
- Náklad na jednu konverzáciu, nie len celkový mesačný súčet. Toto je číslo, ktoré sa dá porovnať s hodnotou, ktorú konverzácia prináša.
- Podiel eskalácií na človeka. Ak po zlacnení modelu vyskočí, úspora bola len presunutá inam.
- Rozpočtový strop a alert. Hranica, po prekročení ktorej príde upozornenie — a pri hrubom prekročení sa agent sám zastaví.
Ako to zarátať do rozhodnutia
Pri porovnávaní s ručným riešením sa oplatí počítať s celkovým nákladom, nie len s vývojom: jednorazová implementácia, mesačná prevádzka a čas ľudí, ktorý agent stále vyžaduje — dohľad, dopĺňanie znalostí, riešenie eskalácií. Metodicky k tomu ideme v článku o meraní ROI nasadenia AI agenta.
Konkrétne čísla sa medzi projektmi líšia natoľko, že paušálna suma by bola zavádzajúca — závisia od objemu komunikácie, dĺžky konverzácií, množstva dokumentácie a zvoleného modelu. Preto má zmysel odhad robiť až na konkrétnom zadaní, a v pilotnej fáze ho overiť meraním.
Zhrnutie
Prevádzkový náklad AI agenta je premenná položka, ktorú ženie hore najmä dĺžka posielaného kontextu, nie počet otázok. Najlacnejšie optimalizácie sú tie, ktoré skracujú kontext a odfiltrujú dopyty, ktoré model vôbec nepotrebujú — nie výmena za lacnejší model. A od prvého dňa treba merať spotrebu, mať strop a alert.
Ak zvažujete nasadenie a chcete si prejsť, ako by prevádzkový náklad vyzeral vo vašom prípade, ozvite sa cez nezáväznú konzultáciu alebo si pozrite naše riešenia v oblasti AI a automatizácie.