Novinky
AI agenti8 min čítania

Prevádzkové náklady AI agenta: tokeny, monitoring a ako ich udržať pod kontrolou

Pri rozhodovaní o AI agentovi sa firmy pýtajú, koľko bude stáť vývoj. Menej často sa pýtajú, koľko bude stáť každý mesiac potom. Pozrime sa, z čoho sa prevádzkový účet skladá, čo ho žene hore a čo s tým reálne ide spraviť.

Keď firma zvažuje nasadenie AI agenta, prvá otázka býva, koľko bude stáť vývoj. Je to pochopiteľné — je to jednorazová položka, dá sa naplánovať a schváliť. Otázka, ktorá sa kladie menej často, je, koľko bude agent stáť každý mesiac potom, keď už beží.

Rozdiel oproti klasickému softvéru je podstatný. Bežná webová aplikácia má prevádzkový náklad, ktorý je do veľkej miery fixný — hosting stojí zhruba rovnako, či ju používa dvadsať alebo tridsať ľudí. AI agent má náklad, ktorý sa mení s každou správou, a rastie inak, než väčšina ľudí čaká.

Z čoho sa účet skladá

Prevádzkový náklad agenta má tri zložky a každá sa správa inak.

Volania jazykového modelu. Toto je typicky najväčšia a najkolísavejšia položka. Účtuje sa podľa počtu tokenov — kúskov textu, ktoré do modelu vstúpia a ktoré z neho vyjdú. Vstup je zvyčajne lacnejší než výstup, ale vstupu býva rádovo viac.

Infraštruktúra. Server, databáza, fronta úloh, úložisko. Táto časť sa správa ako pri bežnej aplikácii a je predvídateľná.

Vektorová databáza a vyhľadávanie, ak agent pracuje s firemnou dokumentáciou. Náklad rastie s objemom dokumentov a s frekvenciou ich preindexovania, nie s počtom otázok. Princíp takéhoto riešenia sme rozobrali v článku o RAG a firemnej dokumentácii.

V skratke: Prevádzkový náklad AI agenta nie je „hosting navyše". Je to premenná položka, ktorá sa správa skôr ako spotreba než ako predplatné — a preto potrebuje strop a merania, nie odhad.

Čo skutočne ženie účet hore

Intuitívna odpoveď je „počet otázok". V praxi je hlavný faktor niekde inde: dĺžka kontextu, ktorý sa do modelu posiela pri každom volaní.

Agent si nepamätá konverzáciu sám od seba. Aby vedel, o čom sa hovorilo, posiela sa mu história spolu s novou otázkou. Ak sa posiela celá, každá ďalšia správa v tej istej konverzácii je drahšia než predchádzajúca — za tie isté vety sa platí znova pri každom volaní. Dlhá konverzácia tak stojí neúmerne viac než niekoľko krátkych.

To isté platí pre kontext z dokumentácie. Ak agent do každej otázky priloží dvadsať najdlhších nájdených úryvkov namiesto troch relevantných, platí za osemnásť zbytočných zakaždým.

FaktorVplyv na účetDá sa ovplyvniť
Počet konverzáciípriamy, lineárnyťažko — je to úspech, nie problém
Dĺžka jednej konverzácienadlineárnyáno — orezanie a zhrnutie histórie
Množstvo priloženého kontextupriamyáno — lepšie vyhľadávanie, menej úryvkov
Voľba modelunásobnýáno — ale pozor na kvalitu
Opakované rovnaké otázkypriamyáno — cache

Čo s tým ide reálne spraviť

Prvá vec, na ktorú siahne väčšina ľudí, je lacnejší model. Je to legitímna páka, ale nie prvá — zhoršenie kvality odpovedí sa prejaví na eskaláciách a tie stoja čas ľudí, čo býva drahšie než ušetrené tokeny. Ako k výberu modelu pristúpiť, rozoberáme v článku o výbere jazykového modelu.

Účinnejšie je začať tým, čo sa do modelu vôbec posiela:

  1. Neposielať celú históriu. Staršie časti konverzácie sa dajú nahradiť krátkym zhrnutím. Pre agenta je podstatné, čo klient chce, nie doslovný prepis pozdravov.
  2. Posielať menej, ale relevantnejších úryvkov. Lepšie vyhľadávanie znamená kratší kontext a zároveň presnejšiu odpoveď — jediné miesto, kde ide kvalita a cena rovnakým smerom.
  3. Cache na opakované otázky. V zákazníckej podpore je veľká časť dopytov takmer identická. Odpoveď, ktorá už raz vznikla, sa nemusí generovať znova.
  4. Nepúšťať do modelu to, čo model nepotrebuje. Otázka „aké máte otváracie hodiny" nepotrebuje jazykový model. Jednoduchý filter pred agentom vyrieši časť dopytov za nulový náklad.
  5. Zvoliť model podľa úlohy, nie jeden na všetko. Triedenie a klasifikácia zvládne menší model; formulácia odpovede zákazníkovi si zaslúži lepší.

Monitoring: čo merať od prvého dňa

Bez merania sa optimalizovať nedá a chyba sa zistí až z faktúry. Minimum, ktoré má zmysel sledovať:

  • Spotreba tokenov za deň, rozdelená na vstup a výstup.
  • Priemerná dĺžka kontextu na volanie — ak rastie v čase, niečo sa hromadí.
  • Náklad na jednu konverzáciu, nie len celkový mesačný súčet. Toto je číslo, ktoré sa dá porovnať s hodnotou, ktorú konverzácia prináša.
  • Podiel eskalácií na človeka. Ak po zlacnení modelu vyskočí, úspora bola len presunutá inam.
  • Rozpočtový strop a alert. Hranica, po prekročení ktorej príde upozornenie — a pri hrubom prekročení sa agent sám zastaví.
Pozor: Agent, ktorý sa v chybovom stave zacyklí, vie za jednu noc minúť mesačný rozpočet. Tvrdý strop a alert na neobvyklý nárast spotreby nie sú luxus, je to základné poistenie — rovnaká logika ako pri monitoringu automatizovaných procesov.

Ako to zarátať do rozhodnutia

Pri porovnávaní s ručným riešením sa oplatí počítať s celkovým nákladom, nie len s vývojom: jednorazová implementácia, mesačná prevádzka a čas ľudí, ktorý agent stále vyžaduje — dohľad, dopĺňanie znalostí, riešenie eskalácií. Metodicky k tomu ideme v článku o meraní ROI nasadenia AI agenta.

Konkrétne čísla sa medzi projektmi líšia natoľko, že paušálna suma by bola zavádzajúca — závisia od objemu komunikácie, dĺžky konverzácií, množstva dokumentácie a zvoleného modelu. Preto má zmysel odhad robiť až na konkrétnom zadaní, a v pilotnej fáze ho overiť meraním.

Zhrnutie

Prevádzkový náklad AI agenta je premenná položka, ktorú ženie hore najmä dĺžka posielaného kontextu, nie počet otázok. Najlacnejšie optimalizácie sú tie, ktoré skracujú kontext a odfiltrujú dopyty, ktoré model vôbec nepotrebujú — nie výmena za lacnejší model. A od prvého dňa treba merať spotrebu, mať strop a alert.

Ak zvažujete nasadenie a chcete si prejsť, ako by prevádzkový náklad vyzeral vo vašom prípade, ozvite sa cez nezáväznú konzultáciu alebo si pozrite naše riešenia v oblasti AI a automatizácie.

INTERFASE