

Generální ředitel společnosti Futurum Group Daniel Newman napsal na síti X: „AI je v současnosti využívána umělou inteligencí pětkrát více, než ji využívají lidé. Toto číslo se zrychlí na desetinásobek a pak bude stále vyšší a vyšší.“ Opírá se o graf společnosti Andreessen Horowitz (a16z), který vychází z údajů platformy OpenRouter. Podle něj spotřebovali agenti v srpnu 7,3 bilionu tokenů, zatímco lidé 1,4 bilionu. Agenti přitom lidi poprvé předstihli teprve o šest měsíců dříve. Je tu ale háček: více než 85 % tokenů agentů pochází z promptů uložených v mezipaměti. Agenti tedy převážně znovu čtou to, co už jednou viděli.
OpenRouter se sám označuje jako „přední brána a směrovací platforma pro modely AI“. Graf jejího vedoucího analýz Petera Walkera nese název „sedmidenní průměr využití tokenů na OpenRouteru rozdělený podle typu“. Uvádí, že od únorového bodu zlomu vzrostla spotřeba tokenů agentů čtrnáctkrát, kdežto u lidí jen 2,8krát. Klíče API platforma dělí do tří skupin: agentní, smíšené a lidské. Používá k tomu „sedmisignálové vážené složené skóre, které zahrnuje vstupy jako míra volání nástrojů, počet tahů, časování mezer a další“.
Levnější tokeny, ale drahá paměť
Podle a16z připadá na tokeny z mezipaměti téměř celý relativní růst spotřeby. Jejich zpracování stojí výrazně méně než zpracování promptu od nuly, musí však zůstat uložené v paměti. Společnost a16z, která do OpenRouteru investovala, to dává do souvislosti s rostoucí poptávkou po paměti s vysokou propustností (HBM). Modely ukládají kontext do takzvané KV cache, přičemž „KV cache přerůstá kapacitu HBM grafických procesorů“.
Stejný vzorec se objevil i v záznamech konzultační firmy zaměřené na call centra, která testovala model DeepSeek na pronajatých akcelerátorech Nvidia H200. Při zářijovém používání nástroje Claude Code jejími vlastními agenty „tvořilo 96 % veškerého vstupu opětovné čtení staré konverzace“. Spolu s daty OpenRouteru to naznačuje, že počet tokenů nadhodnocuje skutečný účet. Hardwarové náklady na paměť jsou ovšem zcela reálné.
Paměti je už teď nedostatek. Micron očekává, že se nedostatek RAM a úložišť v letech 2027 a 2028 ještě prohloubí a zákazníci budou platit víc než letos, protože výrobci pamětí upřednostňují HBM pro datová centra AI. Pokud se naplní Newmanova předpověď, že z pětinásobku bude „10X, 20X, 30X“, budou kupci počítačů soupeřit o paměť s ještě větším počtem agentů.
Zdroj: tomshardware.com


