Чаму агенты AI спалююць бюджет, не завершаючы заданняя, і як іх зупініць
Дазвольце дазнаць, чаму агенты для вызова інструмента продолжаюць ціклізаваць, калі значэнне „готова“ не вялічыцца, куда ідуць выкарыстоўваны токены, і якія умовы зупнення є эфектывныяя лепш за простае падняць ліміты колькасці крокаў аб бюджэту.
Автонамны агент, які зламваецца, лёгкая да карання. Найбольшая проблема — гэты агент, які ніколі не зламваецца: ён продовжае вызываць інструменты, стварае на выгляд разумныя крокі, але ніколі не доходзіць да канца, паколькі таймер ресурса продавальваецца. У этой статыцэ раз’яснюецца механізм такага паведамлення, дзе зазвычай накапліваюцца ресурсы у агенте, які выйшаў з-пад контролю, а таксама конкрэтныя умовы зупінкі, якія гэта запобегаюць, ўпрымку да таго, каб можна было спроекаваць цыклы агентаў, якія знаюць, калі ўжо завершылі сваю роботу, а не пакладацца на большы бюджет для падрыхтавання непатрэбных витрачэнняў.
Разглядзім просты прыклад: апоўнаковы запуск без нагляду, які коштае 40 долераў і не дае нічога. Па стандартам работы агентаў гэта мелкія сумы; каманды рассказваюць пра неконтролюваныя запускі на ноччу, якія доходзілі да чатырохзначных сум. Важнае не ў велічыне сумы, а ў тым, што яна купіла. Агент не застряў і не створыў жадных адхылэнняў, на якія можна было б паскарыцца. Ён быў зайняты ўвесь час, працуючы над нічым.
Як выглядае агент, які выйшаў з-пад кантролю, у логах
Якщо ачыніце лог агента, які збіўся з курсу, рэдка колі знайдзеце стэк-трейс. Там напісана пра адпаведальнага працоўніка, які забыў, што саме мяў выконваць.
Агент ачыяе файл і падсумавляе яго, потым ачыяе той самы контэнт у іншай форматазіі і знову яго падсумавляе. Ён выканае пошук, але адказ не здаёцца яму цілком задовальным, таму ён зноў выканае запит, змініўшы калькі слова. Кожны крок, які рассматрываць окрема, ёсць правамерны. Самэ гэтая прычына змушае складна ўпазнаваць гэты патерн пры швыдкам пераглядзе: ніяны з крокаў не выглядае бяспрычынна некоректным. Процес проста ніколі не дае рэшання.
Чаму модель выбірае, калі ўсё готава
У такой працэвучасці є конкрэтная прычына, яку варта зразумець, якщо вы ствараеце або керуеце агентамі. Кожна адпаведзь модэлю, які выкарыстоўвае інструменты, такаму як Claude, заканчываецца прычыной зупнення, выбранай з короткага, фіксаванага списку. Аднарада Anthropic пра абароткаванне прычын зупнення охопляе калькі случаў; два з іх ёсць найважлівейшыя для цыклаў агента. Першая прычына сигналізуе, што модэль сачынае, што яго робота завершана:
"stop_reason": "end_turn"
Другая прычына сигналізуе, што модэль хоча выкліканы інструмент і продаваць роботу:
"stop_reason": "tool_use"
Цыкл агента — это звычны код прыемніка. Ён адправляе запит, выкананаеяе будь-які інструмент, які прасіць модель, адправляе рэзультат назад і павтараецца, пакуль модель не вярнёць end_turn. Нічога за межамі модэлі не адзначае, што задача завершана. Кожны раз модель сама выконвае гэты вызов, ацэнюючы, чы робота, якая ў ёй на даступе, здаецца завершанай. Існуюць іншыя прычыны зупінкі, такія як досягненне ліміту токэнаў выходу, але гэта перарывы, а не ацэнка таго, што задача выканана.
Гэты адзін факт поясняе весь неякс. Калі цэль занадта расплывчата, ўжо немагчыма з’ясаваць, чы модель яе досягла, завжды існуе ўсё што-небудзь іншае, што варта пераканаліцца, і цыкл продовжваецца, пакуль не втручаецца якаясь зовнішняе прычына, зазвычай паведамленне пра перапланавання бюджету. Чытайце пра проектаванні цыкла на рэвэлі, «Обмежаныя агентныя цыклы і надзеяныя шаблоны TypeScript для викорыстання з інструментамі LLM».
Някколькі гэтага ёсць
Існуе спакуса прыйміць гэта за адзін з функцыйнальных недагоўдаў адзінага конкрэтнага інструмента. Аднак болейшыя доказы паказваюць іншае. Даследжэнне RAND Corporation, створанае на аднойчых спытках з 65 апытнымі вучонымі-даночнымі экспертамі та інжынерамі, паказвае, што рэштацыя проектаў з іскуснай супервізіяй становіць пад 80 процэнтаў, што прыблізна удвое больш, чым у звычайных IT-проектаў. Гэтае даследжэнне стосуецца проектаў з іскуснай супервізіяй у цэлым, а не толькі спецыфічных агентаў, але циклы, якія працуюць без стварэння ценнасі, ўскладнююць такую тратаў у павсякдзенны жыцці. Яны ніколі не праказваныя ў ключовых працэсах конферэнцый; яны з’яўляюцца ў рахунках-фактурах.
Існуюць таксама большыя версіі гэтага апавядання. частае аналізаваное звястка рассказвае пра адну рекурентную петлю, якая за час сваей дзеяння спрацавала на суму пяцізначных цифр, прычаму ніхто не втруціўся. Гэтыя цифры не былі незалежна параболены, і будзь-якая подобная вялікая цифра заслуговае на скепсызм. Аднак механізм рэальны, і ён толькі зростае: тая ж петля, якая за апоўдні спрацавала на 40 долераў, за некантрольваны вякенд можа спрацаваў на 4 000 долераў.
Дзе накапліваюцца витраты
Калі аналізаваць неконтрольваныя витраты і паўставляць іх у адносе да таго, што аператары вялікіх флотаў агентоў адзвярцваюць, грошы зазвычай накапліваюцца ў тых жа калькама месцах:
- Безмежныя пошукі в інтэрнете. Кожная завантажаная стороніца і кожны павторны пошук маюць свой расход. Без ліміту такі безканальныя пошукі продовжваюцца, паколькі модель яшчэ спадзяецца, што можа існаваць яшчэ якісны джерела інфармацыі.
- Дорогія моделі для простых задач. Моделі высокага рангу коштаюць дорожэ, таму што воны краща аналізуюць данныя, але багато крокаў агента, такіх як перакантэнтацыя файлу, перагляд статусу чы абранае падзея, не выклікаюць такой потрэбы. Меншая модель можа выконваць іх за значна меншую цэну.
- Сюжэты, якія ніколі не заканчываюцца. Агент, які працуе в межах адной дугай размовы, кожны раз перапрацоўвае всю сваю накопленую історыю, таму сюжэт, які існуе вясны, стае дорожэ за кожны запит, нават які бы маленькі ён не быў. Кэшаванне запытанняў можа часткова зменшыць гэты эфект, якщо толькі ваш прадаўцы гэта падтрымляе, але контекст усё равно продовжвае растаць.
Нічога з гэтага ня ёсць экзотычным. Разам яны практыкуюць ся як забутая прыўязка, якая берае плату за кожны токен, а не за месцы. Чыбаў для структурнага аднараджэння таго, як гэтыя витраты нарастаюць, стаття па чымі вартасці агентных AI так сильна растуць дае болей дакладную інфармацыю.
Паспрабуйце парадксульваць умову завершэння, а не максымальную планку
Пасля дорогага выконання інстынктыўная рэакція — падняць ліміты колькасці крокаў чы витрачання. Аднак гэта зазвычай мае працоўны эфект, таму што вышэйшая планка проста дазволяе той самым застряглым ціклам працаваць дзяўна да таго часу, пакуль яны не стануць у суперскупніце з ёю. Насамперадзе дапамагае тое, калі ціклу даёцца можласць з’явіць, што працэс застаўся на месцы, і гэта — аднае пытанне з тым, чы розпрацаваў ён усе свае ліміты крокаў.
Разместыце лінію фінішу ў цэлі
Зафіксавайце, што значэнне „заканчана“ ўключаецца ў саму задачу, а не як дадатковы пункт. Інструкцыя на кшталт „вылечыце неўдалы тэст“ залишае простор для дадатковых задач, такіх як аптарганізаванне імпортаў чы пераформатаванне всіх файлоў. Формуляванне „Заставьце гэты адзін тэст працаваць, а потым заканчуйце“ задае чыткі канец, які модэль можа розпазнаць. Чым болей візуабельны крэтарыя заканчання задачы, тым лёгкае для модэля вярнуць end_turn у правы момент.
Зробіце рэзультаты інструментоў одназначнымі
Інформацыя ад інструментоў должна чытка паведамляць, чы задача была выканана ўспэшна чы ні. Неодназначны рэзультат спрыяе тому, што агент будзе прагаць зноў, а не розумее цэ гэта сігнал прыпыніць. Чыткія поля статусу і ясныя паведамленні пра адказы усуваюць неяснасці, якія спрыяють павторным спробам.
Разпазнавайце паўтарэння заместо пісання колькасці крокаў
Стацыянарны калькулятор пасоў — это простае з’яве. Той самы калькулятор можа перарваць правільную задачу, якая выконвалася 15 пасоў, на 11-му пасоў, тады как дазволіць цыклу з 2 пасоў витрачыць калькуляцыйны час на кілька додатковых, дорогіх вызоў пры тым, як ён нарэшце будзе запрацаваць. Набагато лепшы сігнал — це паўтарэнне: фіксаванне адразу заўважвае вызоўы да однага інструмента з ідэнтычнымі аргументамі, пры чым без паслядкаваў для задач, якія проста дужыя.
Дадзіце людскі пункт контролю і строгі захад проты неконтрольаваных витрачэнняў
Кожная задача, яка застаецца без нагляду на большы час, павінна мець момент, калі людзі пераканаецца ў стані працы. Автаматызаваныя механізмы нагляду дапамагаюць у гэтым. Напрыклад, GitHub-авы gh-aw предстаўляе механізм нагляду, які можна налаштаваць так, каб зупініць робочы процес як толькі його витраты перасягнуць заданы ліміт, у замест на тое, каб адпаведальнасць за выяўленне залишылася на тым, хто чытае рахунок. Такі механізм нагляду є абаронным ўстройствам, а не заменай належных умоваў зупінкі, але ён зменшуе накладныя виткі, калі всё інше не працуе.
Актыўнасць — гэта не праця
Найбольш абалоўваючы аспект неконтролаванага виконання задачы — гэта не ўзнакі высокых виткаў, а сама паверенасць у правільнасці дзеяння. Результаты роботы агента ніколі не маюць застерэжнасцей і ніколі не выказваюць неяснасцяў ў тым, чы робіцца якая-небудзь з задач дапамога. Агент стварае правдопадобныя крокі, пакуль якасьць зза межамі, часта людзі, якія цікавяцца нечаканым рахункам, не зупініць яго.
Урок заключаецца не ў тым, каб абсалютна не даваць доверы агентам. Ён заключаецца у тым, каб перестаць плутаць рух з прагрэсам, як у автаматызаваных системах, так і ў багатьох людскіх задачах.
Ключовыя выводы
- У цікле вызову інструмента сама модель вяршыць работу, вярнуўшы
end_turn; якщо у задачы няма відзначальнай канцовай точкі, яна можа так і не зробіць гэтаго. - Неконтрольаваныя витраты концентруюцца ў необмежаных доследжэннях, занадта великіх моделях для простых крокаў, постаўляючыся далей роўнамі і забутых запланаваных задачах.
- Падвышэнне бюджетаў або лімітав паказвае толькі затрымку тых сабе ж адказоў; узамен яшчэ чыткаяя визначаць завершэнне задачі.
- Вяртайце одназначныя рэзультаты інструментаў і выкрывайце павтаральныя ідэнтычныя вызовы інструментаў, а не пакладайцеся на лічбу крокаў.
- Для задач, якія працуюць без нагляду, суманавайце людскія пункты контролю з жорсткімі межамі витрачання.
Спаднія матэрыялы
- AI Agents vs. Agentic AI: A Practical Enterprise Deployment Roadmap — Дазвольце дазнайсца, як адзначыць разлік межаў AI-агентаў і систем AI агентных типа, а таксама як выкарыстоўваць структураваную схему для выбору шляхоў размешчэння, кантролю рызыкаў і планавання будучай архітэктуры.
- Chatbot vs AI Agent: What Actually Separates Them Beyond the LLM — Дазвольце дазнайсца, чаму рэальная разліка межаў чатботаў і AI-агентаў крыўціцца ў архітэктуре супакоўкавага системы — інструментах, планаванні і дзеяннях — а не самай LLM.