Галоўная / Артыкулы / Чаму агенты AI для працэвыкання неяўна збываюць і як выловіць некоректныя адпаведзі

Чаму агенты AI для працэвыкання неяўна збываюць і як выловіць некоректныя адпаведзі

Аналіз дванаццаць агентаў штучнага інтэлекту для вырабоцтва паказвае, чаму правдападобны некоректны выхід являецца справжнім спосабам абякання, і якіе правілы проектавання дапамоглі тым, што засталіся, заставацься корыстнымі.

1816 слоў

Найбольшая небяпека для агента ІІ ў вырабоцтве — гэта не збой чы прахід часу. Гэта адпаведзь, якая выглядае правільнаю, праходзіць усі перагляды стану і ў той жа час є некоректной. У прыкладзе, який паказана нижэй, рассказваецца пра маленькую компанію з разрабоцтва програмнага апарату, якая за адзін квартал запусціла у вырабоцтва дванаццаць агентоў, але залишилася толькі з трохіма; у ям таксама пояснюецца, што адзеліла тых, хто перажыў, ад рэшты, ёб тваю маці, каб вы моглі запрацаваць над аблокацыяй пры выкананні роботы.

Команда, інструменты і основныя правілы

Компанія была B2B-підпрыемствам у сфере SaaS, у якой працавало або чатырохдзесят чалавек, у тым дзевяць інжынераў; гэта не была науковая лабораторыя. З 6 студзеня па 27 марца 2026 года команда запусціла дванаццаць агентоў. Тые, якія працавалі ў репазітарыі коду, функцыонавалі на Claude Code; іншыя былі індывідуальнымі агентамі, створанымі на базе API Anthropic і розмешчанымі за дапамогою маленькага внутраняго сервісу, так што кожны агент меў аднаковы журнал аудыту і аднаковы механізм выключэння.

З першага дня был застосаваны два правіла, і оба виявіліся кориснымі:

  • Кожны агент фіксуе кожную дзеянне ў канале аудыту, уключаючы дзеянні з правамі толькі на чытанне.
  • Будзь-хто з команды можа выключыць будзь-каго з агентоў у будзь-яй момант, без падтрымкі і без заявкі.

Успех быў визначаны спецыяльна строга. Агент лічыўся успешным толькі тады, калі ён продаваў працаваць пасля трыдзяці дней, і хтось пратыміўся, калі пропанавалася яго выключэнне. Показнікі выкарыстоўвання лёгка можна завышыць за дапамогою новасці; людзей, якія захопляюцца інструментам, на якім яны павяржаюцца, нельга легка падрабіць.

Рэйтынг: трое агентоў працавалі, дзевяць выключаны

На канец квартала ўсё яшчэ працавалі трое агентоў:

  • апісчык опису запрошэнняя да з’еднання
  • падрабнік для падготовкі заявак на падтрымку
  • збірач інформацыі пра інцидэты

Дзевяць з іх было выключана за месяц: аўтаматычны пераглядач коду, адпаведнік на запытанні з аналітыки, бот для апдэйту завыскаў залежнасцяў, прыстрой для кварантінавання нестабільных тэстаў, адпаведнік на электранявіны клёячыхся, канвертар зь нотатак з сэсій у тыкеты, апдэйнер дакументацыі у вікі, прыстрой для адпаведзення на анамаліі логаў і публікатор чынніка зь змянамі.

Прамт пра захоўнікі, які не дапамог

Як і большасць команд, гэтая таксама пачала з прамта пра захоўнікі, запісанага ў системны прамт кожнага агента, які прыказваў модэлю вызнаваць неяснасці, ухілляцца ад непераканальных значэнняў і цітаваць джераг для кожнай цифры:

If you are not confident in an answer, say "I don't know" and stop.
Never state a value you cannot verify from the tools available to you.
Cite the source of every number you report.

У практыцы гэтыя інструкцыі практычна не мелі адзначэння, і прычына гэтага ёсць найважлівейшы урок усіх випробаванняў. Гэта детальна расказана ў аналізе неудачы нижэй.

Правы ўтвараліся таксама аберагліва: кожны агент з самага пачатку меў толькі права на чытанне. За першы квартал чатырох агентоў прабавілі да праваў на запіс. Трох з гэтых чатырох пазней былі выключаны.

Што мелі спакойныя агенты ў спадчыне

Автар апісу запрошэння да з’еднання

Цей агент, які працаваў у Claude Code, могаў чытаць разлік і супаўзяныя проблемы, а пасля пісаць апіс у тэле запрошэння да з’еднання. Інжынер рэдагаваў яго і з’еднаў. Ён обрабоўваў прыблізна 35 запрошэнняў да з’еднання ў тыдзень, і апісы выходзілі кращымі, чым тые, якія інжынеры пісалі вручную, главна таму, што вымучаны разработчык у канцы дня часта пісае „вылечыць баг“, тады калі агент не вярочваецца.

Автар прапозыцый для сортавання падтрымкі

Гэты агент чытаў кожны прыйшоўшы заявкі, ставіў атрыбут і прабываў напісаць адпаведзь у вачынку як внутранюю зметку ў сэрвісе падтрымкі. У яго не было можлівасці нічога адправіць, ніколі. Апошнія 60% яго проектаў выходзілі пасля лёгкай рэдагавання, а сярэдні час першай адпаведзі вырастаў з трохо больш чым чатырох гадзін до адносна восьмідесят минут.

Збірач контексту інцыдэту

Калі будзь-яе паведамленне прызывала каго-небудзь, гэты агент публікаваў роўна адну паштовую зметку ў канале інцыдэту, якая мела тры найсвежэйшыя версіі з пазначкамі часу, змены ў канцэнтрацыі бягаў за кожным сервісам і лінкі на падобныя інцыдэты за празьнейшыя дзевяносто дзён. Ён не выконваў жадных дзеянняў і не праставляў діагназу; ён проста збіраў панелі керавання і лінкі, якія інжынер, які быў у режыме чату, інакш адкрываў рукамі. Цэ быў наіменш сложны агент, якій стварыла команда, і той, якога команда цэніла найбольш.

Структура агента, які ўпэўненна мыліцца

Па паперы, агент для аналізу быў найкраща спроектаваным з дванаццаці. У яго быў доступ да копіі для чытання, ручна напісанага документа з схемай у сваём контексте і інтэрфейсу Slack; яго мета была адпавядаць на запытанні, касаючыся показначыкаў, ўбліжкі каманды з обробкі дадзеных не перываліся дваццаць разоў на дзень.

3 лютага хтось запытаў яго пра ўсёвековы дохад. Ян стварыў запыт, які з’еднаў замовленні з платежамі, пры чым рядкі з вярненням грошаў спрацаваў як пасябныя сумы. Рэзультат быў пра 12% завышаны, але цэлкам правдападобны: велічына была правильная, тэндэнція з недзеўы на недзею таксама, а падышча ў сезоне пасля заканчэння акцыі ў студзені таксама была видна.

Гэты завышаны показнік з’явіўся у пастаце з метрыкамі за панедзелак, а потым і ў наступных двух пастанцях за той жа панедзелак. Адхылэнне стала явна толькі 24 лютага, пад закрыццем звітнасці за студзень, калі загальная сума фінансавага аддзелу і загальная сума агента не паспадзяліся.

Паглядзіце, чаго не сталася прыбліжна за тыя тры недзелі. Не было жадных адхылэнняў, жадных паведамленняў пра проблемы і жаднага росту затрымкі. SQL-запыт быў правільны, рэкорды былі отриманы, а агент наводзіў джерэлу даных абоўсюды так, як таго было трэба. Традыцыйныя методы манітарынгу існуюць для выявлення систем, якія перестаюць працаваць, а гэтая система ніколі не перастала працаваць.

Осё гэта якраз там, дзе праблемы з інструкціямі для захоўнай рамы выступаюць. Інструкцыя казаць "Я не ведаю" калі є сумневы працуюць толькі тады, калі у моделі є власны сигнал пра свою нэпакойнасць. У гэтым случыку модель не была нэпакойная; яна проста памылілася. З зовнішняй стороны, калі чыглёва ўпэўнена ў сваей памылцы, гэта неразлічна ад таго, калі яна правая, таму інструкцыя не можа гэта адфільтраваць.

Вылазыць ўжо адно корыстнае загальнае заўважэнне: з’еднанне, якое тылу незменнае зменшае знак або колькасць рэядоў, ёсць класычныя баг у аналізе для людзей таксама. Разлік у тым, што людзкий аналітык зазвычай мае уявленне пра тыя цифры, якія будуць перакантролюваны фінансамі, тады калі агент не мае нічога прынцыповага ў супрацоўцы, як толькі вы для яго гэта не створыце.

Калі правы агент ігнаруецца

Автаматызаваны рэвізор коду парадксальна спачатку зазнаў неудачы, якой большасць каманд не чакала: ён не быў некоректны. Кожны запрос прынятнага коду атрымваў або чака 40 яго коментароў; большасць з іх мела падставы, а частка з іх была складаная ў дробныя прытэры гэтыму чыстаку або стылю распрацавкі памилак.

Чэрез тры недзелі інжынеры пачалі рашаць яго коментары, нават не чытаючы іх. Потым ён выклікану сэрьёзную проблему — запыт без фільтра тэнанта, і гэты коментар быў заглушаны сярод 38 прытэра стылю. Чалавек знайшоў баг у працэсе тэставання чырвоны дзень пазней. Рэвізор быў правы, але чрозмерная колькасць коментароў знішчыла яго сэнс.

Чаму дзевяць прыбораў было выключана

Неудачы мелі чыстую структуру:

  • шасць далі впэўненыя, але некоректныя рэзультаты
  • два далі рэзультаты, якія ніхто не чытаў
  • адзин быў выключаны, таму што ніхто не мог з’ясаваць, чы ён вообща каштуючы ўсё

Правіло дизайну: зупыніцца на адзін крок даўжэй, чым людзь

Тры выжылія агентаў маюць адну спольную характэрыстыку, і яна не ў модэле, запросе чы рамцы. Кожны з іх зупыніцца на адзін крок даўжэй, чым людская дзеянне. Яны ствараюць праект, апытаку чы скупку контэксту, а чалавек выкаанае фінальны крок. Выкананне гэтага крока змушвае чалавека прачытаць роботу.

Кожны агент, які быў закрыты, або дзеяў самастоятельна, або стварыў выходны матэрыял, які ператворыўся на дзеянне без рэальнага адгуку. Агент для аналізу ўсёлякі чытаемы прыклад: у яго воабшта не было права на збір дадзеных, пры тым яго рэшэнні безпасова прайшлі да бізнес-рашэнняў через людзей, якія ў яго верылі.

Рэзультатныя правіла простыя. Дазвольце агентам складаць матэрыял; не дазвольце ім кераваць фінальным крокам, калі памылка стае рэальным наследкам.

Этыя межы не ўскладнення, стосаваныя да можлівасцей модэлю, і аднаватыя версіі модэля яе не знікамуць. Оажылася тут пра выяўленне. Тыповая памылка агента — гідны ўважэння адпаведзь, а не збой, і большасць команд распаўсюджаныя мало інструментоў для выявлення такіх гідных адпаведзей, якія ў рэальнасці некоректныя.

Косцт не быў ніколі прычынай ускладнэнняў. Усе дванаццаць агентоў за квартал выкарысталаўы трохі менш чым 900 долераў на токены. Скарочаным ресурсам была людская увага.

Тры змены, якія вы можете здзейсніць за гэты тыждень

  • Перад запускам задокументаваць, як можна выяўіць адпаведзь, якая ўпэўненна некоректная. Не тое, як вы зазначыце збой, а тое, як вы зрозумеце, што рэзультат некоректны. Якщо вы не можете напісаць такое рэчы, агенту следуе толькі прадстаўіць проект, а не дзеяць.
  • Рэгулярна параболка кожнага числа, якое генеруе агент, з другым источнікам за паведамленым графікам. Автаматызаваная ўжо тыдневная параболка з фінансавымі даннымі могла бы выявіць памылку ў доходах восьмага дня, а ўсунуць яе патрэбна была бы толькі частка дня.
  • Даўайце рэзультаты работы агента там, дзе люди восьвятуюць увагу, і обмежыце ў колькасці тое, што там ёсць. Абсалютна новы канал часта застаецца непазначаным, а стена з чатырохдзесят каментаў працягваецца праз вочы, тады як толькі калька сфармаваных каментаў фактычна прывлекае увагу.
  • Зверце лік з другой крыніцай

    Параўнайце лічбу агента з бухгалтарскай кнігай і спыніцеся, калі разрыў большы за паўпрацэнта або адну грашовую адзінку.

    const reconcile = (agentRevenue: number, ledgerRevenue: number) => {
      const delta = Math.abs(agentRevenue - ledgerRevenue);
      const tolerance = Math.max(1, Math.abs(ledgerRevenue) * 0.005);
      return { ok: delta <= tolerance, delta };
    };

    Гэтая праверка, а не манітор падзенняў, павінна клікаць чалавека.

    Ключовыя выводы

    • Можлівы некоректны выхід даных, а не перыяды зупінкі, — гэта спосаб абяцкі, на які трэба зважаць пад час проектавання; стандартны монітарынг яго не зможа выявіць.
    • Інструкцыі ўсуперш цэнтры з адпаведнасцю не могу выявіць памылкі, пра якія модель не ведае.
    • Доступ толькі для чытання — гэта не тое ж сама, што безнебяжны: выхід даных, які вплывае на прыняттыя рашэнні, фактычна ёсць дзеяннем.
    • Інтэнсытэт сам по сабе ёсць адна з форм неякоснасці; праві сігнал, заглушаны шумамі, не мае жадных цэннасцей.
    • Корыстны тест для будзь-яга агента — гэта запытанне, чы робіцца хто-небудзь працоўкам, якшо яго выключыць завтра.