Галоўная / Артыкулы / Эскаліруйце вузлы, а не задачы: шасьцях-рэвеньоўая лесць для каштоўкаў рабочага прайсупутку LLM

Эскаліруйце вузлы, а не задачы: шасьцях-рэвеньоўая лесць для каштоўкаў рабочага прайсупутку LLM

Чаму выбір между DAG і агентам на кожны заведчык падвышае вартасць LLM, і як лестніца эскалэйшнаў па вузлах з контрактамі, межамі і бюджетамі дапамагае залічыць іх у межах.

3248 слоў

Большынства команд, які ствараюць праграмныя ланцюгі на адміністрацыі большых мовных модэляў, пачынаюць з аднаго архітэктурнага пытання для кожной новай функцыі: чы гэта трэба запускать як фіксаваны DAG чы як автонамны агент? Гэта здаецца разумным падходам да аналізу дыяграм, але адпаведны ўтварэнне на рэжыме цэлага заведамства таямніча фіксуе выкалык самага ненадзейнага крока для всіх іншых крокаў. У гэтым артыкуле показана, як гэта выглядае, а потым прыведзена шасцях-рэвальвацыйная лестніца, па якой кожны вузол пачынае з самага дешавога можлівага рэжыму і паднімаецца толькі тады, калі явны контракт не выпанаў. До канца вы зможазеце раскласіць свае сопныя задачы „агента“, пазнакоміцца з тым, насколькі з іх ёсць дэтэрміністычныя, і задаць часткавыя межы для выкалакоў рэшты.

У всіх прыкладах выкарыстоўвалася продукцыя, якая выплёвае два заведамыя задачы: яна перакладае стандартныя форматы файлаў, а таксама запускае процесы обробкі файлаў з вхіднымі та выходнымі данымі, як у варыянце «адна кліка», так і через прыстрой, які стварае такі процес на адпаведнасць запыту, напісанаму простай мовай. Частка перакладу функцыонавала надзеямо. Але самэ ў частцы, якая караціцца процесами обробкі, постаўленае пытанне пра тое, чы робіць це за дапамогою DAG чы агента, заставалося актуальным, і пашто знадобілася большая частка года, каб усвядоміць, што сама гэтая прычына ёсць проблемай.

Выхадная пункт: класыфікацыя кожнай задачы з самага пачатку

Пачатковы процес стварэння кожнага процесу «адна кліка» быў методычны. Спачатку дзеялася аналіз практычнага выкарыстоўвання, пісалася спецыфікацыя, а потым чалавек выбіраў, чы будзе процес рэалізаваны як DAG, чы як агент.

Задачы без чыстаўків пераказваліся агенту

Задачы, які былі адзінакова прызначаны для абсалютна свабоднага рашэння, былі рэалізаваны як адзіны агент ReAct на LangGraph. Апэлляцыйным прыкладам была пашук работы на адварце. Пользователь заваношвае сваю адварцу, і система должна знайсці вакансіі, на якія варта прасіць, і створыць індывідуальную адварцу для кожной з яных. Це включае адварцы, напісаныя на кальколькох мовах, падбор кандыдатаў да вакансій на аднойчыну, якую не можа паказаць ператнашчэнне ключоўых слоў (выдзей з дому, склад каманды, ўсё, што включае работа ў кожны дзень, дыяпазон заробкі), і нарэшце створэнне індывідуалізаванага дакумента. Ніхто не можа заздалегідь сказаць, сколькі крокаў для гэтага патрабуецца, таму гэта выглядала як класычны прыклад для агента.

Задачы, якія легка працаваць, былі пераданы статычнаму DAG

Парадоксальна, прыгучая робота стала фіксаваным графам. Апэлляцыйны прыклад — пераклад відэа ў сабтайты: выявленне аудыя-тракту, запуск распазнавання мовы, разбіўка транскрыпцыі на часавыя сегменты, стварэнне файла з сабтайтамі. Нават додатковыя элементы можна пераказаць заздалегідь, напрыклад, практычнае выправленне транскрыпцыі для лёгкага чытання або пераконтрольванне, чыі фактычныя тверджэння ў прымове застаюцца правдзівымі. Паколькі кожна рашэнне можа быць прынятая ўсё раней, чым пачнёцца выконанне, весь граф можа быць накрэслены ўсё раней, чым пачнёцца выконанне.

Разбіўка здавалася логічной, і ёй было даўанае рэалізаванне. Проблема была ў тым, што витраты ніколі не зменшаліся.

Чаму податак на агентаў ніколі не зникае

Механізм, стоячы за плоскай крывой витак, є звычным, і самэ гэта якраз прычына, чаму його лёгка перакінуць.

Калі задача пазначаецца як „агент“, кожны етап у ёй выконваецца в межах ціклу агента і плаціць за сябе. Цікл ReAct можа выбраць дзеянне толькі тады, калі схемы яго інструментаў знаходзяцца ў вікні контэксту. Можна стиснуць кантакт, падсумаваць проміжны стан і адсортаваць отрыманыя дакументы, і команда зрабіла всё гэта, але мінімальны косцт на кожны раунд застаецца тым жа, адтуды што гэты мінімум – це блок схем інструментаў, які перадаецца занова ў кожны раунд. Таксама нельга проста даць агенту менш інструментоў, якщо хочаце, каб ён застаў гнучкім: прычына, чаму ён ўжо з самага пачатку є агентам, – гэта тое, што ніхто заздалегідь не ведае, якія інструменты патрэбны для конкретнага выконання.

Адзін з спосабаў — это прыказваць наявны субкантэнт апранатоў для кожнага заведамства. Це легітымны напрамак даследжэння, але ён выклікае патрэбу у ваходзячых ресурсах і трэбуе моделі, якая добра прыказвае. Узамест таго команда хацела чыгулёк, які можна было б часткова задаць: архітектуру, якойя вартасць залежыць ад спосабу ўстановкі, а не ад точнасці прыказчыка. Якшо вас цікавіць шлях прыказвання, процес прогрэсіўнага адкрыцця апранатоў для агентаў у масштабе дэталява гэта розглядае.

Перачытанне науковых працэў разам з месяцамі лог-файлаў з працы вынесла практычна просты заключэнне:

Нявернасць належыць да адзінаковых вузлаў, а не да цэлага заведамства.

Рашынак працаваць з DAG або агентам быў выявляўся для кожнага завдання окрема. Але завданне — гэта проста сукупнасць крокаў, і практычна ў кожным завданні, якое было класыфікавана як „агент“, большасць крокаў была цэлкам детерміністычная. Прыйняття рашынка на рэвэле завдання означае, што кожны вузел плаціць цену за найнепэўнейшы вузел у графе.

Якщо разбіць процес пошуку працы, то патэрн становіцься явным:

  • Для выкарыстоўвання структураваных поль з PDF-рэзюме не трэба ніякага модельнага аналізу.
  • Выявленне мовы, якой пользуецца рэзюме, таксама ўжо є механічным процэсам.
  • Пошук домашней адресы і расчытак часу паўтарнаго прыбыцья — гэта проста выкарыстоўванне аднаго інструмента.
  • Збір інформацыі пра вакансіі адбываецца за дапамогою API для працы.
  • Оцэнка таго, насколькі даная паслявыборка падходзіць данам кандыдату, выконваецца за дапамогою аднаго запиту да моделі, фіксаванага праграмнага запуску і без выкарыстоўвання інструментаў.
  • Толькі такы элемент, як "з’ясаваць, што самэўказаная каманда няўзгодна выклікала", не мае прыемлемага колькасці крокаў.

Гэты апошні элемент — це адзін вузол. Усё графа платіла цены агента-прадавца, каб яго обслужыць.

Шкала эскаліяцыі

Рашэнням было перастаць прыймаць рашэнні заздалегідь. За новым правілам кожны рабочы процес пачынаецца на самай дешавай ступені, якая можа працаваць, і толькі тые адзінлівыя вузлы, якія не функцыонуюць, пераходзяць на вышэйшую ступень. Існуе шасць ступеняў.

  • L0: толькі вызовы інструментаў, без LLM. Якщо запит можна задовольніць выключна за дапамогою дэтерміністычных операцый, модель не запускаецца. У продукцыі гэта ёсць існуючы швайны шлях, і янтарацельва застаецца окремай ступеняй. Косць — гэта проста вызовы інструментаў.
  • L1: статычны DAG з механічнымі вузламі. Настоямы граф з розгалужэннямі, але кожны вузел — це звычны код. Таксама без вызоў модэля.
  • L2: статычны ДАГ з галовкамі LLM адзін раз. Фармат графа не зменяецца, але дзеякі галовкі тепер запускаюць модель адзін раз, з вялікай мерой спецыфічнаю контэкстам. На практыцы галовка бачыць толькі свае прымесны данні: няма історыі кансэрвацый, няма глобальнага статаусу і, што важна, няма схем абыякіх інструментаў. На гэтым роўні модель паводзіцца як чыстая функцыя, а не як агент. Кост складаецца з O(n) вызоў, пры чым n вядома ўжо да пачатку выканання.
  • L3: цягі дапрацоўкі з межамі. Галовка L2 можа праказваць спробы протыкання контракту да фіксаванага максімуму N разоў. Контракт, а не модель, вяршыць пра тое, калі выходны результат ўзямлівы. Кост складаецца з O(n·N), і гэта таксама вядома ўжо да пачатку выканання.
  • L4: непразрачны ўзел стае пад-агентам. Узел, які не можна запрацаваць заздалегідь, атрымоўвае справжніяй цыкл ReAct, але яго інструменты обмежаны тым узелам, і ў яго є строгі ліміт крокаў. Ніхто не можа прыгадаць, сколькі часу ён запрацюе, і самэ гэта непрыгадванне ўскладніць стварэння чыткага ліміту.
  • L5: пачатак новага планування. Сам план быў некоректны, таму граф перабудовваецца. Гэта самы дорогі варыянт і яго следзьвець выкорыстоўваць рэдка.
  • Контракты, меры і бюджэты

    Толькі таксанамія была б проста кращым слоўнікам. Тры механізмы робяць гэты прыем практычным:

    • Контракты спрыяюць паляпэнню. Кожны узел адзначае форму прыемнага рэзультата, і толькі незусімны аналіз па гэтай інструкцыі можа стаць падставай для пераходу на вышэйшы ранг.
    • Scope выконуе ролю фактара, які робіць L4 доступным. Схемы інструментаў пад-агента знаходзяцца ў контэксте таго самога вузла і не праказваюцца нідзе іншыя пад час выканання, таму «падатак» за схемы плаціцца локальна.
    • Бюджэты ставяць меры для верхніх рэвэў. Кожны рэвэ вышэй за L2 мае максымальную колькасць спроб чы ўздоўжае, пасля чаго вузел альбо здаёцца, альбо пераходзіць да наступнага рэвэ.

    Практычны спосаб разумець гэта: кантракт адпавядае на пытанне «чы гэта даскладна?», scope — на пытанне «што можа бачыць і вызываць гэты вузел?», а бюджэт — на пытанне «скількі можа ён заплаціць за спробы?». Якщо хаця б адна з гэтых трох праблем няма, відпаведны рэвэ стае непрадбачальным. Чырпак падробней пра тое, як контролаваць ціклы на кшталт L3 і L4 у кодзе, пазірце bounded agentic loops у TypeScript.

    Праця праймарнай лінійкі перакладу

    Большасць варыянтаў ніколі не выходзяць за межы L1. Лінійка адбирае аудыя, працюе з тэхналогіямі распазнаўання мовы, дзеліець матэрыял па часавых меткі і стварае файл SRT, усё гэта без жадных вызоваў моделей. Потым выходны результат перакантролюецца па заданым стандартам: сэгменты не павінны перакрывацца, жадна лінія не павінна перасягаць ліміт симвоў, а швальнасць чытання — залічвацца нижэй за заданую грань. Тыпава відеа-запіс з чыстым аудыям праходзіць перакантроль, і для ўрабаткі патрабуецца толькі ffmpeg плюс адна процедура распазнаўання мовы.

    Калі адзін сэгмент наражаецца на парабулы ўжо ў частцы дужой дэльнай шырокасці лініі чы адчытнасці, толькі гэты сэгмент пераходзіць у L2. Там яго обрабоўвае адна модель, пры чым контэкстам для яе ёсць сам сэгмент і яго безпосереднія суседы. Полны транскрыпт, метаданы відеа і всі схемы інструментаў не праблекуецца ў запит, а рэшта структуры застаёцца некінавальным.

    L3 падкрэпляецца тэрміналогіяй. У тэхнічным докладзе, які супакоўваецца з гласарыем, перагляд тэрмінаў можа продовжваць не выканацца пасля аднаго толькі корэктыва, таму такі вузол можа доўнейша працаваць над своім выходам ровна два разы, пры чым перагляд па гласарыю вяршыць выбіранне моменту, калі рэзультат ўжо яе задовольняе.

    L4 з’являецца толькі ў аднам месцы: для перакананняся, што тэзісы, выказаныя ў докладзе, правильныя. Для гэтага трэба ведаць пошук, і ніхто не можа сказаць, сколькі саме пошукаванняя будуць. Такі вузел стае пад-агентам, чыяінструменты обмежваюцца пошукам і запрашэнням дадзеных, а колькасць яго крокаў таксавана. Працэс падготовкі сабтайту, який яго абрамляе, застаецца механічным.

    L5 раскідае ситуацыю, калі план з самага пачатку быў некоректны. Падазроумцем, файл виявляецца скрынкастам, у яком значэнне закладзена ў текст на экране, а аудыя є факультатывным. Жадна колькасць доўнейшага працэўвання з адзіннымі вузламі не дапаможа падтрымаць план, створаны на адной засадзе розпазнавання мовы, таму граф строюецца на адной засадзе OCR.

    Пашук работы па ступенях

    Гэты прыклад змёніў падход каманды, бо ён явна нагадваў агента.

    L1 абрабатвае больш функцый, чым чакалася: парсінг рэзюме, выявленне яго мовы, геокодаванне і расчытак часу паўтарнага прыбыцца, а таксама запрашэнне інформацыі. Усё гэта — звычны код.

    L2 адмініструець праблему падобнасці. Для кожной кандыдатскай вакансіі выконваецца адзин вызов модэлі, які вяртае структураваны рэйтинг па актуальныя параметры, пры чым ўсім контекстам служае кантактная інформацыя пра кандыдата та опис самай вакансіі. Гэта адпавядае O(n) вызовам дышчага модэлі без якіх-лебе схем адзінакоў, і гэта заменіла агента, які вырашаў задачу на основе таго ж спісу, перзапускаючы весь набор адзінакоў за кожны раз.

    L3 адмініструе перапісванне резюмэ, і тут кантракты пераходзяць з ролі засобу контролю витак у роль засобу контролю безпекі. Кантракт выклаквае, каб кожна заява ў перапісаным резюмэ была прыязначальна да аднаго первіснага дакумента, забараняе выдумванне будзь-якога работадавца чы року і встановляе максімальную дужыну. Якщо праект наражаецца на парабіянне гэтых правіл, яго дорабляюць, максымум два разы, пасля чаго цей цикл завершваецца. Гэта корыстны патэрн, які працуе не толькі ў аспекте витак: кантракт, який пераглядае походжэнне інфармацыі, ёсьць недорогім, дэтерміністычным засобам захоплення ад модэляў, якія прыкрашаюць кар’ерную історыю чалавека.

    L4 — це адзін вузел: дакладны аналіз команды конкрэтнай кампаніі і яе няўзабавных праграм. Па сваей прыродзе ён є безмежны, але обмежаны структурой.

    L5 актываецца тады, калі самыя катэгорыі не пасуюць. Уявіце фізика, які працаваець над ролямі у сферы квантывных фінансаў: аналізаваныя катэгорыі вакансый паслаба падходзяць да рэальнага досвіду кандыдата, і план падбору трэба перзаснаваць, а не толькі налагоджваць.

    Главны результат — задача, якая раней была класіфікаваная як праця агента, на самай працэ выявілася як праця, якая на 80% адносіцца да катэгорый L1 і L2. Гэта не пытка налагоджвання запиту; гэта прыводзіць цэлы процес працы на зусім іншую крывую витакоў.

    Што дае лестніца для продукту «файл-з файлам»

    Процесы працы з вводам і выходам файлав сильна перасягаюцца. Першыя 80% практычна будзь-каго двух процесаў выглядаюць майже аднакова. Аднак якасць, яку бачаюць корыстувальнікі, залежыць выключна ад застаўшыхся 20%, і гэтая частка змінюецца ў кожны раз. Гэтая ява — галузка адкастамізацыі: або інжынеры самі ствараюць деталі для кожнага завдання, і продукт ніколи не расте, або деталі працягваюцца, і рэзультат застаецца посереднім.

    „Лесвіца“ — это спосаб выйсця з гэтай пасткі. Адкастамізацыя все ж таки вядзецца, але ўсё гэта вырабляецца через рашэнняя пра падыгранне, якія кантролююцца контрактамі, а не часамі, якія витрачаюць інжынеры. Рэзультатам ёст тюнінг па кожным завданню без неабходнасці персональных зусілляў для кожнага з іх.

    Явным парадаграмам являюць агенты загальнага назначэння, якія пропонуюць Anthropic і OpenAI, якія, верагатэльна, выкарыстоўваюць структуру, падобную да гэтай. Гэтыя системы ўзначнены, таму гэта скорэй выводы, чым знанні, але логічныя прыпускі парадзейваюць, што вялікая частка ўсіх зусіль гэтых систем спрямована на стварэнне адносна стабільной структуры ў розных задачах, і у яных є значна большыя даны для гэтага. «Лесачка» досягае падобной структуры за счытком спосабу організаціі рабочага процесу, а не за счытком вялічзінных набораў дадзеных, таму являецца бюджэтным варыянтом той самай ідеі.

    Калі «Лесачка» не ўзначна

    Эты метод выклікаеся з падзячання, што можна стварыць значаменныя контракты. Якщо якасць выходных даных вузла можа быць оцэнена толькі чалавекам, то няма надзею на адгукцыю, і весь процес ператвараецца на згадкі. Кроме таго, гэты падход вымагае дапамогі спецыяльных механізмаў керавання; для практычна простага ланцоўка з двумя-трыма крокамі і малым об’ёмам дадзеных, адзін правільна настроены модельны вызов можа быць простым і дастаткова недорогім.

    Спачатку — найболей просты элемент

    Калі кожны рабочы процес прымеў файлы і вяртае файлы, слой обработкі файлаў знаходзіцца пад усім іншым. Кожны з вышэй описаных элементаў у канечнай лініі ператвараецца на ўсё бол механічны процес: ачыніць контейнер, выявіць текст, захаваць табелі недыскрэтнымі. У гэтым слое няма нічога непакойнага, таму оплата аналізу ў такім разе была б чыстай тратаю, а йго прагнозаванасць робіць яго явным першым элементам, які трэба выпусціць.

    Ён быў выданы як апэн-сорс Python SDK, опублікованы на PyPI пад ліцэнсам Apache-2.0 і можа выкорыстоўваться як сервер MCP унутрь Claude Code. Інсталяцыя адбываецца за дапамою адной команды з uv або pip.

    uv add convilyn          # or: pip install convilyn
    

    SDK перакладае документы у формат Markdown, перакладае зображэнні между 26 форматамі і пераранжоўвае сторункі PDF, усё гэта локальна, без неабязковасці наявнасці аднойчынкі і без доступу да сеті. Калі задача практычна вымагае від модэлю прачытання чаго-небудзь, такога як сканаваная сторунка, фота або аудыяфайл, данні перадаюцца на хоставануюяся хмарную службу, і самэль там пачынаецца нарахоўванне платаў.

    Эты разлік – это «рабочая лесць», выражаная через дизайн прылады, а не чарговую структуру. Вільны локальны шлях – это L0: калі звычны детерміністычны код можа завершыць заданне, ніякі модель не запускаецца, і роба пераходзіць на платны шлях толькі пасля таго, як недорогі спосаб з’явіўся неэфектыва. За прыказамі проекту, офлайн-канвертар не патрабуе акаунта, ключа чы розміру квоты і не надае тэлеметрычных даных; для паведамленняяў пра інсталляцыю та точны набор функцый кантролюйце актуальны файл README у рэпазітарыі, адколькі і тое, і другое можа змяніцца.

    Тэкучы статус двухэтапнага механізма

    У момент напісання тексту функцыяны працэйнага практыку і з’еднанняя для стварэння элементаў яшчэ стабілізаваліся, у тым час як пад іхнім кераваннем велісь перабудовы, якія, за прыцэпленням каманды, будуць завершаны працай месяца. Прычыны гэтага вартая таго, каб яе скопіювалі: краща адклаць інжынерны механізм працэйнага практыку, які вядома ўжо на шляху да замены, чым просуваць яго і два разы перенасляджваць корыстувачаў.

    Існуючыя тэхналогіі і супаўзеленыя працы

    Ні адна з окремых частак не ўжо новая, і кожная з яных вяліка частка ўжо была описана ранейш. Аднак, як выглядае, не было опублікована самэ гэтае конкрэтнае спалучэння: падвышэнне рангу за кожны вузел, якое запускаецца на адпаведнасць з контрактамі, дыапазон інструментаў, які выкарыстоўваецца як фактор косту, дазволена рекурзіўная расширэння, але толькі ў межах бюджэту, пры чым усё гэта застосовваецца да заданняў перадачы файлоў з аднаго на іной. Наступныя працы пакрываюць усі этыя аспекты.

    Пачніце з простага і дадавайце складнасць толькі калі ёй трэба

    • Стварэнне эфектыўных агентаў, выданае Anthropic у грудзені 2024 года, адразняе рабочыя практыкі ад агентаў і рэкамендуе сама простая прыемная рашэння, дадаючы складнасць толькі тады, калі гэта неабходна. Лестніца адразняецца тым, што выкарыстоўвае гэты прынцып пад час выканання, узроўна за вузламі, а не раз на заданне пад час проектавання.

    Паўышайце ранг толькі таго компонента, яны не выканаліся

    • Стаття ADaPT, назва якой абазаваная на ідэі декомпанавання і планавання за патрэбай (Наследкі NAACL 2024), пачынаецца з абщага плану і далей рэкурсыўна декомпанавае падзаданне, толькі пасля таго, як яго выкананне не выйшла, залишаючы тыя часткі, якія выканаліся. Бна ўсё ближэй да опублікованага апісання механізма L4, хоча і не практыкуеся з урахоўванням косту.

    Контракты, правілы обмежанага вякна адзначэння проблем і ўскладнення ситуацыі

    • Тэоретычная структура для керавання агентамі LLM як структураванымі графамі, опублікованая на arXiv у красаве 2026 года, выкарыстоўвае статычны DAG з контрактамі выходных рэзультатаў для кожнага вузла, а таксама трывасты протакол адзначэння проблем: павтарэнне, локальныя паследнія змены і повна перапланавання, з чысткі сформульванымі правіламі ўскладнення ситуацыі. У яе падходзе ставится, што вузлы, базаваныя на моделях, павінны быць перакананыя па правілах контрактов, адколі тэплыя перакананні недастатковы, і што павтарэнне неідемпотентных крокаў выклікае патрэбу ў обмежаных бюджетах. У яе намерна не ўключана рекуррэнтная расширэння падграфаў, дзе і знаходзіцца L4.
  • Planavанне без зв’язку з задамі (Task-Decoupled Planning, TDP), якое рассматрываецца ў там самым артыкуле, дзеліць роботу на граф падцэлей-метаў, кожная з якіх мае свой вузькі контэкст, і обмежвае будзь-якае перапланаванне толькі той падзадачай, якая ў даны момент актыўна. У яму адзначаецца зменшэнне колькасці токенав прыблізна на 82%, што ўсё ближэй да опублікованых показнікаў, якія падтрымліваюць аргумент пра викорыстанне L2.
  • Меры вартасці інструмента як галоўны фактор

    • Skillflow задае структуру DAG у формате YAML, якую пераглядае двіжак, а не сама модэль. Його ввод/выход керуецца можлівасцямі: кожны крок отрымае толькі той контэкст, які ён запрашвае, а будь-які інструмент, які не падпадае пад умовы контракту, проста не выказваецца ў його схеме. Йго заключэнне, што невялікі контэкст, спецыфічны для паведамлення, дазволяе викорыстоўваць дешавыя модэлі, падтрымляе аргумент пра L2.

    Этапавыя лестніцы, якія вже выкарыстоўваюцца ў практыцы

    • PraisonAI выклікае функцыю эскалейвання ў сваём SDK для агентаў, якая включае чатыры стадіі: прымітны адказ без викорыстання інструментоў чы планавання, викорыстанне інструментоў на адчутковай основе без додатковых вызоваў модэля, адзін обмежаны вызов модэля, і нарэшце абсалютна автонамны цыкл з викорыстанням інструментоў, падагентаў та пераканання. Гэта фактычна L0 да L4, стиснутыя у чатыры крокі.
    • Рутэр эскалейвання NVIDIA NeMo Switchyard застаўляе той самы падход да выбору модэля, а не архітектуры: спачатку викорыстоўваецца слабейшы модэль, а калі сістэма выявляе стойкія проблемы, пераходзится на сильнейшы.

    Той самы падход ў іншых месцах

    • Агентныя шаблоны дизайна (systemdesign.one, красавік 2026 г.) выкарыстоўвае выраз "шчыглі паднесення" для апрантавання выбору между рабочым прайс-лістам і агентам, і рэкамендуе выбіраць наіпростейшы варыянт, які дазволяе выкарыстаць задачу.
    • Аднарадчык Vercel па рамкам ацэнкі AI-агентаў для прыменення (ліпень 2026 г.) прыменяе прынцып "наідешавейшы спачатку" для ацэнкі: запускаецца наідешавейшы тест, здатны выявіць даную несправнасць, і паднесенне на вышэйшы ранг вядзецца толькі тады, калі такі тест структурна не можа выявіць проблему.

    Ключовыя выводы

    • Рашэнне "DAG чы агент" для кожной задачы дапамагае кожнам кроку падкрэпіць найболей неясны крок.
  • Незменным выкалкам ціклу агента є блок «інструмент-шыматак», які перадаецца ў кожны раз, і якога не можа падчыніць стисненне історыі.
  • Пачніце кожны вузел на самам дешавым рэвэлі і перейдзіце на вышэйшы рэвэл толькі у разе невялікага, чыста выражанага контракту.
  • Закрасьце шыматакі інструментаў толькі для вузла, якому яны патрэбны, і задаце кожнаму рэвэлу вышэй за L2 жорсткі бюджет.
  • Можна спакульваць, што большасць «агентных» завантажэнняя будуць у значным ступені детерміністычныя пасля ўскладнення; у прыкладзе пошуку работаў адпаведна 80% было на рэвэлах L1 і L2.
  • Спаднёю літэратура