Схема павяровых рангаў канцэпцый інжынерыі AI і моменты, калі яны маюць значэнне
Дазвольце дазнацца, якія канцэпцыі інжынерыі ШІ вялікага масштабу адначынююць, чы рэчысць система ўзагалі працуе, якія з іх маюць значэнне пасля стварэння для прыменення ў рэальных умовах, а якія можна зачакаць.
Спісак іменніка рассматрывае ўсе двадцать пунктав як эквівалентныя, хоча на самай працэ ўсе яны такімі не ёсць. Шасць з іх вялікай меры вплываюць на тое, чы робіцца ваша система функцыйнаю ўзагалі. Јшчэ семь становяцца значнымі, калі вы пачынаеце ствараць ўсё для прыменення. Пасляпэўныя семь – це тыя рэчы, якія вы мусіце ведаць пад час размовы, але якія можна без небяга адкласты на год на пазнейшэе глыбокае вучэнне; і, на дзякую, саме яны часта становяцца предметам вучэння ў вільны час.
У наступным апісе рассматрываецца тое ж самае, але да кожнага панявання дадаюцца тры элементы: што ён на самай працэ дае, у які момент ён становяцца значным, і спосаб пераканацца, чы вы справжнім чынам яго розумеце, а не проста ведаеце тэрмін.
Саме перакананняя є тымі, на якія трэба зважаць. Большасць людзей усвядомляюць, што месяцы працавалі над тым чы іншым тэмам, толькі калі прабуюць першы раз поясніць яго вогулом.
Раганак 1: Шэсць элементаў, якія вялікай меры ўплываюць на працэсаванне вашай системы
1. Эмбеддінгі і вектарны пошук
Што гэта дае: Практычна ўсё, што стосуецца выкарыстоўвання дадзеных, залежыць ад гэтай концэпціі, а яе неправильнае застосаванне водзіць да проблем, якія ніколі не выдаюць парадоксу.
Перакананне: Два модэлі эмбеддінга ствараюць вектары размерам 1024. Паспраўце паводзкі, чаму класыфікатор, натрэнаваны на выходныя даны ад однаго з модэляў, будзе продаваць некоректныя рашэнні, калі яму даюць вектары з другога модэля.
Якщо вы думалі, што адпаведнасць размераў вектараў ёсць пазнакай сумеснай працы модэляў, то гэта самая большая памылка. Кожны модэль эмбеддінга стварае свою сябеўную геаметрыю. Два разныя модэлі можу разместіць аднаковы тэкст у абсалютна разных месцах у прасторах, якія толькі збігаюцца за формай. Нічога ў вашай системе не паведаміць вас пра гэта.
2. Якосць выкарыстоўвання дадзеных, якая не ёсць тым самым, што RAG
Што гэта дае: Практычна вся якасць адказа ў системе, якая выкарыстоўвае пошук, — і практычна ніякой часткі гэтай якосці не дае сама мовная модель.
Перакананне: Укажыце тры моменты, калі процес RAG можа зазнаць неудачы ўсё раней, чым будзе запрашана мовная модель.
Адказы даюць функціі разбівання на часткі, стварэння векторных представленняў і їх ранжыравання. Якщо дакумент разбіць не там, гэдзе трэба, вы прымусіцеся адмахнуцца самэй рэчы, якая адпаведала на запитанне. Якщо вы вжываеце модель, навучаную не для таго домэна, вашы спеціялізаваныя терміны опиняюцца не там у векторнай прасторы. Якщо працэс ранжыравання праўільна не выконаны, система пошуку будзе вяртаць рэзультаты, якія є тэматычна блізкімі, але фактычна несутыкаемымі. Команды, якія думаюць, што у ўсіх проблемы з галюцинаціямі, на самай справе маюць проблемы з пошукам, і часта витрачаюць месяцы на налагоджэнне запитоў, прычаму не пераканаючыся ў гэтым раней.
3. Ацэнка
Што гэта дае вам: можлівасць з’ясаваць, чыі змяны даслужылі рэальныя палескі, што і ўражае разліку межы інжынерным падходам і простым здагадкам.
Перакананне: опісаць стандарты, па якіх вы адмацаваеце — сколькі є прыкладоў, звядзе дзе яны, па чым оцінююцца і хто пераглядае рэзультаты.
Якщо вы не можете даць конкрэтныя цифры, тады гэта не ўзлічэнне, а проста вражання плюс дэманстрацыя, якая з’яўілася працюючай у вядзеньні. Разумны пачатковы пункт — ад двухсот да пяціста рэальных пар «запит-адказ», выбраных з фактычнага трафіку, адмацаваных па кальку іменаваных параметраў, пры чым чалавек пераглядае частку рэзультатаў. Таксама важна знати, што якщо вы вжываеце модель як суддю, тады гэтаму суддзе таксама патрэбна ўлічэнне — гэта рекурзыўная проблема, якая є некамфортной, але нэвыхіднай.
4. Структураваны выхід і использованне інструментаў
Што гэта дае вам: Связь межа системай, якая генеруе текст, і системай, якая фактычна выконвае задачы.
Перакананне: Модель вяртае JSON, які не паспелаў працаваць за вашым шэмам. Трэба дакладна апісаць, што будзе рабіць ваша система далей.
Большасць людзей зупіняецца на фразе «мы спробуема знову», але самэль тут і пачынаюцься справжнія запитанні. Сколькі разоў трэба спробаваць, якая стратэгія відкладання спроб, і чы роўныму спроба знову включае памылку верыфікацыі, каб модель мела можлівасць выправіць свой сабэйны прынтак? Што будзе пасля апошняй няудачы — чы корыстнік побачыць поведамленне пра памылку, чы ж адпаведны, хоць і гіршы за якосцю, але ўжываемы адказ? Выклік інструмента па сутнасці ёсць вызывам функцыі за межой, якая можа ствараць халюцинаціі, таму ўсе стандартныя практыкі верыфікацыі недазволенага вхіднага даных прыменяюцца тут таксама строго.
5. Контроль вартасці і затрымкі
Што гэта дае вам: Разлік межа функцыяй, якія насправды выходзяць у працэ, і дэмаверкі, якія занікаюць чераз фінансавыя прычыны.
Перакананне: Указаць ныякшую вартасць за запит, а пасля пераказаць пяць спосабоў яе зменшыць удвое, распарадзіўшы іх па ступеню ўплыву кожнага з іх.
Варто маты пад рукою пяць спосабоў. Надсылайце простыя запиты дагэн дешавейшаму, меньшаму моделю замест адной стандартнай. Зберагаўце кэш адпаведзей на запиты, якія семантычна блізкія да тых, на якія вы вялічэ ўжо адпаведзь, а не толькі ідэнтычныя. Скасавайце або стисніце все, што вы дадзейце ў запит. Агрупавайце все, што не патрабуе жывой адпаведзі, у групы і запускайце ў фонавым режыме. А таксама скорачайце тое, што выдае модель, адтолькі ўсё ж таки токены, якія яна генеруе, зазвычай коштаюць больш, чым токены, якія вы надсылайце. Па данным Stripe, гэты месачы компанія заплатіла больш чым 7 мільярда долераў за OpenRouter — компанію, чыё основнае продукт практычна автоматызуе першыя два з гэтых спосабоў — што паказвае, што абласць перестала спрыятаць кантролю витакоў як да дробных деталяў.
6. Кантроль контэксту
Што гэта дае вам: Прыведжымая праця кансолькі, калі вхідны тэкст перасілае межы вікна контексту — ўсё гэта часта трапляецца пад час роботы продакшна, а майже ніколі — у дэмах.
Пераканаленне: Калі вікно контексту заповнюецца, што будзе адхілена і хто прыняў такае рашэнне?
Чыстая адпаведзь называе конкрэтную палітыку: спачатку адхіліць старэйшыя часткі тэксту, спачатку адхіліць часткі з найніжэйшым рэйтингам, падсумаваць середню частку або цалкам адхіліць запит. Абавяжучая адпаведзь — гэта колі фреймворк сам разбіраецца з гэтым, бо гэта зазвычай значыць, што якаясь важлівая інфармацыя тайна адхіляецца, і ніхто насправдзе не пераканаліўся, што самэ гэта.
Ранг 2: Семь прынцыпаў, якія вы выучыце пад час стварэння рэальных рашэнняў
Этыя аспекты становяцца значнымі, калі система запускаецца і з яёю пачынаюць взаімадзейваць рэальныя корыстувачы. Не ёсць нічога паганага у ўважнай ўваходзе ў іх ранейш, але ўважнае вивучэнне іх да пачатку першага ўровня прыводзіць да таго, што зусилля распалохваюцца не там, дзе трэба.
7. Запросы як версіяваныя артыфакты
Майстэрнае стварэнне запросаў прыклеквае значна больш увагі, ніж гэта заслуговае, тады калі інжынерныя аспекты, якія стосуюцца запросаў, застаюць празірнымі. Насамперадзе трэба реўістар, фіксаваныя версіі, можлівасць порэвняння запросаў і возможнасць вярнуцца да поперадней версіі, адколі запрос фактычна ёсць кодам, які потрапляе у працэйную среду без перакладчыка.
8. Стратэгія чанкавання
Разбій тексту на фрагменты фіксаванага размеру, разбій па сэмантычныя межы і дадзенне перакрыцэння між фрагментамі — гэта разныя компромісы между воспамінанням і тачнасцю. Правы выбор залежыць ад таго, як структураваны базовыя дакументы, а не ад таго, што рекамендуе які-небудзь нарадчык.
9. Переранжаванне
Звычны патэрн — спачатку отрыць шырокі, недорогі скорочаны список, а пасля працаваць над гэтым спискам з болей дорогім методам ацэнкавання. Адказаўка ад гэтага другога паслядоўнага крока, вероятна, ёсць найпашыльнейшая прычына, чаму процес атрымання рэзультатаў дае наследы, якія здаюцца майже правильнымі, але не цалкам.
10. Меры захоплення і введэнне запрошэння
Гэта выклікае патрэбу ў багатаслоўных заходах: дешавыя фільтры на пункце входу, дорожэйшыя пераканальнікі бліжэй да самага моделю. Будзь-які тэкст, який прыходзіць ад пользователя чыра з дасягліва вашай системы, трэба спрыяваць як потэнцыйна ворагоўскі вхідны дадзенні, а не як надзеяныя інструкцыі.
11. Магчымасць аблікавання для недэтэрміністычных систем
Тут вам патрэбны ўсёлякія следы, а не проста журналы. Насамэй важныя запитанні — якія часткі дадзенняў былі адзначаны, і якая версія запиту была актуальная, калі тры дні назад з’явілася конкрэтная паспалая адпаведь, і толькі деталі на рэвэле следаў можна на яныя адпавесці.
12. Выбор между стварэнням запитаў, адзначанням дадзенняў і ўточнэнням параметраў
Эта рашынка мае набагато большую значымасць, чым владанне якой-небудзь адзіной тэхнікай. Адчыяванне дае знаньні, тонкая наладка форм, прыемах і формата выходных дадзеных, а прампты абарачвае ўсё іншае, што можна кераваць без якога-небудзь з гэтага. Частая памылка — спробава вырашыць проблему, якая на самай справе є працэю адчыявання, за дапамою тонкай наладкі.
13. Циклы агента і выбір інструментаў
Адзіны агент, ужоўваны правяльна выбраным наборам інструментаў і циклам выканання з абмежэннямі, можа рашыць нейколькі разоў больш проблем, чым тыя, якія люди намагаюцца рашыць, вядучыся на архітектуры з кальколькомі агентамі.
Рэжым 3: Сямь прыемаў, якія варта адзначыць і адклаць
Для гэтага рэжыму дастатнька добра знаць слоўнік, каб могчыць выказвацца ў размове на гэту тэму. Глыбокейшае веданне можа чакаць, пакуль конкрэтная проблема не змусі ўважна да гэтага паглядзець, а для багато практыкантав такі момент ніколі не настае.
14. Оркестрацыя кальколькіх агентаў
Эта стая ў спісе ўсіх найбольш працягваная. Існуе вельмі великі масы паперакоў, якія аналізавалі, чаму гэтыя системы перестаюць працаваць пасля ўпрацоўкі, і рэгулярны вывод такі: надзвычайны трыбут коордынацыі і зростаючыя тэксы пакрыцча часта прыводзяць да таго, што ў большасці випадкаў іх працэсаванне є горшым, чым у аднаго добра спроектаванага агента.
15. Квантызацыя і оптымізацыя аддачы
Гэта мае вельмі важлівое значэнне, якщо вы самі храніце вагі модэлю, а практычна не мае значэння, якщо вы проста вызываеце API.
16. Внутрошняя структура Transformer
Механізмы атэнцыі, позыцыйны кодырацыі і іншы элементы архітэктуры з’яўляюцца ў інтэрв’ю значна чащэ, чым у повсякдзеннай працы. Цікавае для вучэння раз, але глыбокое розумеўце не змінюе значна таго, як вы будуеце системы.
17. Дистыляцыя
Гэта становіцца корыстным, калі у вас уже ёсць рабочая, але дорогая система, і вам трэба скасаваць витраты — гэта проблема, якую вы стварылі самі, а не тая, з якою пачалі.
18. Семантычны кэшаванне
Моцная тэхніка з рэальнымі недагадкамі: калі запыт працоўвае з кэшам, але є незначныя разніцы, вось і праблема — адпаведна адпаведь вярнуцца некоректная, прычому да яе ставяцца абсалютна правільная довера.
19. Графы знанняў і GraphRAG
Гэтыя методы даюць рэальныя прыбуткі, калі базовыя даны справды маюць структуру асоціяцый, але для ўсвоўвання гэтых прыбуткаў патрэбна значная дапамога ў складзе системы.
20. Налёгчэнне настройкі і семья технік RLHF
Гэта пераважна стосуецца команд, якія фактычна трэнуюць моделі, а не тых, якія ствараюць прыемлі на аснове вядомых модэляў.
Некамфортная частка
Якщо паглядзець на всі тры рэвэлі, можна зазначыць кальканняе.
Мнагаэйентная оркестрацыя, внутранія працэў канвертароў і формулюванне запытаў — гэтыя тэмы займаюць самую большую частку зусібоў людзей у навучэнні, і ўсе тры належаць да 2-й або 3-й катэгорыі. Там часом ацэнка, якосць выкарыстоўвання інфармацыі і контроль витакаў ёсць тым, што насправдзе вялікая мера вярнайцца таму, чы рэальная система працюе, але яны атрымваюць толькі частку уваги, галоўная прычына — ні адна з іх не стварае захоплюючай дэманстрацыі.
Існуе чыста прычына гэтага разліку, і яе варта сказаць проста, а не як крытыку. Тэмы 3-го рангу лёгкія для спрытку. Вы можете чытаць пра оркестрацыю калькуляў з участю колькасці агентаў пад час паехады на работу і пакінуць гэта з адчуткам, што чыглі ўжо чагосьці. На протыварож, ацэнка вымагае ад вас створыць ідеальны набір дадзеных, сперачыцца з колегай пра тое, што значыць «добра», і інодзе прыйняць тое, што ваша система ніколі не была настолькі сильная, як выглядала ў дэманстрацыі. Адна з гэтых дзеянняў є зручной. Іншая — тая, якая насправды дапамагае.
Як насправдзе выучыць гэта, а не проста скупіць інфармацыю
Пастка ў такім списку — спрыяць яму як праграме навучэння, яку трэба прачытаць. Чытанне дапамагае толькі распазнаць матэрыял, а распазнаванне зникае ў той момент, калі хтось задае дапаможны пытанне.
Две прычынкі дапамагаюць набагато лепей, чым сама толькі чытанне.
Спачатку створыце адно маленькае система з начала да канца, а потым намеравана яе зламайце. Направіце прыемнік дакументаў на тыя дакументы, якія вам сапраўды важны, і намеравана паспяшайце кожны ўзлок. Разбійце тэкст на вялікія фрагменты і старайцеся, каб якасць адпаведзей рухалася вниз. Адключыце прыстрой для переранкінгу і старайцеся разбіраць, што змяніцца. Падаўце системе спробу втрымкі прампта і старайцеся разбіраць, што яна выдадзе. Вікенд, пасвячаны такім эксперыментам, дае больш ведаць, чым месцачны час на чытанне, адтолькі ў рэзультате застаюцца спомнення пра конкрэтныя неудачы, а не абстрактныя вядомасці.
Паўторна пераканальніца: прыкольцавайте тую лексыку за дапамою рэалістычных запытанняў. Апранаванні, описаныя ў цім матэрыяле, створаныя на адповідачных запытаннях, якія фактычна з’яўляюцца ў практыцы, і рашэнне рэальных задач у стылі проектавання систем — гэта найшырэйшы спосаб раскрыць прасоў у вашам разумеўні, галоўная прычына — рэальныя запытанні часта маюць дадатковыя пытанні, і самэ ў такіх моментах поверхневае розпазнаўанне вяршыцца недастатнім.
Дзе я можу крыцься
Гэтыя рангі ўтвореныя на адповідачных суджэннях, заснованых на конкретныях системах, якія былі пераглянуты, а не на рэзультатах формальнага апранавання, таму чыстасцю будзе назваць іх західным арранжаментам, а не абсалютным.
Є два пункты, пры якіях варта адкрытаючы спрачывацца. Оркестрацыя калькольнікае агентаў знаходзится у 3-й категорыі часткова таму, што сяродзецкія дапамогі пра тое, як гэтыя системы функцыонуюць у практычных умовах, ўсё ж не ўтыманнія, і справжня, надзеяна парадка можа лёгка перасунуць яе вышэй. Внутрошняя структура трансфармера знаходзится нізка тут, таму што работа з моделямі AI стала ўсё бол дысцыплінай інтеграцыі, а не моделювання, і тыя, хто працуе безпосередні да самых модэляў, павінны падняць гэты пункт на калькольнае месца вышэй.
Пункт, пры якім варта найбольш адчынна заступацца, — гэта ацэнка на трохім месцы, і ёсць вагомыя падставы для таго, каб яе паставіць на першае месца. Без яе кожны іншы пункт у гэтым списку стае простаю здагадкай, адтуды што нельга паспрабаваць падняць рэзультаты, калі няма можлівасці іх вымерыць, і дужа мала колькасць команд, якія працуюць з моделямі сёння, можа насправдзе сказаць, чыя змены за минулы тыдзень паднялі чы стварылі проблемы.
Якбы вы хотелі перерасположыць гэты ранг, найцякавейшыя незгоды, верагчыма, адбываюцца на межы між 1-м і 2-м рангамі. Более корыстным ёсць адзначэнне, які пункт вы хотелі б падняць у рангу і што саме прынесла вам гэта змяна, а не стварэнне ўсё новага списку з двадцати пунктав.
Спадневана література
- Управлінне LLM-системай як суддзёй як жывойа системай вырабоцтва — Дазвольце дазнацца, як чатыроэтапны цикл жыцця Netflix — даныя з реальнага свету, навчанне па спецыяльным критэрыям, апатэнтна розгортка та постаўленая нагляд — дапамагае падтрымваць точнасць LLM-суддзі на великых масштабах.