Шэсць канцэпцый ШУЯ, якія падказваюць, што трэба пераканаліцца пры выборы адпаведнай адказы
Токены, акна контексту, тэмпература, галюціназы, RAG і агенты выясняюцца як засобы верыфікацыі, ўсё гэта дапамагае выявляць адыякваты, кантролюваць витраты і ацэніваць тверджэння пра продукты AI.
Вы даеце AI-асыстэнту адзін звярненне і атрымляеце апрануты кантакт, які ўключае графік, якога няма нідзе ў дакументе. Калі вы спытваеце пра гэта, асыстэнт перапрашвае і прасіць дастаць іншы графік. Чы рэч у тым, што не хватала інфармаціі, чы апрацоўка дакумента не выйшла, чы цячу проста выдумалі? Шэсьць основных канцэпцый, якія разумеюцца чераз рашэнні, на якія яны вплываюць, дапамагаюць заменіць запытанне «Чаму ён каламутзіць?» на тачна дыягностычная запытанне, а таксама спрыяюць контролю витакоў і ацэнцы тверджэннях постаўщыкаў.
Чаму скептыцизм — граматычны стандарт
Недаверлівасць да выходам ШІ ўсё частая, нават сярод тых, хто яго вжывае ўсё дзень. У апытнай перапытцы развіяўцаў Stack Overflow 2025 года 46% учаснікаў, якім была задана пытанне пра точнасць, сказалі, што не даверяюць выходам ШІ, тым часом як 33% даверяюць ім, з 33 244 адповедзяў (рэзультаты перапыткі). Чытайце гэта адзёрвана: тут фіксуюцца думкі развіяўцаў, а не памеры точнасці модэля, і гэта не ўзнакомлівае вялікага калекцыі населення. Аднак гэта адбівае рэальную напругу — людзі вжываюць гэтыя інструменты, але ўсё раву не веруюць у всё, што яны кажуць.
Пачніце з таго, што таксама рэтельна аднесіцеся да загалоўкаў
Тэксты пра АІ частаюць тым, што абяцкаюць, iшо выучэнне калькі тэрмінаў дапамагае стаць „перад 90% людзей“. Гэта звучыць як рэзультат даследжэння, але без падтрымкі рэальнага адзінства, гэта проста маркетынг у вадзе статыстыкі. Задайце сабе простыя запитанні: перад каму, як гэта мераваецца, з якімі учаснікамі, і дзе публікуюцься рэзультаты? Без адказаў, без вялікага калекцыі дадзеных, без статыстыкі — гэты процэнт не мае падстав. Гэта не значыць, што всія тлумачэнняя, якія даецца, ўсё ж такі некоректныя, і гэта нічога не сказвае пра намеры каго-небудзь; гэта проста значыць, што гэты цифра не мае жаднага значэння.
Знаўцоўство апісанняў — гэта пачаткова точка. Їх прыменэнне, выяўленне асаблівасцей і перакананне ў рэальных рэзультатах — гэта аднае складовыя, і жадная з іх не мераваецца праглажуючымі процэнтамі.
Той жа дысцыпліна паводзіцца і да обяваў пра тое, што адна запитанне можа заменіць цэлую команду, або што якісь інструмент у дзесяць разоў падвайшыць скорасць усіх. Запрашаюце конкрэтную задачу, базовыя показнікі, спосаб ўзняць іх та якія былі абмежэнні. Адна вражаючая дамастрацыя не може стварыць загальныя вынікі. Сильны загалоўка — гаразд; проблемы пачынаюцца, калі тверджэнне ўсё болей точнае, чым доказы, якія яго падтрымліваюць. Следзіце за тым, каб гід таксама паследаваў этым стандартам.
1. Токены: рэальны размер задачы
Токен — это единіца тексту, яку на самай працэ практычна обробляе модель мовы. Залежна ад токенізатора, токен можа быць цэлым словам, фрагментам слова, знакам пунктуацыі аб іншым фрагментам тексту, пры чым токенізатор прысвоюе кожнаму фрагменту числовы ID.
Няма фіксаванага правіла на кшталт «адзін слова = адзін токен». У аналізе токенайзерах Hugging Face описваюцца разныя падходы, укладаючы кодаванне пар байтов, WordPiece і методы, зв’язаныя з SentencePiece; тая ж самая фраза можа быть раздзелена абсалютна разнацьваючыся токенайзерамі. Мовы, не англійская, код і незвычны формат часта викорыстоўваюць больш токенав на слова.
Чаму гэта мае значэнне, становіцца ясным праз такой запит:
Калькі трох вопытаў клёянтав з’являліся чащэй за іншыя?
Сам запит ўсьмохнены. Але якщо для адпаведзі на ўпыт трэба прачытаць тыячы паведамленняў падтрымкі, то гэты запыт ёсць пахыбкай апраноўкі ў загальным вводзе. Як простая ілюстрацыя, а не як точны паказанні: 400 паведамленняў, кожна з якіх мае або близу 150 токенав, вялічынаю дадаюць 60 000 токенав яшчэ до будзь-якіх інструкцый чы іншага контэксту.
Таму важным пытаннем не ёсць дзейнае дужыня вашага запиту, а колькі матэрыялу система змушаная обрабоцаваць. Паколькі цены, час адпаведзя і ліміты контэксту зазвычай выражаюцца ў токенах, самэ гэта таксавана вплывае на косцы. Перад обрабоцай большога дакумента адзёрвайце павтаральныя падпісы на электронных паславаннях, нерелевантныя дадаткі і дублікаты записаў, якія не даюць жадных доказаў, застаўляючы толькі тое, ад чаго практычна залежыць адпаведзь.
2. Акна контэксту: што можа бачыць модель у адной запытке
Акна контэксту абмежвае колькі матэрыялу модель можа выкарыстоўваць у адной запытке. Інструкціі системы, історыя размовы, атрыбутаваныя фрагменты і любы іншы вхідны матэрыял спрацоўваюць з гэтага ліміту; спосаб разлічэння токенаў выходу залежыць ад моделі і API. Дасягнення Google па длігам контэксту паказваюць, як большыя акна дозволяюць працаваць з великіми колекцыямі тексту і іншых медыя-матэрыялаў.
Адзьёмленае дакумент не абавязкова значыць можлівасць надзеянага выкарыстоўвання ўсіх актуальных дакументаў. У даследжэнні 2023 года пад назвай „Загубленыя ў середзіне“ тэставалася адпаведнае рашэння запытанняў на аднойчыну большай колькасці дакументаў і выкарыстоўванне інформацыі з формату ключ-значэння, і было выявлена, што для пераглядзелых модэлей точнасць часта падсыхала, калі актуальная інформацыя знаходзілася ў середзіне дужа дугог уводу, а не бліжэй да пачатку чы ў канцы. Лепш спрыятаць гэта як історычныя доказы тых конкретных эксперыментаў, а не як показнік для сучасных модэлей, пры тым урок аб неабходнасці пераканальнага перагляду застаецца актуальным.
Продукты чату таксама рэдка карацца так, як прапано ў іх інтэрфейсе. Калі размова перастаёна паверхню вікна, прыложэнне не зобов’язана проста выдаліць старэйшыя паведамленні; ёна можа замест таго стварыць падсумак, выбраць чы адзьёмліць ранейшы матэрыял. Тое, што вы бачыце ў історыі чату, не являецца надзеяным атласам таго, што прабачаецца да модэлі з кожным вызывам.
У практыцы:
- Для дзейнаў, які трываюць даволі дазго, неабходна зберагчы короткі, чытальны кароткі опис з ныямі трэбованнямі та рашэннямі, і павтарыць яго, калі гэта неабходна.
- Калі вынік залежыць ад адного фрагмента, папросіце асистэнта цитаваць або знаходзіць гэты фрагмент пры вынесенні выніку.
Большыя вакна даюць системе прастор для работы; але гэта не паводзіцца доказам таго, што система выкорыстала правільныя доказы.
3. Тэмпература: кантроль над разнаўтнечасцю, а не над правдой
На кожным кроцы генеравання модель оцінюе кожны можлівы наступны токен. Тэмпература перакаштоввае распад верыятнасцей, які викорыстоўваецца для выбору з гэтых оцэнак: низкія значэння концентруюць верыятнасць на найбольш правдападобных варыянтах, тады як высокія значэння распрадзеляюць яе між большай колькасцю варыянтаў. У дакументах Hugging Face тэмпература описваецца разам з іншымі параметрамі кантролю генеравання, такімі як выбіранне токэнаў па прынцыпе top-p і алгорытм жадання (greedy decoding).
Парадоксальны ўскорэннік — „низкая температура значыць точнасць“. Аднак гэта не так. Якщо найбольш верагодны адказ моделі ўскладнены, зменшэнне розмаўтасці не можа запрацаваць недастатковы факт; гэта толькі робіць той жа самы прынт болей стабільным. Падвышэнне температуры таксама не гарантуе кращых ідэй, толькі болей розмаўтых.
Две протыярыстые задачы паказваюць разлік. Стварэнне пяці імен для вымышленага кафе выгодная з розмаўтасцю. Выкарыстоўванне номераў рахункоў-фактур выгодная з стабільным форматаваннем, але ці фактычна номеры павінны паспаўляць з рэальными рахункамі-фактурамі, і тут температура не мае ніякага значэння.
Спрыткуйце тэпературу як адні з параметраў, з якім можна эксперыментаваць, і адмаўляйце яго на аднойчыну з тым, калі насправды патрабуе задача. Для выкарыстоўвання дакументаў лічыце некоректныя і відсутнія поля; пад час генеравання ідэй спытуйце, чы розглядваныя ідеі ўзаемна прыемныя і справжньа розныя. Для пераканальнасці та правильнасці патрэбны адзінакавыя перагледы.
4. Галюцінацыя: выходны матэрыял, які пераходзіць межы сваіх доказаў
У гэтым случыку галюцінацыя абозначае створаны контэнт, які ўзгадваецца як правдзівы, але ёсць вымышленым, фактычна некоректным або не падтрымваным матэрыялам, які ён нібыта описвае. Упэўнены тон ускладняе ўсвядомленне галюцінацыі, але упэўненасць не ёсць часткай яе апісання; рэчы, сказаныя адступленаю манерай, таксама можуць не матыць падстав.
Явным прыкладам ёсць вымышленая нарадчая праца. Болей тонкім і распашчэным прыкладам ёсць рэальная нарадчая праца, якая цітуецца за рэзультатам, якога ёна ніколі не апісвала, і якая застаецца непазнаванай праз швыдкі прыгляд самэль таму, што існуе цітацыя.
The TruthfulQA benchmark адаптаваў 817 запытанняў у 38 катэгоріях, створаных на аднойчынных хыбных уяўленнях. У пачатковай ацэнкі найлепшы працаваўшы модэль даваў правдзівыя адпаведзі на 58% запытанняў, у працоўкі з людзьмі — на 94%. Это історычныя рэзультаты даследжэнняў 2021 і 2022 гадоў; гэта не є меркай для сучасных чатботаў і не є універсальным паказателем часткі галюцинацый. Гэтыя даследжэння паказваюць, што модэлі можу верна воспроўядзіць хыбныя уяўленні, якія з’являюцца ў текстах, напісаных людзьмі.
Калі у статызацыі є нечаканая цифра, неабходна чыткаа запытаць пра ўзгадку яе пад час збору даных:
Наведзіце аднаго з істочных тэкстаў, указаце дату і аб’ект, які быў вымераны. Якщо тэкст не падтрымае гэю цифру, пазначыце яе як непадтрыманую.
Потым пераканаўцеся ў рэферэнс самі. Кожная цитата, якую стварае модель, ёсць толькі тэзой, пакуль вы не паўнастаеце і таго, што сторанка існуе, і таго, што яна дзейсна падтрымлівае конкрэтную фразу.
5. RAG: запрашэнне доказаў пры адпаведзенні
Процес стварэння тэкста з дапамогай адзысквання інфармацыі спаўнае крок пошуку з крокам стварэння. Сістэма шукае релевантны матэрыял у зовнішней колекцыі, перадае яго модэлі і прасіць модэль адпаведзець на пытанне на адной з гэтых інформацый.
Вызначны артыкул пра RAG 2020 года спалучыў заздалегідь натрэнаванага генератора з прыстроем адзысквання інфармацыі на базе індэкса Вікіпедыя, і пасля публікацыі ён даў найкращыя рэзультаты на трох критэрыях адпаведзення на пытанні у відкрытых доменах. Гэтыя рэзультаты описваюць адну доследчую сістэму, а не гарантію якосці для кожнага продукту, який мае атрыбут RAG.
Разглянем ситуацыю, калі працавальнік спытаеся, сколькі дзён у яго є на тое, каб подаць заявку на вырачэнне витак. Хораша система запошукае чынную правіловую базу і дае адпаведны адказ. Ак жа яна запошукае правіловую базу праз годзіну, то нават высокакалітэтны текст не зможа выправіць грубую памылку – адказ будзе зрозумільным, але некоректным. Самэй таго проблемы RAG зазвычай легкая діагноставаць на кожны ўзлок, а не проста разглядаючы фінальны адказ; гэты падход раскрываецца ў оцэнцы RAG па стадіям выканання.
Есць два хыбных уявлення, якія варта проясніць:
- RAG не выклікае патрэбы ў наявнасці спецыялізаванага векторнага сховішча. Этап запошуку можа быць класычным падборам ключоўых слоў, аналізам схожасці вектораў чы ўжо гібрыдам гэтых методаў, і у агульным описе RAG ад Microsoft рассказваецца пра гэтыя варыянты, а таксама пра значэнне падготовкі контента, каб яго можна было лёгка ашукаць.
Ёсць калькі ацэніць будь-якога дапаможніка з дакументамі, трэба задаць два окольныя пытанні: чы розшукаў ён правильны фрагмент, і чы яго адказ верна відбівае той фрагмент?
6. Агенты: системы, якія выбіраюць свой наступны крок
Термін „агент“ вжываецца шырока, таму корисна часткавая дзеякразнасць. У падрабніку Anthropic пра стварэнне эфектыўных агентоў рабочыя процесы описваюцца як системы, якія следуюць заздалега заданым шляхам коду, тады як агенты дазволяюць моделі дынамічна кераваць своім процесам та выкарыстоўваннем інструментаў.
Фіксаваны працэйны лянцуг можа выкарыстоўваць полья з рачынку, перакантраціваць іх і зберагаць запис, завжды за гэтым порядкам. Агент, які стаўляецца да непূранага рачынку, можа самастаяльна адкрыць дадатак, знайсці супаўзяны замовленне і адправіць запит пра нехваткуючыя дапаможныя даны.
Таму ключовы вопыт стае такім: якія рашэнні і дзеянні мае права выконваць система? Прыготаваны адпаведзень і выдача вярнення маюць аблічна разныя наследкі. Агенту патрэбны чыста апрацаваныя правы прывілеі, відразумелыя рэзультаты для кожнага дзеяння і спосаб перастаць, калі ён не можа выклікчыць разумны наступны крок.
Большая колькасць крокаў таксама значыць большыя шансы на невыпанне. Як спрощанае ілюстрацыйнае прыклад, якщо задача выкалічвае дзесяць крокаў, і кожны з яных выпанываецца незалежна з верыгоднасцю 95%, то шансы на тое, што всі дзесяць крокаў выпаняюцца, станавяць 0,95 у дзесятай ступені, адпаведна прыблізна 60%. У практыцы крокі агента залежаць адзін ад другога, а пракаты зменяюць матэматычныя расчыткі, таму гэта ўсьмо ўжо інтуіцыя ўзростаючага рызыку, а не стандарт для ацэнкі. Практычны наследак — трэба мераваць, чыя цэлая задача была выпаняна правільна, уключаючы побачныя эфекты, а не тое, чыя оканчальныя крокі здаюцца правдападобнымі. Для болей шырокага розгляду самога циклу, адзірніце параграф «Розумеўце AI-агентаў: цялі, інструменты, память і цикл агента».
Шэсць пытанняў для перагляду рэальных задач
Кожная концэпцыя адпаведае пытанню, якое можна задаць пра будзь-яю рэальную задачу:
- Токены: сколькі матэрыялу на самай працоўны системе трэба адпрацаваць, і што можна выдаліць без адныя пазбавлення доказаў?
- Вікна контэксту: на які фрагмент тексту залежала адпаведнае адказа, і чы справадзіла система яго дзеясна?
- Тэмпература: чы стосуецца гэтая працоўна разнавідносці чы адпаведнасці, і чы былі правільнасць і прагнозаванасць пераканалены разамна?
- Галюціназы: дзе самэ праўда для кожнага нечаканага тверджэння, і чы ён паводзіцься пра тое, што кажа адказ?
- RAG: чы быў знайдзены правы, актуальны дакумент, і чы ён быў адражаны тачна?
- Агенты: што системе разрэшана робіць, і чы была весьма працоўна, укладаючы ў сябе яе пабочныя эфекты, адпрацавана правільна?
Заключэнне
Практыкуйцеся з гэтымі запытаннямі на рэальным заданні, напрыклад, на стварэнні апূরкі дакумента, змяне коду чыў адпаведзі на запыт кліента, калі дакумент-выхадны матэрыял будзе ачынуты пры вас. Разграніць трэба джерела інфармацыі, на якіх ён апоўязваўся, вывары, да якіх ён сам дайшоў, і рэальныя дзеянні, якія ён выканаў. Постацэйнае адпрацоўванне такіх заданняў паказвае больш пра надзеямасць інструменту, чыему-небудзь у відэа-дэманстрацыях чы статыстыкі, і ператварае нечыярые сумневы на конкрэтныя, якія можна выправіць проблемы: занадта вялікі об’ём інфармацыі, праўілены фрагмент, некоректны дакумент, не падтрымваны данні чы агент з занадта вялікімі правамі.