Тонкая наладка чы не вызов API? Косцы практыку выкарыстоўвання для адчынення дакументаў
Модель расчытку затрат для процесу стварэння дакументаў аудыту паказвае, чаму выбір маршрутацыі модэлі кращы за налашчванне ў спрאве цены, і калі точнасць схемы чы ўместнасць дадзейнай ЕС паўажнуюцца як прычыны для наявнасці модэлі.
Лідэры інжынерных кампаній продовжаюць ставіць тое ж пытанне, зазвычай ведаўжо пасля таго, як прыходзіць першы большы рахунак ад OpenAI чыста Anthropic: чы групе трэба налаштаваць свой сабе модель чы працаваць далей з API? Адпаведны адказ — што налаштаванне є дышэўней. Інодзе гэта правда, але зазвычай з менш значных прычын, чым думаюць людзі, і для багато груп гэта проста некоректна. У этай статыце рассматрываецца рэалістычная сістэма, якая включае большую колькасць дакументаў, і якая оцэнюецца з двух сторон, выкорыстоўваючы цены з сэптэбря 2026 года, тады вы зможаце пазнакоміцца з тым, адкуль на самае праўда прыходзяць заэканомленні, калі є праблема з адпаведнасцю модэлі, і як прыймаць рашэнні без таго, каб ставіць восьмыя недзелі працы інжынероў на спадзяванні.
Варыянт, які людзі сабе уявлялі, больш не існуе
Адна змяна тыхама перакашталевала весь спарчу: на момент напісання немагчыма налаштаваць сучасную передовую модель.
За данымі сторонкі з цэнамі OpenAI, ўсе болей выключаецца можлівасць тонкай наладкі ўсіх модэляў: новыя кліенты не можуць зарэгістравацца, а o4-mini — ўсё толькі застаўшыся модэль, які можна налацаваць, за які берэцца плата у розмяре 100 долераў за гадзіну трэніравання. Сам API компаніі Anthropic ніколі не адкрываў можлівасці тонкай наладкі. Їхнім ўжо існуючым спосабам была кераваная тонкая наладкі модэля Claude 3 Haiku на платформе Amazon Bedrock, пры чым модэль Haiku 3 згодна з тым быў выключаны па всіх месцах, за выняткам Bedrock і Google Cloud.
Такім чынам, у канцы 2026 года падзея «точна наладка протыва новых тэхналогій» насправды мае болей шчырэй значэнне: бераецца модель з адкрытым вагам, такая як Qwen, Llama, варіянт Nemotron чыра gpt-oss, на вашых данных трэнуецца адаптар LoRA, пасля чаго ён размешчаецца на вашай сабе інфраструктурэ чыра ў такіх прадаўцах, як Fireworks чыра Together. Рызыкі такога выбору не тыя, якія людзі собраўляюць у галаве — яны стосуюцца выбору модэлі, ўзлёгчэння і аддачы данных, якія зазвычай для вас выкарыстоўвае хоставаная API. Будзьце точныя ў своіх адказах пры прадставленні на заседанні рады.
Система для адлікавання: платформа для доказаў аудыту
Система, якая тут описваецца, — гэта не проста іграшка. Це цэлая платформа для доказаў аудыту для средней па велічыне фірмы, такі продукт, які насправдэ заўсёды купуе бухгалтерскія фірмы у Велсе чыра Скандынавіі. Яна працуе у семи этапах:
- Прыем дакументаў. Кліянты завантажваюць файлы через портал, пераважна у вигляде сканаваных PDF-файлаў. Тыповыя дакументы — квіты, замовленні, акты прыемкі товараў, банкавскія выкладнікі, даговоры праеўзяць і протаколы заседанняў рады.
- Класыфікацыя. Кожнаму дакументу прызначаецца тип і ён адправляецца на відпаведную перацэю.
- Выкарыстоўванне інфармацыі. Структураваныя поля перакладаюцца у фіксаваную схему, якая включае інформацыю пра прадавца, дату, чыстую суму, ПДВ, номер замовлення, апраўніка, валюту і цэнтр костаў. Рэзультат павінен быть валідным JSON, які ў кожны раз прысвайчаецца абоўсумневальна да схемы.
- Тэставанне кантролю. Тройны парапор пераказвае, чы рэашчот квіты паспраўданы з замовленнем і актом прыемкі, а таксама чы апраўнік дзеяў у межах своіх поважаных прав. Большая частка гэтага ўскладнення являе сабою звычайны код, а не модель.
Этапы 2 і 3 спрацоўваюць практычна всі токены, і яны таксама ўтвараюць найбольш павторны, механічны і строго прымушаны да пэўных правілаў частаку системы. На этапах 6 і 7 вырабляецца рэальныя адлічэння, пры тым ўжо частка іх у загальным об’ёме є канцэнтральная. Памятаце пра такі падзел, калі ўжо будзе адбывацца рэшта аналізу.
Аблікаванне об’ёму токенаў
Модель прыяжэць, што кожны дакумент ператвараецца ў текст за дапамою OCR прытым, як толькі ён падае на перакладчык. Цэе дазволяе ухіліцца ад расчытків за токены зображэнняў, і такое і ў рэальнасці імеет месца.
Кожны дакумент праходзіць через тры крокі (класыфікацыя, выдзеўленне і самаперакананне), што дае аб’ём прыблізна:
- 5,200 вхідных токенав, якія включаюць текст дакумента, схему і калькі з кантрольнымі прыкладамі
- 600 выходных токенав для структураванага рэзультата
Моделююцца два розміры працы:
- Pilot: 100,000 дакументаў на месцы, што адпавядае адной кампаніи ў перыод піку акывнасці.
- Scale: 2,000,000 дакументаў на месцы, што адпавядае таму ж продукту, продаюцаму п’ятдесят кампаніям.
У режыме Pilot аб’ём станавіць прыблізна 580 мільйонаў токенав на месцы, а у режыме Scale — 11,6 мільярдаў токенав.
Як выглядае счыт
У прытаках нижэй выкорыстоўваны стандартныя цены за абслугоўкі з глобальным маршрутызаванням, без дэсконтаў за абработку вялікіх пакетаў дадзеных чы скарыбніцаванне, якія былі публікуемы на сторонцы цэнаў кожнага прадавца ў верасні 2026 года. Цены часта зменяюцца, таму спрыймайце іх як момантальны статыстычны дадзенне і пераконтавайцеся з ямі перш чым формуўваць бюджэт.
Пры малым обсязе работ патрэба ў дапрацоўкі моделі становіцься нерэальной. Абработка всего процеса выкарыстоўвання дадзеных на Claude Sonnet 5 коштае абоўшча $1,640 на месцы, Haiku 4.5 — абоўшча $820, а дапрацоўаная 8B-модель — абоўшча $116. Эканомія прыблізна $1,500 на месцы ніколі не компенсавае зусілляў, затрачаных на стварэнне дапрацоўкі. У такой ситуацыі кращэ выкарыстоўваць API.
Пры вялікім обсязе работ выбор стаў значным:
- Claude Opus 5: абоўшча $82,000 на месцы
- GPT-5.6 Sol: абоўшча $65,600 на месцы
- Claude Sonnet 5: абоўшча $32,800 на месцы
- Claude Haiku 4.5: абоўшча $16,400 на месцы
- GPT-5.6 Luna: абоўшча $3,520 на месцы
Існуе спакуса пісаць, што заўдышка складае больш чым 90% завялікаб тонкай настройкі, і ў пораўнанні з флагманскімі версіямі такая арытметыка падтрымае гэта: вартасць тонкай настройкі станаві прыблызна 7% вартасці Sonnet 5 і менейш чым 3% вартасці Opus 5. Але жадна команда не должна здольнае выкарыстоўваць масовую экстракцыю рахункоў для флагманскіх модэляў. Пораўненне оптымаізаванага дизайна з намерна неэфектывным — це маркетынг, а не аналіз.
Маршрутацыя, а не тонкая настройка, дае великую заўдышку
Пораўняйце два пасляпэльныя пункты таго спісу: 3 520 долераў за GPT-5.6 Luna проты 2 320 долераў за тонкая настроены 8B модэль. Разлік станаві 1 200 долераў на месцы, або прыблызна 14 400 долераў на год.
Правильная рэалізацыя процесу тонкай наладкі выключае пазначэнне атрыбутаў дадзенням, стварэнне інструмента для ацэнкі, запуск процесу навчання, налажоўку сэрвіса і дадаць монітарынг змян. Справедлівая оцэнка — восьма тыдзёння роботы інжынера. Якша практычныя тарыфы европейскіх підряднікаў, адпаведна, час вярнення інвэстыцыі за рахунак еканаміі коштоў можа сягнуць нават адзіннадцаті-дванаццаці месцаў.
Найболее корыстным вывадам ёсць тое, што самая большая частка скачуку витрат даесяць за рахунак маршрутацыі. Перанесенне процэса класыфікацыі і выяўлення з прыгоннага рашэння на найдешавшыя ресурсы, якія ўсё ж паспелі працаваць за вашыма критэрамі, дазволяе зменіць месячныя витраты на рангу Opus з 82 000 долераў да 3 520 долераў, тое ўсьмо гэта прыблізна 96% скачук. За дапамогою маршрутацыйнага прыстрою і адпаведнай сэткі критэраў такую змяну можна адбыць за адны полудзень. Даўнейшая налаадка дапамагае захаваць ўсьмо ўтрох, тое ўсьмо ешча прыблізна 34%. Той жа прынцып – падбіранне розмеру модэлю па кожнаму запытку – детальна розглядаецца ў стацыі пра правильны выбор розмеру LLM-маўак за дапамогою маршрутацыі, выяўлення і критыкі.
Сама практыка навчання заступаецца майже безкоштовна. Fireworks прымаеся за роботу з LoRA для тонкай настройкі модэляў з колькасцю параметраў да 16 мільярдаў за цэнай $0,50 за мільйон токенаў навчання. Двадцать тысяч прыкладаў з атрыбутамі, кожны з яых складаецца з 2 500 токенаў, пасля трох эпох навчання даходзяць да 150 мільйонаў токенаў навчання, тое ўсьмо $75 за адну практыку. Восьць такіх практык падчас розработкі даходзяць прыбліжна да $600. Вычысленні ніколі не былі дорогай часткаю; дыяльнасць па падготовцы данных і ўзлікаванню яе ролі ёсць дорогай. Кожны расчын пра тонкай настройці, які базуецца галоўная мерой на вартасці GPU, ўзьязначае людзіну, якая сама такога не рабіла.
Чаму взагалі трэба тонкая настройка?
Якщо вартасць токенаў сама па сабе не ўзьязначае цэлеспрабавнасці, то іншыя два фактары можу яе узьязначыць.
Першая прычына: строгае адпаведанне схеме
Гэта мае важнае значэнне ў аудытный работе, але прывертае значна меншае ўвагу, чым заслуговвае.
Моделі типу Frontier ўособлівае рашэнняя. Якщо папросіць іх выбраць з 51 фіксаванай падкатегорыі, яны часам ствараюць 52-ю, адколі метай іх навчання ў самым дзеле яе — ствараць текст, які здаецца правдападобным. Для чат-асистэнта такія памылкі практычна не маюць значэння. Аднак у даследжанні, якое падтрымвае падписаную аудытную думку, гэта ўжо являецца дыфектам.
Няўзабавныя даследжанні таксама паказваюць адно і тое ж, хоць большая частка з іх ўжо опублікована як прэпрынты, таму іх трэба чытаць з урахоўваннем гэтага:
- У прэпрінте 2026 года, прызначанам для класіфікаціі дакументаў безпекі, модэлі былі адмацаваны за дапамою 51 заранее вяліканай падкатегорыі, пры чым адпаведныя рэсультаты павінны былі быть у строгам JSON-фармате. У яму модэль, налаштаваная локальна, перамагала сучасныя фронтейр-модэлі на 15–20 процэнтных пунктаў, а дзеярнікі зазначылі, што GPT-5 ствараў назвы падкатегорый, якіх не было ў таксаноміі. Їхня інтэрпретацыя ёсць найважлівейшай часткай: фронтейр-модэлі добра справляюцца з выкарыстоўваннем дакументаў у слаба структураваным формате, але пад строгімі правіламі схемы калібрацыя мае большое значэнне, чым спроможнасць да логічных выводам.
Для продукта для аудыту падінне на два пункты ў точнасці выкарыстоўвання дадзеных у практыцы можа мець большую цэннасць, чым усі витраты на інферэнс разам, таму што кожная памылка ў выкарыстоўванні прыводзіць да ручнага перагляду, а ручны перагляд ёсць найдрожэйшым ресурсам у бізнесе.
Другая прычына: точная інформацыя пра месца зберагачвання дадзеных
У Еўропе часта самэ гэта вялічына выканае рашэнне.
Файлы аудыту бухгалтерскіх фірм Уэльсу чы ў ЕС маюць фінансавыя дакументы кліентаў, данні пра працавальнікаў і іноды персональныя данні трохі чаёў. Месца обробкі дадзеных не ёсць другаплановым пытаннем; зазвычай гэта друга запитанне, якое ставяюць пад час закупкаў.
Ныякія варыянты, якія існуюць станам на сэрпень 2026 года, дзівуюць багато каманд:
- API адміністрацыі Anthropic не паслужае для працы ў ЕС. Параметр
inference_geoпрымае значэнняglobalабоus; обробка толькі ў США коштуе у 1,1 раза больш, чым стандартная цэна. Ёжчы заставіць Claude працаваць у ЕС, трэба викорыстоўваць регіон AWS Bedrock або Google Vertex, які знаходзіцца ў ЕС, дзе регіональныя канцэнтры мають на 10% вышэйшую цэну, чым глобальныя. У момент напісання Claude на платформе Microsoft Foundry не мела регіону зберохвату дадзеных у ЕС. - OpenAI падтрымляе регіональную обробку, дадаючы 10% допануець да цены для модэляў, запусканных з 5 чэрвеня 2026 года.
- Fireworks прызначае множык 1,5, калі спецыяльны розмешчэнне модэля обмежваецца певным регіонам.
Калі вартасць рэзідэнцыі завісіць ад масштабу обсяга, картына зменяецца. Два спецыяльныя H100, якія запускаюць настроены модель 8B, працуюцыя толькі ў паводле регіону і цэлы час, коштаюць праўда-такі 17 520 долераў у месяц. Адпаведная робота з Claude Sonnet 5 на ендапоінтэ EU Bedrock коштаць будзе або 36 080 долераў, а з Opus 5 — або 90 200 долераў.
Гэта справжняя еврапейская аргументацыя за власнае володзенне такой модэлью. Не тое, што токены дышчы, а тое, што паспаведанне пра супакорэннасць можна запісаць ў адной фразе, а не на дыяграме архітэктуры.
Не купуйце спецыяльныя GPU занадта рано
Пастовая месячная цена на GPU здаеця прыемнай, але ўводзіць у памылку багато команд, таму што ёй можна зарабіць толькі при такых обсягах, якія рэдка калі досягаюцца. Як базу берамо пару спецыяльных працёздатных карт H100 па міжнародным цэнам, адпаведна прыблізна 11 680 долераў на месцы, тады точкі перапрыяснення знаходзяцца прыблізна:
- 700 000 дакументаў на месцы для Claude Sonnet 5; пад гэтым показнікам API є дышэўней
- 1,4 мільйона на месцы для Claude Haiku 4,5
- 6,6 мільйона на месцы для GPT-5,6 Luna
Тыповы продукт для аудыты ў першыя два годы, верагатна, будзе пад кожным з гэтых показнікаў. Хостынг на базе сервера без адпаведальнасці за обслуговуванне дозволяе абходзіць гэтую прыемку цалкам: вы отрымліваеце індывідуальныя настройкі без неабходнасці платы за незаўантажаныя GPU, што робіць гэты варыянт разумным пачаткам. Аднойчы ж выкарыстоўваецца меншая контроль над затрымкамі та прыемнасцю, што мае значэнне толькі тады, калі обсяг работы стане вялікім і стабільным.
Чатыры пытанні, якія дапамагаюць выбраць рашэнне
1. Калькуюце вы рэальны месячны об'ём токенаў? Якщо вы пераробляеце менейш чым ад мільярда токенаў ў месцы, выберыце найменш дорогі ранг Frontier, які падтрымае вашы запиты, і інвестыруйце восьмі недзелі роботы інжынераў у чымсь болей корыстным. Налёгкая настройка пры маленькім об'ёме — это тэатр, а не інжынерыя.
2. Насколькі вузка і обмежана задача? Фіксаваны формат выходных дадзеных, фіксаваны набор атрыбутаў і тыясячы практычна ідэнтычных прыкладоў ў дзень вказываюць на можлівасць налёгкай настройкі. Адкрытыя мысленні, ухваленыя рашэння і стварэнне наратыў для падпісу партнёра адносяцца да модэляў типу Frontier і, верагатна, застануцца там.
3. Дзе павінны знаходзіцца даны? Клаза кантракту, якая вымагае, каб обробка даных велася ў межах ЕЭЗ, змінюе спіс можлівых варыянтав пры тым, як ў разговор увайшлі косты. Неабходна ўключыць доплату за розмешчэння даных у першай оценцы, а не выявляць яе пад час перагледу архітектуры.
4. Чы можна практычна атрымаць прынеймна 10 000 пазначаных прыкладоў? Дакумент NVIDIA Research пра маленькія мовныя моделі ў агентных системах прыпускае, што для налагоджэння маленькай моделі патрэбна колькасць прыкладоў ад дзесятка тысяч да ста тысяч. Якщо гэтага няма, першым крокам павінна быць наладка процесу трэніравання так, каб ён сам запісваў свае даны трэніравання.
Гэты пасляпяродны момант ёсць найцэннейшым патэрном у гэтым аспекте, пры тым як яго мінімаўна прадвайваюць. Адправляйте данні через API на межы і фіксуйце кожны вызов, уключаючы вхідныя данні, выходныя рэзультаты і паследнія правкі. Чэрез шысць месцаў у вас будзе набор дадзеных з атрыбутамі, які не косцюе допаможных зусиль, і вы зможаце налаштаваць систему на аднойчынных дапаможных дадзеных, а не на спадзяваннях. Фіксаванне дакументаў кліентаў мае своія обавязкі па захопленні дадзеных, таму з самага пачатку неабходна разрабіць правіла зберагчэння і доступу да гэтых логаў.
У там самым артыкуле NVIDIA таксавалі частку вызоў LLM, якія маленькія моделі моглі б перэйняць у трох проектах з адкрытым кодам: прыблізна 60% для MetaGPT, 40% для Open Operator і 70% для Cradle. Не всі з іх, але і не ніхто з іх. Правадзебная адказ — гэта сумешанне, і толькі логі паказваюць, калькі вызоў належыць куды.
Найсильнейшы протыяўказ
Даныя працэвушчання падпрыемстваў паказваюць працоўны направленні. За рэзультатамы апытнаўкі падпрыемстваў, якая адбылася у Menlo Ventures, частка робочых навантажэнняў на адкрытым кодзе знизілася з 19% да 11%, тады калі витраты былі сконцентраваны на закрытых API: Anthropic займае 40% від загоўнаў витрачаных падпрыемствамі на LLM, OpenAI — 27%, а Google — 21%. (Menlo ўзьяла участь у інвеставанні ў Anthropic, што важна знаты пад час аналізу гэтых цифр.)
Гэта не суперчыць вышэйшаму аналізу; гэта паказвае, дзе выклікі. Закрытыя API маюць перавагу ў зручнасці, а зручнасць зазвычай перамагае. Команды, якія атрымалі рэальную цэннасць ад налаштаванняў на адкрытым кодзе, свядома выбралі вышэйшыя операцыйныя навантажэння з якойсь чыстаю прычыной. Якщо вы не можете назваць гэтую прычыну, апытнаўка ёсць сігналам, які варта прыймаць у ўвагу.
Короткая адмова пра рэгуляванні ЕС
Команды з Брэтаніі і ЕС будуць спытваць пра Закон па аб’ектах штучнага інтэлекту, таму корыстны кароткі апুষ্টак. Воспрыяўце яго як інформацыю, а не як юрыдычную падказку, і пераканаўцеся ў актуальным тексты пры выкарыстоўванні будзь-якіх дат.
Цифровы комплексны акт па аб’ектах штучнага інтэлекту, формальна Рэгламент (ЕС) 2026/1744, быў опублікованы ў Офіцыйным журнале 24 ліпня 2026 года і набраў чыннасць за тры дні пазней, 27 ліпня. Ён перанёс тэрміны выпалення высокарызыковых трэбавань для самастоятельных систем з Прылагача III з 2 серпня 2026 года на 2 дзецабря 2027 года. Для аб’ектаў штучнага інтэлекту, ўбудованых у прылады, якія паўнажнацься на Прылагачы I, новы тэрмін — 2 серпня 2028 года.
Трэбаванні па прозрачнасі, выказаныя ў Статцы 50, не былі адкладзеныя і дэйствуюць з 2 серпня 2026 года, як і планавалася спачатку. Для систем, выпускаемых на рынак раней, обавязак маркіравання па Статцы 50(2) набірае чыннасць 2 дзецабря 2026 года.
Адынстры, які падтрымляюць аудытораў і выконваюць крок людскай апрацовкі, зазвычай не палягаюць у межах Дадатку III, але пераканайцеся самі ў сваёй ситуацыі: якщо які-небудзь элемент вплывае на рашэння пра прыем на работу чыя-небудзь кредытабельнасць, ён палягае ў межах даследжэння. Нічыга з гэтага не паўтарае правілы GDPR, якія регулююць даны кліентаў, якія праходзяць через систему, незалежна ад таго, як Закон пра AI класіфікуе такую систему.
Патрэба ў гэтым реальная. У апытнай перапытцы Wolters Kluwer 39% з 4,214 спецыялістаў у сферы внутршняго аудыту заявілі, што ўжо викорыстоўваюць AI, а ўсё 41% плануеяць пачаць яго викорыстоўванне прыблізна за год.
Этапавы план стварэння такой системы
Для команды, якая пачынае стварэнне такой системы, рекамендуемая последоваснасць ёст:
- Застосаваць найдешавейшы тарифны ўровень, які паспелаў вашы набор дадзенняў для ацэнкі. Запісваць кожны вызов модэлю, дазволіць аудыторам працаваць з яным пад час рэальнага напружанаг періоду і відклаць будзь-яю дальнейшую наладку.
Тры з гэтых чатырох фаз коштаюць меней, чым тое, што выконваюць багатыя команды ў першы ж дзень.
Ключовыя выводы
- Часоўныя модэлі фронтяра зазвычай не можна тонкай налаадаваць, таму рэальны выбар — модэль з адкрытым вагам і адаптаторам LoRA проты API, якае размешчаецца на серверах.
Асалідны вопыт ніколі не быў пра абмежаныя моделі протыва передовых модэляў. Це пра тое, якія з вашых запытанняў практычна вымагаюць логічных раздумоў. Як толькі вы даеце на гэты вопыт адпаведны ўказвіт, пытанне пра вартасць заўсёды сама апавядаецца.
Супакойлена літэратура
- Mapping RAG: Pipeline Stages, Core Components and the Variant Landscape — З’ясавайце, як працюе процес генеравання з дапамогай адзысквання інфармацыі з канца ў канец, якія компоненты неабходны для RAG-системы, і як безліч разных варыянтав RAG пасваяюцца ў адну структуру.