Главная / Статьи / Отрегулировать настройки или использовать API? Стоимость пайплайна для извлечения документов

Отрегулировать настройки или использовать API? Стоимость пайплайна для извлечения документов

Работающая модель затрат для процесса создания аудиторских документов показывает, почему маршрутизация моделей эффективнее тонкой настройки по цене, и когда точность схемы или требования к размещению данных в ЕС оправдывают наличие собственной модели.

2967 слов

Руководители инженерных отделов постоянно задают один и тот же вопрос, обычно сразу после поступления первого крупного счета от OpenAI или Anthropic: стоит ли команде настраивать собственную модель или продолжать использовать API? Ожидаемый ответ заключается в том, что настройка модели дешевле. Иногда это действительно так, но обычно по более узким причинам, чем предполагают люди, и для многих команд это просто неверно. В этой статье рассматривается реалистичная ситуация с высокой нагрузкой на систему, оцененная с обеих сторон, с использованием цен за сентябрь 2026 года, чтобы вы могли понять, откуда действительно исходит экономия, когда оправдано владение моделью и как принять решение, не рискуя восемью рабочими неделями инженеров на угадывание.

Вариант, который люди себе представляли, больше не существует

Одно изменение тихо изменило всю дискуссию: на момент написания этой статьи невозможно настраивать современные передовые модели.

Согласно странице с тарифами OpenAI, их платформа для финтунинга постепенно уходит с рынка: новые клиенты не могут зарегистрироваться, и o4-mini — единственная оставшаяся модель, подлежащая настройке, за которую взимается плата в размере 100 долларов за час обучения. Собственный API компании Anthropic вообще не предоставляет возможности финтунинга. Единственным ранее существовавшим способом было контролируемое обучение модели Claude 3 Haiku на платформе Amazon Bedrock, причем версия Haiku 3 с тех пор была устарожена во всех системах, кроме Bedrock и Google Cloud.

Таким образом, в конце 2026 года понятие «точная настройка против передовых технологий» означает что-то более конкретное: берется модель с открытым весом, такая как Qwen, Llama, вариант Nemotron или gpt-oss, на её основе тренируется адаптер LoRA с использованием собственных данных, после чего он размещается на собственной инфраструктуре или у поставщика вроде Fireworks или Together. Риски такого выбора не связаны с тем, что обычно представляют люди — с выбором модели, её оценкой и предоставлением услуг, которые обычно выполняет хостинговый API. Необходимо чётко определить эти аспекты перед тем, как представлять информацию на совете директоров.

Система для справочных целей: платформа для хранения доказательств аудита

Система, о которой здесь идёт речь, — это не просто демонстрационный инструмент. Это полноценная платформа для хранения доказательств аудита, предназначенная для среднего по размеру предприятия; именно такой продукт могли бы приобрести бухгалтерские фирмы в Великобритании или скандинавских странах. Она работает в семи этапах:

  1. Получение данных. Клиенты загружают файлы через портал, в основном в виде отсканированных PDF. К типичным документам относятся счета-фактуры, заказы на покупку, акты приемки товаров, банковские выписки, договоры аренды и протоколы заседаний совета директоров.
  2. Классификация. Каждому документу присваивается тип, после чего он направляется на соответствующую обработку.
  3. Извлечение данных. Структурированные поля извлекаются в соответствии с фиксированной схемой, включая информацию о поставщике, дате, чистой сумме, НДС, номере заказа на покупку, лице, утвердившем документ, валюте и центре затрат. Результат должен представлять собой действительный JSON-файл, полностью соответствующий схеме при каждом вызове.
  4. Проверка корректности. В процессе трехстороннего сравнения проверяется соответствие счета-фактуры заказу на покупку и акту приемки товаров, а также то, были ли полномочия лица, утвердившего документ, в пределах его полномочий. Большая часть этой логики представляет собой обычный код, а не модель.
  • Классификация исключений. Все элементы, не прошедшие тестирование, оцениваются и сортируются по рейтингу.
  • Составление рабочих документов. Система создает первый черновик каждого вывода, например: проверены 42 платежа сверх порога в 50 000 фунтов стерлингов, и у трех из них отсутствует задокументированное вторичное одобрение.
  • Вопросы и ответы аудиторов. Аудиторы запрашивают всю информацию по проекту и получают обоснованные ответы с ссылками на исходные документы.
  • На втором и третьем этапах тратится почти весь объем токенов, и это также самые повторяющиеся, механические и ограниченные схемой части системы. На шестом и седьмом этапах происходит реальное принятие решений, однако их доля в общем объеме незначительна. Имейте это в виду, поскольку остальной анализ основывается на этом разделении.

    Оценка объема токенов

    Модель предполагает, что каждый документ преобразуется в текст с помощью OCR перед тем, как он попадает к модели. Это позволяет избежать начисления платы за токены изображений, и это то, что на практике и делается.

    Каждый документ проходит через три этапа обработки (классификация, извлечение данных и самопроверка), в сумме составляющие примерно:

    • 5,200 входных токенов, включающих текст документа, схему и несколько примеров
    • 600 выходных токенов для структурированного результата

    Рассматриваются два уровня нагрузки:

    • Pilot: 100,000 документов в месяц, что соответствует одной компании в период пиковой нагрузки.
    • Scale: 2,000,000 документов в месяц, что соответствует продажам того же продукта пятидесяти компаниям.

    Это даёт примерно 580 миллионов токенов в месяц при уровне Pilot и 11,6 миллиарда токенов при уровне Scale.

    Как выглядит счёт

    В приведённых ниже цифрах используются стандартные цены с глобальным маршрутизированием без скидок за оптовые заказы или кэширование, указанные на страницах с ценами каждого поставщика в сентябре 2026 года. Цены часто меняются, поэтому рассматривайте их как моментальную информацию и перепроверяйте перед составлением бюджета.

    При небольших объёмах работ необходимость тонкой настройки модели отпадает. Запуск всего процесса извлечения данных на Claude Sonnet 5 стоит примерно 1 640 долларов в месяц, на Haiku 4.5 — около 820 долларов, а на отрегулированной модели объёмом 8 миллиардов параметров — примерно 116 долларов. Экономия в размере примерно 1 500 долларов в месяц никогда не компенсирует усилия, затраченные на создание такой отрегулированной модели. На этом этапе достаточно использовать API.

    При крупных объёмах работ выбор становится действительно важным:

    • Claude Opus 5: примерно 82 000 долларов в месяц
    • GPT-5.6 Sol: примерно 65 600 долларов в месяц
    • Claude Sonnet 5: примерно 32 800 долларов в месяц
    • Claude Haiku 4.5: примерно 16 400 долларов в месяц
    • GPT-5.6 Luna: примерно 3 520 долларов в месяц
  • Тонко настроенная модель размером 8 миллиардов параметров, предоставляемая без серверной инфраструктуры: примерно 2 320 долларов в месяц
  • Желательно указывать, что благодаря тонкой настройке экономия составляет более 90%, и с точки зрения арифметики это подтверждается по сравнению с флагманскими тарифами: стоимость тонкой настройки составляет примерно 7% от стоимости тарифа Sonnet 5 и менее 3% от стоимости тарифа Opus 5. Однако ни одна команда не должна использовать флагманские модели для массовой обработки счетов. Сравнение оптимизированной конфигурации с намеренно ресурсоемкой является маркетинговым приемом, а не анализом.

    Большая экономия достигается за счет маршрутизации, а не тонкой настройки

    Сравните последние два пункта списка: 3 520 долларов за модель GPT-5.6 Luna против 2 320 долларов за тонко настроенную модель размером 8 миллиардов параметров. Разница составляет 1 200 долларов в месяц, или примерно 14 400 долларов в год.

    Правильная настройка процесса тонкой настройки включает маркировку данных, написание инструментов для оценки, запуск процесса обучения, создание системы предоставления результатов и внедрение мониторинга отклонений. Разумная оценка времени — восемь инженерных недель. Умножив это на типичную ставку европейского подрядчика, можно сказать, что одни только экономии за счет использования токенов позволят окупить затраты более чем за восемнадцать месяцев.

    Более важный вывод заключается в том, что наибольшая экономия средств достигается за счёт оптимизации маршрутизации. Перенос процедур классификации и извлечения данных с высокопроизводительных решений на самый дешёвый уровень, который всё ещё соответствует требованиям оценки, позволяет снизить ежемесячные расходы с 82 000 долларов до 3 520 долларов, что на 96% меньше. С помощью специального маршрутизатора и надёжного набора данных для оценки такие изменения можно внести за один день. Дополнительная настройка позволяет сэкономить ещё примерно 34%. Тот же принцип — подбор размера модели под конкретную задачу — более подробно рассматривается в статье «Правильный размер LLM с использованием маршрутизации, поиска и оценки».

    Сам процесс обучения практически бесплатен. Fireworks предлагает метод настройки моделей LoRA под руководством специалиста для моделей с числом параметров до 16 миллиардов по цене 0,50 доллара за миллион токенов обучения. Двадцать тысяч меток, каждая из которых состоит из 2500 токенов, обучаемых в течение трех эпох, соответствуют 150 миллионам токенов обучения, то есть примерно 75 долларам за одну попытку. Восемь таких попыток во время разработки обходятся примерно в 600 долларов. Вычисления никогда не были дорогостоящей частью; дорого обходится подготовка данных и оценка результатов. Любые цифры, связанные с стоимостью настройки моделей и основанные в основном на затратах на GPU, приводятся людьми, которые сами этим не занимались.

    Зачем вообще настраивать модели

    Если стоимость токенов не является достаточным основанием, могут сыграть роль ещё два фактора.

    Первая причина: строгое соблюдение схемы

    Это особенно важно при аудиторской работе, но уделяется этому гораздо меньше внимания, чем следует.

    Модели Frontier являются универсалами. Если попросить их выбрать из 51 фиксированной подкатегории, они время от времени сгенерируют 52-ю, поскольку цель их обучения — создавать текст, звучащий правдоподобно. Для чат-ассистента такие ошибки практически не имеют значения. Однако в документе, подтверждающем заверенное аудиторское заключение, это считается недостатком.

    Недавние исследования указывают в том же направлении, хотя большинство из них представляет собой предварительные публикации, и к ним следует относиться с соответствующей осторожностью:

    • В предварительной публикации 2026 года, посвящённой классификации документов с информацией о безопасности, модели тестировались по 51 заранее определённой подкатегории, причём ответы должны были предоставляться в строгом формате JSON. В ходе тестов модель, настроенная локально, превзошла современные модели на 15–20 процентных пунктов, а исследователи заметили, что GPT-5 придумывал названия подкатегорий, отсутствовавших в предоставленной таксономии. Их интерпретация является ключевой: современные модели хорошо справляются с извлечением информации в свободно форматированном виде, но при строгих ограничениях схемы калибровка имеет большее значение, чем способность к логическому мышлению.
  • В ещё одном предварительном отчёте описывается отточенная версия Qwen2.5-0.5B — модель с полумиллиардом параметров, которая помещается на одну потребительскую GPU и показывает средний результат 0.83 в метрике micro-F1 при извлечении связей в общедоменных задачах. При минимальном использовании техник zero-shot prompting модель GPT-5.4 достигла значения 0.69 по этой же метрике, а Claude Sonnet 4.6 — 0.66. Авторы подчёркивают, что это не означает, будто небольшие модели по своей природе сильнее; это показывает, что адаптация модели к узкой, фиксированной задаче может превзойти её базовые возможности. Извлечение данных для аудита — именно такая задача.
  • Собственные опубликованные результаты компании Anthropic по отточке модели Claude 3 Haiku показали повышение точности классификации при задаче модерации комментариев с 81,5% до 99,6%, причём количество токенов на запрос сократилось на 85%. Домен задачи отличается, но закономерность остаётся прежней.
  • Для продукта аудита двухпроцентное улучшение точности извлечения данных на месте может оказаться ценнее, чем сумма всех затрат на инференцию, поскольку каждая ошибка в извлечении приводит к ручной проверке, а ручная проверка является самым дорогим ресурсом в бизнесе.

    Вторая причина: точное знание местоположения данных

    В Европе именно это часто становится решающим фактором при заключении сделки.

    Аудиторские файлы британской или европейской бухгалтерской фирмы содержат финансовые записи клиентов, данные сотрудников и иногда личные данные третьих сторон. Место обработки данных не является второстепенным вопросом; обычно это второй вопрос, который задают при закупках.

    Текущие варианты на сентябрь 2026 года удивляют многие команды:

    • API от Anthropic не предоставляет опции работы в регионах ЕС. Параметр inference_geo принимает значения global или us; обработка исключительно в США стоит в 1,1 раза дороже стандартной цены. Чтобы сохранить Claude в пределах ЕС, необходимо использовать регион AWS Bedrock или Google Vertex в ЕС, где цены за использование региональных точек доступа на 10% выше, чем у глобальных. На момент написания статьи у Microsoft Foundry не было региона с зоной хранения данных в ЕС.
    • OpenAI поддерживает региональную обработку, добавляя 10% к цене для моделей, запущенных с 5 марта 2026 года и позже.
    • Fireworks применяет коэффициент 1,5 при ограничении специализированной развертки определенным регионом.
  • Автономные GPU в центре обработки данных, скажем, во Франкфурте или Дублине подразумевают оплату любого оборудования и услуг хостинга по согласованной цене, причем данные никогда не покидают ваш контроль.
  • Когда стоимость размещения зависит от объема работы, ситуация меняется. Два специализированных устройства H100, работающих с отрегулированной 8B-моделью, ограниченные по региону и работающие круглосуточно, стоят примерно 17 520 долларов в месяц. Обслуживание той же нагрузки с помощью Claude Sonnet 5 на сервере EU Bedrock обойдется примерно в 36 080 долларов, а с Opus 5 — около 90 200 долларов.

    В этом и заключается настоящий европейский аргумент в пользу использования собственной модели. Дело не в том, что токены дешевле; дело в том, что объяснение соответствия требованиям помещается в одно предложение, а не в схему архитектуры.

    Не покупайте специализированные GPU слишком рано

    Фиксированная ежемесячная стоимость GPU кажется привлекательной, но обманывает многие команды, поскольку она оправдывается только при объемах, которых редко достигают продукты. Если взять в качестве базы пару специализированных карт H100 по мировым ценам — примерно 11 680 долларов в месяц — то точки перекрытия расходов будут примерно следующими:

    • 700 000 документов в месяц для Claude Sonnet 5; ниже этого показателя API дешевле
    • 1,4 миллиона в месяц для Claude Haiku 4.5
    • 6,6 миллиона в месяц для GPT-5.6 Luna

    Типичный продукт для аудита, скорее всего, будет находиться ниже всех этих показателей в течение первых двух лет. Безсерверное хостинговое решение для настроенной модели полностью избавляет от этой проблемы: вы получаете индивидуальные веса модели, не платя за неиспользуемые GPU, что делает его разумной отправной точкой. Однако взамен снижается контроль над задержками и пропускной способностью, что имеет значение только при высоком и стабильном объеме работы.

    Четыре вопроса, которые помогут принять решение

    1. Каков ваш реальный месячный объем токенов? Если вы обрабатываете менее миллиарда токенов в месяц, выберите самый дешевый уровень Frontier, достаточный для прохождения ваших тестов, и инвестируйте восемь рабочих недель инженеров в более полезные цели. Настройка модели на уровне пилотных объемов — это спектакль, а не инженерная работа.

    2. Насколько узким и ограниченным является задание? Фиксированный формат вывода, фиксированный набор меток и тысячи практически идентичных примеров в день указывают на необходимость тонкой настройки модели. Работа с открытыми задачами, принятие решений и составление текстов для подписи партнера требуют использования моделей уровня Frontier, и, скорее всего, так и останутся там.

    3. Где должны храниться данные? Положение контракта, требующее обработку в пределах ЕЭЗ, изменяет список возможных вариантов ещё до того, как начинаются обсуждения по вопросам стоимости. Следует учесть дополнительные расходы на хранение данных в первой оценке, а не обнаруживать их в процессе анализа архитектуры.

    4. Можно ли получить как минимум 10 000 примеров с метками? В документе NVIDIA Research о небольших языковых моделях в агентных системах предлагается диапазон от десяти тысяч до ста тысяч примеров как оптимальный для настройки небольшой модели. В отсутствие такого количества первым шагом должно стать внедрение инструментов в работу пайплайна, чтобы он сам записывал свои данные обучения.

    Последний пункт является самым ценным принципом здесь, но при этом наименее распространённым. Используйте API на границе и ведите журнал каждого вызова, включая входные данные, выходные результаты и корректировки от рецензентов. Через шесть месяцев у вас будет меткий набор данных, который не потребует дополнительных затрат, и вы сможете проводить тонкую настройку на основе фактов, а не упований. Ведение журнала документов клиентов сопряжено со своими обязанностями по защите данных, поэтому с самого начала необходимо определить правила хранения и доступа к этим записям.

    В той же статье NVIDIA также была оценена доля вызовов больших языковых моделей, которую могли бы взять на себя небольшие модели в трёх проектах с открытым исходным кодом: примерно 60% для MetaGPT, 40% для Open Operator и 70% для Cradle. Это не все, но и не ничего. Правильный ответ — это сочетание, и только журналы вызовов позволяют определить, какие вызовы относятся к каким моделям.

    Самый сильный аргумент против

    Данные о внедрении решений в корпоративной среде показывают обратную тенденцию. Согласно опросу корпоративных клиентов, проведенному Menlo Ventures, доля работ, выполняемых с использованием открытого кода, снизилась с 19% до 11%, в то время как расходы были сосредоточены на закрытых API: Anthropic составляет 40% от общих расходов корпораций на ИИ-модели, OpenAI — 27%, а Google — 21%. (Menlo является инвестором Anthropic, что важно учитывать при анализе этих цифр.)

    Это не противоречит предыдущему анализу; оно показывает, в чем заключается сложность. Закрытые API превосходят по удобству использования, и обычно удобство берет верх. Команды, которые действительно получают пользу от настройки моделей с использованием открытого кода, осознанно выбирают дополнительную рабочую нагрузку по веской причине, которую они могут четко обосновать. Если вы не можете указать эту причину, результаты опроса являются сигналом, на который стоит обратить внимание.

    Kраткое примечание о регулировании в ЕС

    Команды из Великобритании и ЕС будут задавать вопросы о Законе об ИИ, поэтому краткое резюме будет полезно. Рассматривайте его как информационное материало, а не как юридическую консультацию, и убедитесь в актуальности текста перед тем, как опираться на какие-либо даты.

    Цифровой сводный законопроект об ИИ, официально называемый Регламентом (ЕС) 2026/1744, был опубликован в Официальном журнале 24 июля 2026 года и вступил в силу через три дня, 27 июля. Благодаря ему сроки выполнения обязательств, связанных с высоким риском для автономных систем из Приложения III, были отложены с 2 августа 2026 года на 2 декабря 2027 года. Что касается ИИ, встроенного в продукты, указанные в Приложении I, новой датой стало 2 августа 2028 года.

    Обязательства по прозрачности, предусмотренные статьей 50, не были отложены и действуют с 2 августа 2026 года, как и планировалось изначально. Что касается систем, выпущенных на рынок ранее, обязанность маркировки согласно пункту 2 статьи 50 вступает в силу 2 декабря 2026 года.

    Инструменты, которые помогают аудиторам и предусматривают этап человеческого утверждения, обычно не входят в Приложение III, но оцените собственный случай использования: если какой-либо компонент влияет на решения о найме или кредитоспособности, он подпадает под действие правил. Все это не влияет на GDPR, который регулирует данные клиентов, проходящие через систему, независимо от того, как Закон об ИИ классифицирует данную систему.

    Спрос реален. Согласно опросу Wolters Kluwer, 39% из 4 214 специалистов по внутреннему аудиту заявили, что уже используют ИИ, а еще 41% планируют начать его использование в течение года.

    Поэтапный план создания подобной системы

    Для команды, которая начинает разработку такой системы, рекомендуемая последовательность действий следующая:

    1. Запустите систему на самом дешевом уровне, прошедшем ваш набор тестов. Зафиксируйте каждый вызов модели, позвольте аудиторам использовать ее в реальных условиях в период пиковой нагрузки и отложите любую доработку.
  • Изучите журналы логов. Определите два-три типа запросов, которые составляют большую часть обработанных данных, и проверьте, являются ли они повторяющимися и связанными с определенной структурой. Почти всегда так и бывает.
  • Тонкую настройку проводите только для этих запросов. Сначала разместите их на инфраструктуре без серверов, оставьте функции сортировки, составления ответов и отвечания на вопросы на модели frontier, а перед ними добавьте маршрутизатор.
  • Применяйте специализированные GPU только тогда, когда объем работы или требования контракта вынуждают это сделать, и ни на день раньше.
  • Три из этих четырех этапов обходятся дешевле, чем то, на что тратят многие команды с самого первого дня.

    Основные выводы

    • Современные модели frontier, как правило, не поддаются тонкой настройке, поэтому реальный выбор заключается между моделью с открытыми весами и адаптером LoRA и API, размещенным на сервере.
  • В пайплайнах обработки документов несколько повторяющихся вызовов, ограниченных схемой, потребляют большинство токенов; анализ затрат следует начинать именно с этого.
  • Перенаправление этих вызовов на самый дешевый подходящий уровень экономит гораздо больше средств, чем тонкая настройка, причем это занимает часы, а не недели.
  • Тонкая настройка оправдывает себя благодаря строгому соблюдению схемы и правилам размещения данных, а не из-за стоимости токенов.
  • Ресурсы для обучения дешевы; настоящими затратами являются маркированные данные, оценка и операции.
  • С самого начала ведите записи о всех вызовах, чтобы при последующей тонкой настройке иметь основу для анализа.
  • Цены, варианты размещения и сроки соблюдения регулирований быстро меняются; перед утверждением бюджета всегда проверяйте все цифры на страницах поставщика и в официальных документах.
  • Основной вопрос никогда не заключался в противостоянии маленькой модели и передовой модели. Речь идет о том, какие из ваших запросов действительно требуют логического анализа. Ответив на этот вопрос, вы в значительной степени решите и проблему затрат.

    Связанные материалы

  • Безопасная замена моделей LLM: человеческие метки, показатели за каждый шаг, настройки усилий — как мигрировать многоэтапную систему LLM на более новые модели, избегая вымышленных регрессий: использование человеческих эталонов, показателей за каждый шаг, устаревших запросов и оценки затрат на обработку информации.