Галоўная / Артыкулы / Jev ад TypeSafe AI: Модель без чату для прымэння рашэнняў на адной пазначцы

Jev ад TypeSafe AI: Модель без чату для прымэння рашэнняў на адной пазначцы

У этай статыяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяяя

2471 слоў

Jev — это першы модель адміністрацыі TypeSafe AI, стартапа з Сан-Францыско, які пачаў свою дзеяльнасць 15 сэптэбря 2026 года пасля ранейшага таямнічага стварэння, і які фінансуецца за счытком 40 мільйонаў долераў у першай раунде фінансавання пад кераваннем DCVC.

У працоўнасці ад большасці AI-сістэм, якія прадаюцца ў прасе, Jev не ёсьць моцным моделлю большых языкаў. Ён не можа ствараць рэченні, гэнераваць код чы прадставляць адпаведзі. У замяну вы даеце яму кароткую інформацыю пра стан справ, напрыклад, заявку на падтрымку кліента чы опис продукту, а таксама набор структураваных, типаваных запытанняў. У вярню я ён дае типаваныя адпаведзі, кожна з якіх супаўнажаная распадам верыгоднасцяў і рэйтингам адпаведальнасці. Не існуе прозы, якую трэба адгукнуць, і няма JSON-структуры, якую трэба пасля цього выправіць.

TypeSafe называе гэты падход моделлю "System One", яка трэнуецца за дапамогай метода, які компанія адначыта «Reinforcement Learning for Calibrated Decisions», або RLCD. Па словам компаніі, час адказу складае ад 70 да 500 мілісэкундаў, а цена станавіць 0,042 долара за мільйон токэнаў вхідных дадзеных; токэны выходных дадзеных не купуюцца ўжо зовсім.

Гэты паказаны ценавы параметр — не адказка на памылку. Выходныя дадзеныя ўжо зовсім безкоштовныя, таму што іх практычна немае.

Хто створыў TypeSafe AI

Заснавальнік і галоўны дырэктар компаніі, Діогу Алмейда, раней працаваў як дзеяч у OpenAI, вносячы вклад у развіцьце методаў падкрэпленага навчання на адзінаках людскай адзыву, такіх як InstructGPT, ChatGPT і GPT-4. Яго зарахоўваюць адним з співтворцаў тэхнікі RLHF, якая ператварыла первісныя мовныя моделі на прыдатных дасканальнікаў.

У складзе каманды керавання таксама ёсць Эрік Гафні як CTO і Саша Шэнг як COO. Компанія TypeSafe была створена у 2024 годзе і працавала таямніча прыбліжна два гады, перш чым стала публічной. Пасля гэтага раунда фінансавання журнал Forbes оцэніў вартасьць компаніі у адпрыязно 200 мільйонаў долераў.

Цікава тое, што Алмейда спадзяржаўся над самым падходам, які дапамогаў стварыць моделі, спроможныя задовольняць людскія прагантаванні, пры тым я ў настоўчасці стверджуе, што задовольненне людзей ніколі не было тым жа вызвам, як стварэнне надзеяныго програмнага забезпечэння. Калі хтось протыстоіць таму, што зробіла яго вядомым, гэта зазвычай ўскладненне таго, што яны пасвяцілі значны час перэосмысленню проблемы.

Назва компаніі паводзіцца з Вільямам Стэнлі Джэвансам, эканамістам XIX стагодзяда, вядомым за парадоксам Джэванса — адзінкам, які паказвае, што калі тэхналогія становіцца эфектывней, ўсеўказовое яе спрацоўванне тэндуюць раставаць, а не падымацца. Основная ідея тут простая: якщо зробіць інтэлект дастаткова дышучым, яго выкарыстоўванне значна распаўзецца.

Аспект

Кожны, хто раней выкорыстоўваў функцыі AI для е-камерцыі, верагодна страждаў ад тых сабе павтараючыхся проблем.

Разглядзім, якія рашэнні патрабуецца прымкнуць ад гэтых систем: Чы ў цім запите на пошук ідзе пра марку чы катэгорію? Чы падходзіць гэтае фота продукту для галоўнай сторонкі? Чы ў гэтым адзначэнні ідзе пра затрымкі у доставцы чы пра якасць продукту? Гэта незначныя рашэнні, якія кампетентны менеджер катэгорыі могаў бы прымкнуць за калькі секунд.

Адзначыцца, стандартны спосаб — перадаць такія запытанні через модель мовы. Яна стварае абзац тексту, які пасля таго прымусова перакладаецца у структуру JSON. Патрэбна ўстановка парсера для яе, логіка пераканання, алгорытмы павторных спроб, а таксі ў разе, калі павторныя спробы таксама не ведуць да рэшынкі. У практычным выкарыстоўванні, часта ў пачатку ночы, модель вяртае значэнне кацэгоріі, якога няма ў вашай таксаноміі, чым тыхо пашкоджаецца таблица для адпраўкі тавароў.

Проблемай ніколі не была сама інтэлігенцыя. Проблемай быў інтерфейс, які ёй супакоўваў.

Самэ гэтае прасечка, якую прагне запрацаваць Jev.

Основная тэза не ў тым, што гэтая модель разумее лепей за іншыя. Яна ў тым, што форма яе выходных даных нарэшце падходзіць таму, калі аплікацыі насправдзе патрабуюць.

Як насправдзе працюе Jev

Весь інтэфейс API складаецца толькі з трохоў кантэкста запытаў.

Запыт з варою дазволяе модэлю выбраць адну з вароў, якія вы задаеце, і вы отрымваете выбраны элемент разам з верагатнасцю, прызначанай кожнай вароў, а таксама з загальным значэнням доверы. У адной лісты можна задаць да 255 вароў.

Запыт з ацэнкай дазволяе модэлю оцаніць вхідны даны за шкалай упорядкованых рэвалюцый, якія вы самі задаеце — напрыклад, ступень сер’ёзнасці бага, ступень разчароўвання кліента або ступень готовасці адзінкі продукту. Разлічак, який отрымаеце, можа знаходзіцца межу двумя суседнімі рэвалюцыямі, а не точна на адной, і ў адказе таксама паказваецца цэлы распад за гэтай ацэнкай.

Запыт з «Так/Ня» представляе дваічны тверджэння. Адказ — это адзін цыфра з дыяпазону 0 і 1, якая паказвае верагатнасць таго, што адказ будзе «Так».

Этыя тры типы можна свабодна саюзваць у ўсём адным запытанні. Кожна запытанне ацэнюецца на адной і той жа стані вхідных дадзенняў, кожна з яых адгукваецца незалежна, і ўсія яны выконваюцца адночасна. З-за такога паралельнага обробкі дадзенняў, адносна незначны плян у дапытаннях ледзь вплывае на час адпаведзі. Кожны запытанні працуе ў межах спяльнага бюджэту прыблізна 32 000 токенаў, які павінен пакрыць як стан, так і самыя запытанні.

Этыя деталі бюджэту токена перакрашваюць спосаб працы над проектаваннем системы на аднойчыне з Jev. Паколькі дадзенне дапаможных запытанняў карыць практычна нічога дапаможнага, рэкомендуемая стратэгія — запытацца пра все, што толькі можна сабе уявіць, нават пра запытанні, адказы на якія актуальны толькі для певных даных, і проста адмовіцца ад таго, чым не выкарыстоўваецца ваша прыкладна програма. TypeSafe называе гэты патэрн спекулятивным розгалужэнням. Для тых, хто звычны да сітуацыі, калі кожны дадзенны запыт да модэлю прыносіць даплата і затрымку, такая змена стымулаў трэбуе часу, каб ёй пачаць цалкам разумецца.

У чым Jev адрозніцца ад LLM

Чатыры яскравыя асоблівасці выделяюць яго з-поміж мовных модэляў, адзягнутых у структураваны формат выходных дадзенняў.

Паўначальна мета навчання ў разы разлічная. RLHF оптымізуе модель так, каб яна давала адпаведзіць, якія люди оцэнююць позытыўна. RLVR оптымізуе модель для адпаведзіць, якія можа пераканаць верыфікатор, і гэта ўсё тое, што стоіць за моделямі для рассудкавання. Jev замест тыго викорыстоўвае метод пад назвай RLCD, які навчае модель выдаваць рашэнні, супакоўаныя з чыстаснымі оцэнкамі верагатнасці. Якшо Jev выдае 0,8 як рэйтынг абавесці, то це неявна обяцаўка, што сярод вялікага калекцыі падобных адпаведзіць праўда будзе правільная у адпаведныя 80 працэнтав. Калібрацыя тут не ёсць парадуктам — гэта сама сутнасць ціх систем.

Паўторна, адбір прыкладоў выканаеся паралельна, а не па спрабах. Тыповая модель мовы стварае тэкст токен за токенам, пры чым кожны новы токен залежыць ад усьго, што было створана раней. Jev жа стварае цэлы адказ за адну процедуру. Гэта і є прычыной яго швайнасці, а таксама таго, чаму стварэнне выходных даных не каштуюць дапаможна — няма дзейнага дужог ліста токенав, якія б платзіліся по аднаму.

Трэцья пункт — формат выходных даных не толькі рэкамендуецца, але і гарантуецца. Jev фізычна обмежана у можласці вяртаць значэння з пазначанага заранее набору, які вы задаеце. Гэта не ўзнака „звычайная сумеснасць“ — вярнуць ўсё, што не належыць да гэтага набору, за прыродой не можліва. Категорыя, створаная па абману, не толькі рэдкая, але і структурна выключаная з прастору можлівых выходных даных. TypeSafe абявляе пра 0 процэнтовы пакет памылак у некоректных структураваных выходных даных, і, на вядзіманне ад большасці показнікаў, гэты пакет ёсць прымусовым наследкам архітектуры, а не чымось, што было вымерана эмпірычна.

Чатвертая пункт — сама неяснасць спрацоўвае як рэальны выхід, а не як чыста наследка. Кожна адпаведь у відах «Выбор» чыста «Рэйтинг» супроводжваецца значэнням паверы, якое вылічваецца на адной засадзе — насколькі рошчэрпана верхня частка распаду праваможнасцяў. Распад, які розтрымліваецца на вялікай плошчы, сигналізуе пра асалодную неяснасць модэлю. Гэта дазволяе логіцы вашага прыемніка безпосередзя реагаваць на паверу — автаматычна дзейваць, калі павера перасягне адны порог, пераводзіць роботу на чалавека, калі яна знізиться нижэй іншага, а таксама ставіць строгейшыя вакуумы для дзеянняў з высокім рызыкам, чым для тых, дзе рызык нізькі.

Гэтае апошнее можласць, мабыць, ёсць найцэннейшая. Тое, што памылка трапляецца 5 процэнтав часу, рэдкая раз быў практычным пераканаўнікам у такіх системах. Пастаялыя проблемы былі ў тым, што не было можнасці выявіць, калькі саме 5 процэнтав.

Што на самай працоўнае значэнняя показываюць

Эта частак, дзе ўсупэўненасць є справадлівая, адколькі маркетынгавыя матэрыялы вельмі актыўна формуюць уявленне, а большая частка публікацый у Інтэрнете проста пераказвае загальныя цыфры, не аналізуючы детаўна.

TypeSafe адбіла ся своія тэсты, якія павінаваліся чатырох сцэнарыёў выкарыстоўвання: реагаванне на інцыдэты безпекі, адстежэнне дзеяння агентаў, обробка рахункоў-фактур і падтрымка кліянтаў, ўсьго прыблізна 711 тэстовых кейсаў. У замяне на падтверджаны людзьмі правільны адпаведнік, базовыя адпаведнікі былі створаны па сярэднему значэнню ацэнак GPT 6 Astra і Claude Fable 5.1.

Па адносу да гэтага набора базовых адпаведнікаў, Jev правільна даў адпаведны адпаведнік у 67,8 процэнаў случаёў. GPT 5.6 Terra таксама показаў рэзультат у 67,9 процэнаў — гэты результат на першы погляд выглядае чымраз лепа для TypeSafe.

Але якщо працаваць далей у таблыце рэзультатаў, картына зменшваецца. GPT 5.6 Sol парадуў точнасцю 74,1 процента, а Claude Opus 5 — 73,1 процента. Якщо звернуцца конкрэтна да падзеўкі обработкі рахункоў-фактур, Jev парадуў 61,8 процента проты 79,1 процента у Sol — разлік у сімнадцать пунктав, і ўжо не маленькі, у самэй той структураванай задачы выкарыстоўвання дадзеных, у якой багато потэнцыяльных корыстувачаў спадзяваюцца, што гэты модель будзе выдатны.

У чым Jev явна домінуе, так гэта ў вартасцы та швальнасці. Ён працуе за мерой приблізна 0,0004 долара за кожны кейс з адзінам секундай затрымкі, тады як Terra стоіць або трохі больш — адпаведна тры цэнты та дзесять секунд, тое ў обох аспектах разлік становіць прыблізна два порядка.

Якща говорыць часовісна, Jev практыкуеяся на роўні сэредзіны меж між точнасцю фронтейр-модэляў, пры чым коштуе ад чацвёртай да чатырохсотай часткі такога ж розмяру, а адпавядае за частку секунды. Чы гэты компроміс ўзгодны, залежыць абоўсумова ад каштоўкаў адпаведнага неправільнага рэшэння. Пры класыфікацыі мільйона запытанняў такі компроміс выглядае чыста прыемным. Пры автаматычнай згодзе на вярненне грошаў, хацелася б, каб механізм контролю абданняў выпрацоўваў рэальную, значымую фільтрацыю.

Варта памятаць два застерэжэння. Це цифры, прадастычныя самім продавцам, і досяглі ўжо няма жадных незалежных, масштабных перапрыцэпаў. А так какія-то аднаковыя адпаведзі былі створаны модэлямі OpenAI і Anthropic, усё паўстанавленне тых супароўнэнняў нейкім чынам спрямаванае на адзначэнне згоды самэльва з гэтымі двума семьямі модэляў.

Дзе я бы яго выкарыстоўваў

Разглянем можлівасць стварэння функцыяй для аналізу патронакоў і маркетынгу для е-камерчыясной платформы, яка працуе з продуктамі для домашняй хаты і загальнай таварою на канулькох рынках Персійскага залыва. Гэта прыблізна тое, як такая команда могла бы прадалаць задачы Jev у сваім списку на выпаленне.

Розумеўце запыткаў у масштабе каталагу, верагодна, будзе першым пунктам. Платформа, якая працуе на канулькох рынках і з канулькіма мовамі, сталквецца з вельмі большым коллекцыям запыткаў. Задачы, такія як класыфікацыя намеру, аддзеленне назв брэндаў ад тэрмінаў катаграфій і атрыбутаў, а таксама пазначэнне запыткаў, якія, верагодна, дацягнуць порожнія рэзультаты, наразе адрабоўваюцца за дапамогою сумяшання правіл, якія з часам стаюць менш эфектывнымі, плюс часам выкарыстоўваюцца модулі LLM, якія є занадта дорогімі для адрабоўкі ў такім велікім обсязе. Пры прыблізна $42 за мільярд токэнаў вхіднага тэксту, адрабоўка такой класыфікацыі для кожнага запытку ў кожны дзень становіцца фінансава рэалістычной.

Ацэнка якосці контэнту — ўсё таксама адны з найболей перспективных вароў. Кожны аблік продукту можна ацэніваць за яснасцю заглавля, сігналамі якосці зяўленняў і полнотай атрыбутаў, пры чым тыя з найніжэйшыми баламі направляюцца назад да каманды каталога для выправлення. По суті, гэта адна падтваржаная запытка типу «ацэнка», якая прыменяецца у масштабах мільйонав — задача, якая традыцыйна ўсё ж занадто дорога для адработкі за дапамогою LLM і занадто сложная для закодавання як строгія правіла.

Адаптаванне пошуку на адміністрацыю на адкладнасць значэння — гэта трэці варыянт прыменення. У замест на пакупку дадзэных пра адкладнасць, пазначаных людзьмі, або оплата дорогага модэля для ўтварэння такіх дадзэных, пары запита-товар могу быць оцэненыя масова, каб створыць незалежную базу дадзэных пра адкладнасць. У савой дакументацыі TypeSafe па переранкінгу згадваецца падысканне тачнасці першага рэзультата з 5 процэнта да 18 процэнта на тэстах пошуку юрыдычных дакументаў — гэта абнадзейлівы сигнал, нават які тэматыка гэтых тэстаў мало спакойнае з пошукам у э-камерцыі.

На заканчэнне, захоўкі для існуючых функцый, якія работаюць на адной з ЛІМ-модэляў, ёсць цалкам логічным рашэнням. Перакантрольванне вхідных і выходных дадзэных будь-якай функцыі для пераказоў на наявнасць спробаў абходу захоўкаў і наявнасці паляганняў на правілах выклікае неабходнасць быстраага і недорогага перакантрольвання, каб гэта сама не стала бутылочным горлам, і гэта самае ўсё, для чаго створаны Jev.

Дзе я бы яго не выкарыстоўваў

Будзь-яка ситуацыя, якая выклікае патрэбу ў адказе, не падходзіць. Jev ніколі не прыносіць аргументаў, точка. Калі продавец разважае, чаму яго айтэм падняўся ніжэй у рангаванні, адказ «модель даўае 2,1 з 4» нікому не задовольняе.

Задачы, якія выкалікаюць неабходнасць аргументаў у розныя, залежныя адзін ад другога крокі, таксама не падходзяць. TypeSafe чытна пісае пра гэта ў свайных дасведчэннях: разбейце вашу проблему на самастоятельныя запытанні або выберце інструмент, калі айтэмы, згрупаваныя ў адну запрос, не маюць можлівасці бачыць адпаведныя адказы на іншыя запытанні.

Там, дзе точнасць мае большое значэнне чым швальнасць, трэба быць аўтарытетным. Гэтыя слабасі ў обробцы рахункоў-фактур — не проста дробныя недагоднасці, а справжнія сігналы парадкі.

І яго не трэба выклікваты там, дзе нельга спачатку пераканаліць яго на паслужнасць вашых сабе дадзэй. 67,8 процента сумарнага рэйтингу па чатыро критэрыя іншага чалавека майже ніч не паведамляе пра тое, як модель справіцца з арабскімі назвамі продуктав і пра тое, як класифікуюць продукты ў рынках Персійскага заліва.

Большая ідея

Якіх-небудзь показначыкаў дня запуску можна не браць у расчыт, але існуе основная тэза, якая застаецца актуальной незалежна ад таго, чы рэштаўцюе Jev у гэй кантэксте чамусьці.

Тэкст ніколі не быў належным інтарфейсам між модэлем і програмнай аплявацыёю, якая павінна працаваць з його выходным дадзеннем. Мы ўсё-такі зусім проста вжывалі його, таму што гэты быў доступны формат, а пасля працавалі гады над стварэнням парсероў, верыфікатораў, логіки павторных спроб і перакалькатораў схем, толькі каб чыгараць наследкі. Кожны з гэтых слоёў існуе выключна для таго, каб пераклаць ўсё, што створанае для чытання людзьмі, у тое, што машына можа безпечна пераробіць.

Якщо большая частка вжывання ШІ ў канцэ наступіць унутры пайплайнаў програмнага забезпечэння, а не ў інтарфейсах чату — і гэта здаецца правядзімым напрамкам развіцця — тады система, якая выканае гэту роботу, верагодна, вовсе не павінна быць оптымізаваная для стварэння чытабельных рэчэнняў. Сама TypeSafe ацэнюе, што автаматызацыя у масштабе ў канцэ становіць прыблізна 99 процэнтаваў кантакту машына-машына. Тачны показнік є спарчлівым. Але загальны напрамак развіцця гораздка легча заперачыць.

Можа, Jev не стане тым модэлем, які дапаможа промышленасці досягнуць прагнутага рэзультата. Ён мае вузкі спектар застосоўвання, ёщэ новы, паводзіцца на самастаўленыя даны і астаецца позаду найлепшых модэляў за чыстой тачнасцю. Але ён ужо змог даць конкрэтную, перапытную твердзібу пра тое, дзе самэ ў нашых чынных системах знаходзіцца прычына проблем.

Гэтая прычына проблема є там, чырвоным пунктам, які команды стараюцца адмаўліваць ўсё тады, калі ствараюць функцыі на адной з тэхналогій AI. Было б прыемна, каб яна нарэшце знікла.

Спадневана літэратура

  • Fugu Ultra: Як модель AI-оркестратора каналізуе завданні через спецыялізаваныя моделі замест аднаго велікага LLM, і як яна прабывае на тэстах, па цэнам і ў аспекте прозрачнасці — Адказвае на пытанні, як Fugu Ultra v2 ад компаніі Sakana AI распадзеляе задачы між спецыялістамі-моделямі замест аднаго велікага языковога модэля, і як яна прабывае ў порэванні за критэрамі тэстаў, цэнаў і прозрачнасці.