Gdy modele oceniają architekturę: błędy w kryteriach oceny, które wymagają uwzględnienia w budżecie
Weryfikatorzy LLM wymyślają ścisłe kryteria prawdy, mylą demonstracje z produktami oraz nagradzają standardowe teksty — opracujcie kryteria oceny, które uwzględniają cel.
Wykorzystywanie modeli do oceny odpowiedzi dotyczących architektury – i gdzie to zawodzi
Zespoły proszą modele językowe o przeglądanie odpowiedzi dotyczących architektury systemów w taki sam sposób, jak robiłby to praktykujący architekt. Pomysł jest kuszący: możliwość skaliowania procesu oceny, stosowanie wytycznych oceniania, wykrywanie braków. W praktyce osoby oceniające tworzą bardziej rygorystyczne kryteria prawdy niż używają to inżynierowie, mylą zakres demonstracji projektu z możliwościami produktu, akceptują pytania uzasadnione dowodami, ale absurdalne, optymalizują dostarczone testy zamiast niewyrażonego celu i pozostawiają przestarzałe odpowiedzi po zmianie pytań. Lubią również standardowe teksty brzmiące profesjonalnie, ale mówiące niewiele.
Testowany system
W ramach badania odpowiedzi kandydatów na temat konkretnego systemu porównywano z wynikami modeli językowych sprawdzających poprawność, dostępność dowodów i zakres odpowiedzi za pomocą list kontrolnych. Ludzcy architekci w spójny sposób nie zgadzali się z modelem, co warto udokumentować.
Błąd 1 – filozoficzny rygor
Inżynierowie działają w warunkach niepewności; modele zmierzają ku absolutnym definicjom tego, co „poprawne”. Projekt, który jest wystarczająco dobry przy określonych ograniczeniach, jest krytykowany za brak udowodnienia metafizycznej optymalności. Kryteria oceny muszą odzwierciedlać „odpowiedniość do celu”, a nie „prawdziwość we wszystkich możliwych światach”.
Błąd 2 — dowód projektu versus możliwości produktu
Jeśli repozytorium udowadnia właściwości określonego fragmentu produktu, modele często twierdzą, że cały produkt już je posiada. Osoby sprawdzające muszą oddzielić dowody dotyczące testowanego produktu od twierdzeń o charakterze marketingowym.
Błąd 3 — pytania uzasadnione dowodami, ale absurdalne
Pytanie może powoływać się na konkretne pliki, a mimo to być błędnym. Maszyny optymalizują działanie na podstawie dostarczonych testów; ludzie zauważają, gdy testy nie odpowiadają celowi. W kryteriach oceny należy uwzględnić sprawdzenie zgodności z celem.
Błąd 4 — poprawianie pytań bez ponownej oceny odpowiedzi
Lokalne edycje zapytań bez globalnej ponownej oceny semantycznej pozostawiają odpowiedzi „sieroty”, które już się nie zgadzają. Higiena procesu: zwiększyć wersję pytania i unieważnić zapisane oceny.
Błąd 5 — siła szablonów
Modele wytwarzają wiarygodne teksty o architekturze — „należy wziąć pod uwagę skalowalność, bezpieczeństwo, możliwość obserwacji” — nie zajmując się rzeczywistymi wąskimi gardłami systemu. Konieczne jest podawanie odniesień do konkretnych komponentów.
250000 Gbps
Zasady projektowe dla weryfikacji AI
- Kryteria oceny z wyraźną tolerancją na praktyczne aspekty inżynieryjne.
- Odrębne oceny dla jakości dowodów i odpowiedniej trafności pytania.
- Banki pytań w wersjach z obowiązkową ponowną oceną.
- Ludzkie audyty w przypadkach niezgód.
- Zabranienie nieuzasadnionych, ogólnikowych rad w ocenach o wysokim znaczeniu.
Co nadal działa
Sztuczne inteligencje typu LLM pomagają w wykrywaniu brakujących sekcji, niespójnej terminologii oraz nieobecnych diagramów, gdy są odpowiednio wykorzystywane. Są one asystentami architektów, a nie zamiennikami ich osądu co do celu projektu.
Zakończenie
Sztuczna inteligencja sprawdzająca inną sztuczną inteligencję zawodzi, gdy test zapomina o ludzkim celu architektury – podejmowaniu decyzji w ramach określonych ograniczeń. Twórz narzędzia sprawdzające, które respektują te ograniczenia, w przeciwnym razie skutkować to będzie karą dla właśnie tego osądu inżynieryjnego, którego się posługujesz.
Rozszerzone wskazówki dotyczące platform i procesu rekrutacji
Jeśli włączasz narzędzia oceniające typu LLM do rozmów kwalifikacyjnych lub pakietów awansowych, publikuj kryteria oceny dla kandydatów tam, gdzie jest to etycznie dozwolone, utrzymuj ludzi w obiegu przy wynikach na granicy dopuszczalnych wartości oraz rotuj pytania, aby modele nie mogły zapamiętać powierzchownych odpowiedzi. Co kwartał sprawdzaj wskaźniki błędnych odrzuceń i błędnych przyjęć w porównaniu z ocenami wydawanymi przez doświadczonych ludzkich ekspertów.
Zacznij od odpowiedzi napisanych ręcznie przez ludzi. Skalibruj model tak, aby zgadzał się w prostych przypadkach. Przeanalizuj trudne spory. Dopiero wtedy zautomatyzuj ocenę pierwszego etapu przy obowiązkowej ludzkiej weryfikacji powyżej ustalonego progu ryzyka. Nigdy nie pozwalaj, by decyzja personalna o nieodwracalnych konsekwencjach opierała się na wyniku modelu, który nie został sprawdzony.
Głębia dopasowania celów
Architektura istnieje po to, by realizować cele interesariuszy w ramach określonych ograniczeń. Weryfikator, który nie potrafi określić tych celów, doskonale oceni coś niewłaściwego. W każdym pakiecie z pytaniami muszą znajdować się sformułowania celów. Odpowiedź musi ponownie przedstawić cele przed zaproponowaniem struktury. Oceniaj powiązanie między celami a mechanizmami, a nie tylko elokwencję samych mechanizmów.
Rozwój w organizacji
Pilnuj wewnętrznych przeglądów projektu przed kolejnymi rundami oceny kandydatów. Mierz oszczędzoną czas oraz wskaźnik odwołań. Zaproście ścieżkę odwołania, która szybko łączy się z ludzkim architektem. Udokumentuj znane błędy modelu. Ponownie przeszkol lub zastąp kryteria oceny, gdy zmieniają się elementy infrastruktury – dostawcy chmury, regulacje prawa lub charakter ruchu.
Podsumowanie
Weryfikatory LLM poprawiają jakość kryteriów oceny. Słabe kryteria, nawet w skali, pozostają słabe. Silne kryteria w połączeniu z nadzorem ludzkim mogą przyspieszyć proces oceny. Powyższe problemy nie są powodem porzucenia narzędzi; to właśnie one określają zasady ich używania bez oszukiwania samego siebie.
Rozszerzone wskazówki dotyczące platformy i procesu rekrutacji
Jeśli włączasz narzędzia oceny oparte na modelach językowych do rozmów kwalifikacyjnych lub pakietów awansowych, publikuj kryteria oceny dla kandydatów tam, gdzie jest to etycznie dozwolone, utrzymuj ludzi w bieżącej informacji na temat wyników na granicy dopuszczalnych wartości oraz rotuj pytania, aby modele nie mogły zapamiętać powierzchownych odpowiedzi. Co kwartał sprawdzaj wskaźniki fałszywych niepowodzeń i udanych ocen w porównaniu z grupami ekspertów ludzkich.
Walidacja architektury to proces społeczno-techniczny. Narzędzia, które ignorują ograniczenia organizacyjne, budżet oraz rzeczywistość operacyjną, będą systematycznie błędnie oceniać osoby, które prawidłowo optymalizują swoje działania pod kątem tych niewyrażonych czynników. Zapisz te czynniki lub przestań udawać, że narzędzie oceny jest neutralne.
Kolejne rodzaje awarii, na które warto przeznaczyć budżet
Błąd 6: ocenianie rozwlekłości jako rygoru. Błąd 7: karanie języka wyrażającego niepewność, którego eksperci poprawnie używają. Błąd 8: nagradzanie frameworków nieistotnych dla systemu. Błąd 9: ignorowanie dowodów operacyjnych, takich jak podręczniki postępowania i SLO. Błąd 10: zmienianie kryteriów oceny pomiędzy różnymi przeprowadzeniami bez uprzedzenia.
Każdy z tych problemów ma rozwiązanie: limity długości, punkty za skalibrowaną niepewność, filtry relewności, wymagania dotyczące dowodów operacyjnych oraz kontrolne sumy kryteriów oceny w rejestrach ocen.
Praktyczny plan działania
Zacznij od ręcznie napisanych wzorcowych odpowiedzi. Skalibruj model tak, aby zgadzał się w prostych przypadkach. Przeanalizuj trudne spory. Dopiero wtedy zautomatyzuj pierwszą ocenę z obowiązkową rewizją przez człowieka przy przekroczeniu progu ryzyka. Nigdy nie pozwalaj, aby nieodwracalna decyzja personalna opierała się na ocenie modelu, która nie została sprawdzona.
Głębsze omówienie dopasowania celów
Architektura istnieje po to, by realizować cele zainteresowanych stron w ramach określonych ograniczeń. Weryfikator, który nie potrafi określić tych celów, doskonale oceni coś niewłaściwego. W każdym zestawie pytań należy wymagać sformułowania celów. Odpowiedź musi ponownie przedstawić cele przed zaproponowaniem struktury. Oceniać należy powiązanie między celami a mechanizmami, a nie tylko elokwencję samych mechanizmów.
Rozwój organizacyjny
Najpierw przeprowadzić pilotaż w ramach wewnętrznych przeglądów projektowych, zanim rozpocząć testy w pełnym zakresie. Pomierzyć oszczędzoną czas oraz wskaźnik skuteczności. Zapewnić drogę odwołania prowadzącą szybko do ludzkiego architekta. Udokumentować znane błędy modelu. Przeprowadzić ponowne szkolenie lub zastąpić kryteria oceny w razie zmian w infrastrukturze – dostawcach chmury, regulacjach prawa lub charakterze ruchu.
Podsumowanie
Weryfikatory LLM poprawiają jakość kryteriów oceny. Słabe kryteria, nawet w skali, zachowują swoją słabość. Silne kryteria w połączeniu z nadzorem ludzkim mogą przyspieszyć proces oceny. Powyższe problemy nie są powodem do porzucenia tych narzędzi; stanowią one wytyczne dotyczące ich używania bez oszukiwania samego siebie.
Rozszerzone wskazówki dotyczące platform i procesu rekrutacji
Jeśli włączasz narzędzia oceny LLM do rozmów kwalifikacyjnych lub pakietów awansowych, publikuj kryteria oceny dla kandydatów tam, gdzie jest to etycznie dozwolone, utrzymuj ludzi w obiegu przy wynikach na granicy i zmieniaj pytania, aby modele nie mogły zapamiętać powierzchownych odpowiedzi. Co kwartał sprawdzaj wskaźniki błędnych odrzuceń i błędnych przyjęć w porównaniu z ocenami ekspertów ludzkich.
Zacznij od odpowiedzi napisanych ręcznie przez ludzi. Skalibruj model tak, aby zgadzał się w prostych przypadkach. Przeanalizuj trudne spory. Dopiero wtedy zautomatyzuj ocenę pierwszego etapu przy obowiązkowej rewizji przez człowieka, jeśli przekroczony zostanie próg ryzyka. Nigdy nie pozwalaj, by decyzja personalna o nieodwracalnych konsekwencjach opierała się na wyniku modelu, który nie został sprawdzony.
Głębia w dopasowaniu celów
Architektura istnieje po to, by realizować cele interesariuszy w ramach określonych ograniczeń. Weryfikator, który nie potrafi określić tych celów, doskonale oceni coś niewłaściwego. W każdym pakiecie z pytaniami należy podać sformułowania celów. Odpowiedź musi ponownie przedstawić cele przed zaproponowaniem struktury. Oceniaj powiązanie między celami a mechanizmami, a nie tylko elokwencję samych mechanizmów.
Rozwój w organizacji
Pilnuj wewnętrznych przeglądów projektu przed kolejnymi rundami oceny kandydatów. Mierz oszczędzoną czas oraz wskaźnik odwołań. Zaproście ścieżkę odwołania, która szybko łączy się z ludzkim architektem. Udokumentuj znane błędy modelu. Ponownie przeszkol lub zastąp kryteria oceny, gdy zmieniają się elementy infrastruktury – dostawcy chmury, regulacje prawa lub charakter ruchu.
Podsumowanie
Weryfikatory LLM poprawiają jakość kryteriów oceny. Słabe kryteria, nawet w skali, pozostają słabe. Silne kryteria w połączeniu z nadzorem ludzkim mogą przyspieszyć proces oceny. Powyższe problemy nie są powodem porzucenia narzędzi; to właśnie one określają zasady ich używania bez oszukiwania samego siebie.
Rozszerzone wskazówki dotyczące platformy i procesu rekrutacji
Jeśli włączasz narzędzia oceniające oparte na modelach językowych do rozmów kwalifikacyjnych lub pakietów awansowych, publikuj kryteria oceny dla kandydatów tam, gdzie jest to etycznie dozwolone, utrzymuj ludzi w biegu w przypadku wyników na granicy dopuszczalnych wartości oraz rotuj pytania, aby modele nie mogły zapamiętać powierzchownych odpowiedzi. Co kwartał sprawdzaj wskaźniki fałszywych niepowodzeń i udanych ocen w porównaniu z grupami ekspertów ludzkich.
Walidacja architektury to proces społeczno-techniczny. Narzędzia, które ignorują ograniczenia organizacyjne, budżet oraz rzeczywistość operacyjną, będą systematycznie błędnie oceniać osoby, które prawidłowo optymalizują swoje działania pod kątem tych niewyrażonych jasno zmiennych. Zapisz te zmienne lub przestań udawać, że narzędzie oceniające jest neutralne.
Kolejne rodzaje awarii, na które warto przeznaczyć budżet
Błąd 6: ocenianie rozwlekłości jako rygoru. Błąd 7: karanie języka wyrażającego niepewność, którego eksperci poprawnie używają. Błąd 8: nagradzanie frameworków nieistotnych dla systemu. Błąd 9: ignorowanie dowodów operacyjnych, takich jak podręczniki postępowania i SLO. Błąd 10: zmienianie kryteriów oceny pomiędzy różnymi przeprowadzeniami bez uprzedzenia.
Każdy z tych problemów ma rozwiązanie: limity długości, punkty za skalibrowaną niepewność, filtry relewności, wymagania dotyczące dowodów operacyjnych oraz kontrolne sumy kryteriów oceny w rejestrach ocen.
Praktyczny plan działania
Zacznij od ręcznie napisanych wzorcowych odpowiedzi. Skalibruj model tak, aby zgadzał się w prostych przypadkach. Przeanalizuj trudne spory. Dopiero wtedy zautomatyzuj pierwszą ocenę z obowiązkową rewizją przez człowieka przy przekroczeniu progu ryzyka. Nigdy nie pozwalaj, aby nieodwracalna decyzja personalna opierała się na ocenie modelu, która nie została sprawdzona.
Głębsze omówienie dopasowania celów
Architektura istnieje po to, by realizować cele zainteresowanych stron w ramach określonych ograniczeń. Weryfikator, który nie potrafi określić tych celów, doskonale oceni coś niewłaściwego. W każdym zestawie pytań należy wymagać sformułowania celów. Odpowiedź musi ponownie przedstawić cele przed zaproponowaniem struktury. Oceniać należy powiązanie między celami a mechanizmami, a nie tylko elokwencję samych mechanizmów.
Rozwój organizacyjny
Najpierw przeprowadzić pilotaż w ramach wewnętrznych przeglądów projektowych, zanim rozpocząć testy w pełnym zakresie. Pomierzyć oszczędzoną czas oraz wskaźnik skuteczności. Zapewnić drogę odwołania prowadzącą szybko do ludzkiego architekta. Udokumentować znane błędy modelu. Przeprowadzić ponowne szkolenie lub zastąpić kryteria oceny w razie zmian w infrastrukturze – dostawcach chmury, regulacjach prawa lub charakterze ruchu.
Podsumowanie
Weryfikatory LLM poprawiają jakość kryteriów oceny. Słabe kryteria, nawet w skali, zachowują swoją słabość. Silne kryteria w połączeniu z nadzorem ludzkim mogą przyspieszyć proces oceny. Powyższe problemy nie są powodem do porzucenia tych narzędzi; stanowią one wytyczne dotyczące ich używania bez oszukiwania samego siebie.
Rozszerzone wskazówki dotyczące platform i procesów rekrutacyjnych
Jeśli włączasz narzędzia oceny LLM do rozmów kwalifikacyjnych lub pakietów awansowych, publikuj kryteria oceny dla kandydatów tam, gdzie jest to etycznie dozwolone, utrzymuj ludzi w obiegu przy wynikach na granicy i rotuj pytania, aby modele nie mogły zapamiętać powierzchownych odpowiedzi. Co kwartał sprawdzaj wskaźniki fałszywych niepowodzeń i udanych ocen w porównaniu z grupami ekspertów ludzkich.
Zacznij od odpowiedzi napisanych ręcznie przez ludzi. Skalibruj model tak, aby zgadzał się w prostych przypadkach. Przeanalizuj trudne spory. Dopiero wtedy zautomatyzuj ocenę pierwszego etapu przy obowiązkowej ludzkiej weryfikacji powyżej ustalonego progu ryzyka. Nigdy nie pozwalaj, by nieodwracalna decyzja personalna opierała się na wyniku modelu, który nie został sprawdzony.
Głębia dopasowania celów
Architektura istnieje po to, by realizować cele interesariuszy w ramach określonych ograniczeń. Weryfikator, który nie potrafi określić tych celów, doskonale oceni coś zupełnie nieprawidłowego. W każdym pakiecie z pytaniami muszą znajdować się sformułowania celów. Odpowiedź musi ponownie przedstawić cele przed zaproponowaniem struktury. Oceniaj powiązanie między celami a mechanizmami, a nie tylko elokwencję samych mechanizmów.
Rozwój w organizacji
Pilnuj wewnętrznych przeglądów projektu przed kolejnymi rundami oceny kandydatów. Mierz oszczędzoną czas oraz wskaźnik odwołań. Zaproście ścieżkę odwołania, która szybko łączy się z ludzkim architektem. Udokumentuj znane błędy modelu. Ponownie przeszkol lub zastąp kryteria oceny, gdy zmieniają się elementy infrastruktury – dostawcy chmury, regulacje prawa lub charakter ruchu.
Podsumowanie
Weryfikatory LLM poprawiają jakość kryteriów oceny. Słabe kryteria, nawet w skali, pozostają słabe. Silne kryteria w połączeniu z nadzorem ludzkim mogą przyspieszyć proces oceny. Powyższe problemy nie są powodem porzucenia narzędzi; to właśnie one określają zasady ich używania bez oszukiwania samego siebie.
Rozszerzone wskazówki dotyczące platformy i procesu rekrutacji
Jeśli włączasz narzędzia oceny oparte na modelach językowych do rozmów kwalifikacyjnych lub pakietów awansowych, publikuj kryteria oceny dla kandydatów tam, gdzie jest to etycznie dozwolone, utrzymuj ludzi w biegu w przypadku wyników na granicy dopuszczalnych wartości oraz rotuj pytania, aby modele nie mogły zapamiętać powierzchownych odpowiedzi. Co kwartał sprawdzaj wskaźniki fałszywych niepowodzeń i udanych ocen w porównaniu z grupami ekspertów ludzkich.
Walidacja architektury to proces społeczno-techniczny. Narzędzia, które ignorują ograniczenia organizacyjne, budżet oraz rzeczywistość operacyjną, będą systematycznie błędnie oceniać osoby, które prawidłowo optymalizują swoje działania pod kątem tych niewyrażonych jasno zmiennych. Zapisz te zmienne lub przestań udawać, że narzędzie oceny jest neutralne.
Kolejne rodzaje awarii, na które warto przeznaczyć budżet
Błąd 6: ocenianie rozwlekłości jako rygoru. Błąd 7: karanie języka wyrażającego niepewność, którego eksperci poprawnie używają. Błąd 8: nagradzanie frameworków nieistotnych dla systemu. Błąd 9: ignorowanie dowodów operacyjnych, takich jak podręczniki postępowania i SLO. Błąd 10: zmienianie kryteriów oceny pomiędzy różnymi próbami bez uprzedzenia.
Każdy z tych problemów ma rozwiązanie: limity długości, punkty za skalibrowaną niepewność, filtry relewności, wymagania dotyczące dowodów operacyjnych oraz kontrolne sumy kryteriów oceny w rejestrach ocen.
Praktyczny plan działania
Zacznij od ręcznie napisanych wzorcowych odpowiedzi. Skalibruj model tak, aby zgadzał się w prostych przypadkach. Przeanalizuj trudne spory. Dopiero wtedy zautomatyzuj pierwszą ocenę z obowiązkową rewizją przez człowieka przy przekroczeniu progu ryzyka. Nigdy nie pozwalaj, aby nieodwracalna decyzja personalna opierała się na ocenie modelu, która nie została sprawdzona.
Głębsze omówienie dopasowania celów
Architektura istnieje po to, by realizować cele zainteresowanych stron w ramach określonych ograniczeń. Weryfikator, który nie potrafi określić tych celów, doskonale oceni coś niewłaściwego. W każdym zestawie pytań należy wymagać sformułowania celów. Odpowiedź musi ponownie przedstawić cele przed zaproponowaniem struktury. Oceniać należy powiązanie między celami a mechanizmami, a nie tylko elokwencję samych mechanizmów.
Rozwój organizacyjny
Najpierw przeprowadzić pilotaż w ramach wewnętrznych przeglądów projektowych, zanim rozpocząć testy z udziałem kandydatów. Pomierzyć oszczędzoną czas oraz wskaźnik zaufania do rozwiązania. Zapewnić drogę odwołania, która szybko doprowadzi do osoby odpowiedzialnej za architekturę. Udokumentować znane błędy modelu. Przeprowadzić ponowne szkolenie lub zastąpić kryteria oceny w razie zmian w infrastrukturze – dostawcach chmury, regulacjach prawa lub charakterze ruchu.
Podsumowanie
Weryfikatory LLM poprawiają jakość kryteriów oceny. Słabe kryteria, nawet w skali, zachowują swoją słabość. Silne kryteria w połączeniu z nadzorem ludzkim mogą przyspieszyć proces oceny. Powyższe problemy nie są powodem do porzucenia tych narzędzi; stanowią one wytyczne dotyczące ich używania bez oszukiwania samego siebie.
Rozszerzone wskazówki dotyczące platform i procesów rekrutacyjnych
Jeśli włączasz narzędzia oceny LLM do rozmów kwalifikacyjnych lub pakietów awansowych, publikuj kryteria oceny dla kandydatów tam, gdzie jest to etycznie dozwolone, utrzymuj ludzi w obiegu przy wynikach na granicy i rotuj pytania, aby modele nie mogły zapamiętać powierzchownych odpowiedzi. Co kwartał sprawdzaj wskaźniki błędnych odrzuceń i błędnych przyjęć w porównaniu z ocenami ekspertów ludzkich.
Zacznij od odpowiedzi napisanych ręcznie przez ludzi. Skalibruj model tak, aby zgadzał się w prostych przypadkach. Przeanalizuj trudne spory. Dopiero wtedy zautomatyzuj ocenę pierwszego etapu przy obowiązkowej rewizji przez człowieka, jeśli przekroczony zostanie próg ryzyka. Nigdy nie pozwalaj, by decyzja personalna o nieodwracalnych konsekwencjach opierała się na wyniku modelu, który nie został sprawdzony.
Głębia w dopasowaniu celów
Architektura istnieje po to, by realizować cele interesariuszy w ramach określonych ograniczeń. Weryfikator, który nie potrafi określić tych celów, doskonale oceni coś niewłaściwego. W każdym pakiecie z pytaniami należy podać sformułowania celów. Odpowiedź musi ponownie przedstawić cele przed zaproponowaniem struktury. Oceniaj powiązanie między celami a mechanizmami, a nie tylko elokwencję samych mechanizmów.
Rozwój w organizacji
Pilnuj wewnętrznych przeglądów projektu przed poddaniem kandydatów do ponownej oceny. Mierz zaoszczędzony czas w porównaniu z odsetkiem apelacji. Zaproście ścieżkę apelacji, która szybko łączy się z ludzkim architektem. Udokumentuj znane błędy modelu. Ponownie przeszkol lub zastąp kryteria oceny, gdy zmieniają się elementy infrastruktury – dostawcy chmury, regulacje compliance czy charakter ruchu.
Podsumowanie
Weryfikatory LLM poprawiają jakość kryteriów oceny. Słabe kryteria, mimo skalowania, zachowują swoją słabość. Silne kryteria w połączeniu z nadzorem ludzkim mogą przyspieszyć proces oceny. Powyższe problemy nie są powodem porzucenia narzędzi; stanowią one wytyczne do ich efektywnego używania bez oszukiwania samego siebie.
Literatura pokrewna
- Architektura AI w przedsiębiorstwach: RAG znajduje, LLMy rozumują, modele decyzyjne wybierają — Dlaczego samodzielne wyszukiwanie informacji i rozumowanie językowe nie wystarczą — jak GraphRAG, agenci oraz modele decyzyjne System 1, takie jak Jev, oddzielają wiedzę, kontekst, rozumowanie, podejmowanie decyzji i ich realizację.
- Modele decyzyjne z type’em vs wywołania LLM: opóźnienie i stabilność na granicy — Eksperyment obejmujący 240 wywołań, w którym porównano naturalne prawdopodobieństwa dostępne w Jev z tymi podawanymi przez sam LLM, oraz sposoby przekształcenia tych danych w router modeli LangChain.