Accueil / Articles / Lorsque les modèles évaluent l’architecture : erreurs dans la grille d’évaluation à prendre en compte pour le budget

Lorsque les modèles évaluent l’architecture : erreurs dans la grille d’évaluation à prendre en compte pour le budget

Les vérificateurs d’LLM inventent une vérité stricte, confondent les démos avec les produits, et récompensent le texte générique — conçoivez des critères qui respectent l’objectif.

2925 mots

Utilisation de modèles pour évaluer les réponses en architecture – et où cela échoue

Les équipes demandent aux LLM d’examiner les réponses relatives à l’architecture de systèmes de la même manière qu’un architecte professionnel le ferait. L’idée est séduisante : élargir l’évaluation, appliquer des critères précis, identifier les lacunes. En pratique, ces évaluateurs inventent des normes de rigueur plus strictes que celles utilisées par les ingénieurs, confondent l’étendue de la démonstration d’un projet avec ses capacités réelles, acceptent des questions fondées mais ridicules, optimisent les tests fournis plutôt que l’objectif réel non exprimé, et laissent en place des réponses obsolètes lorsque les questions changent. Ils apprécient également des textes types plausibles qui donnent l’impression d’une grande expertise tout en disant peu.

Le système testé

Une configuration d’étude a associé des réponses de candidats concernant un système concret à un vérificateur LLM qui utilisait des listes de contrôle pour évaluer la correction, les preuves et l’étendue. Les architectes humains étaient en désaccord avec le modèle de manière récurrente, selon des schémas dignes d’être documentés.

Echec 1 – rigueur philosophique

Les ingénieurs travaillent dans l’incertitude ; les modèles tendent vers des définitions absolues de ce qui est « correct ». Un design suffisamment bon dans le cadre des contraintes est critiqué pour ne pas prouver une optimisation métaphysique. Les critères d’évaluation doivent prendre en compte l’adéquation avec la finalité, et non la vérité dans tous les mondes possibles.

Echec 2 — preuve de projet versus capacité du produit

Si un dépôt prouve une partie spécifique d’un système, les modèles affirment souvent que l’ensemble du produit le fait déjà. Les vérificateurs doivent séparer les preuves concernant l’artefact testé des affirmations à grande échelle destinées au marketing.

Echec 3 — questions étayées mais ridicules

Même une question qui cite des fichiers peut être fausse. Les machines s’optimisent en fonction des tests fournis ; les humains détectent lorsque le test ne correspond pas à la finalité. Il convient d’inclure des vérifications de finalité dans les critères d’évaluation.

Echec 4 — correction des questions sans réévaluation des réponses

Les modifications locales des prompts, sans réévaluation sémantique globale, génèrent des réponses orphelines qui ne correspondent plus. Hygiène du pipeline : augmenter la version de la question et invalider les notes mémorisées.

Echec 5 — gravité des modèles standardisés

Les modèles produisent des essais d’architecture plausibles — « prendre en compte l’évolutivité, la sécurité, l’observabilité » — sans aborder les véritables goulots d’étranglement du système. Exiger des citations de composants concrets.

250000 Gbps

Principes de conception pour la vérification de l’IA

  • Rubriques prévoyant une marge de tolérance explicite pour l’ingénierie pragmatique.
  • Notes distinctes pour la qualité des preuves et l’adéquation avec la question.
  • Banques de questions versionnées avec réévaluation obligatoire.
  • Vérifications manuelles sur les cas de désaccord.
  • Interdiction des conseils génériques non cités dans les évaluations à haut risque.

Ce qui fonctionne encore

Les LLM aident à repérer les sections manquantes, la terminologie incohérente et les diagrammes absents lorsqu’ils sont correctement utilisés. Ce ne sont que des assistants pour les architectes, et non des substituts au jugement concernant l’objectif visé.

Conclusion

L’intelligence artificielle chargée de vérifier d’autres systèmes d’intelligence artificielle échoue lorsque le test oublie l’objectif humain de l’architecture : prendre des décisions dans le respect de contraintes. Il faut créer des outils de vérification qui respectent ces contraintes, sinon ils pénaliseront précisément le jugement technique pour lequel vous les avez recrutés.

Leçons complémentaires pour les processus de plateforme et de recrutement

Si vous intégrez des outils d’évaluation basés sur des LLM dans les entretiens ou les dossiers de promotion, publiez le critère d’évaluation auprès des candidats lorsque cela est permis sur le plan éthique, maintenez les humains dans la boucle pour les scores incertains, et alternez les questions afin que les modèles ne puissent pas mémoriser des réponses superficielles. Suivez trimestriellement les taux de faux échecs et de faux succès par rapport aux panels humains expérimentés.

La validation de l’architecture est un processus socio-technique. Les outils qui ignorent les contraintes organisationnelles, les plafonds de coûts et la réalité opérationnelle évalueront systématiquement de manière erronée ceux qui optimisent correctement en fonction de ces variables non exprimées. Il faut encoder ces variables ou cesser de prétendre que l’évaluateur est neutre.

D’autres modes de défaillance pour lesquels il convient de prévoir un budget

Défaillance 6 : considérer la longueur des explications comme un signe de rigueur. Défaillance 7 : punir l’usage de termes liés à l’incertitude que les experts emploient correctement. Défaillance 8 : récompenser l’évocation de cadres non pertinents pour le système. Défaillance 9 : ignorer les éléments concrets liés à l’exploitation, tels que les manuels opérationnels et les SLO. Défaillance 10 : modifier sans préavis les critères d’évaluation entre différentes évaluations.

Chaque mode de défaillance dispose d’une mesure corrective : limites de longueur, reconnaissance des incertitudes mesurées, filtres de pertinence, exigences relatives aux éléments opérationnels et contrôles de cohérence des critères dans les archives d’évaluation.

Plan pratique

Commencez par des réponses d’or écrites par des humains. Calibrez le modèle pour qu’il s’accorde sur les cas simples. Examinez en détail les désaccords difficiles. Ce n’est qu’alors que vous pouvez automatiser l’évaluation en première passe, avec une révision humaine obligatoire dès que le seuil de risque est dépassé. Ne laissez jamais une décision RH irréversible reposer sur un score de modèle non vérifié.

Profondeur dans l’alignement des objectifs

L’architecture existe pour atteindre les objectifs des parties prenantes dans le respect de contraintes. Un vérificateur qui ne peut pas identifier ces objectifs évaluera brillamment le mauvais élément. Exigez des formulations claires des objectifs dans chaque ensemble de questions. Exigez que la réponse reformule ces objectifs avant de proposer une structure. Évaluez le lien entre les objectifs et les mécanismes, et non seulement l’élégance des mécanismes eux-mêmes.

Mise en œuvre au sein de l’organisation

Mener des revues de conception interne avant que les candidats ne fassent plusieurs tentatives. Mesurer le temps gagné par rapport au taux d’appels. Fournir une voie de recours permettant d’atteindre rapidement un architecte humain. Documenter les biais connus du modèle. Réentraîner ou remplacer les critères d’évaluation lorsque l’environnement évolue — fournisseurs de services cloud, régimes de conformité ou schémas de trafic.

Résumé

Les outils de vérification basés sur des LLM améliorent la qualité des critères d’évaluation. Des critères faibles, une fois appliqués à grande échelle, amplifient ces faiblesses. Des critères solides associés à un contrôle humain peuvent accélérer les revues. Les échecs mentionnés ci-dessus ne sont pas des raisons d’abandonner ces outils ; ce sont plutôt les directives pour les utiliser sans se tromper soi-même.

Lecions complémentaires pour les processus de plateforme et de recrutement

Si vous intégrez des outils d’évaluation basés sur des modèles de langage grand public dans les entretiens ou les dossiers de promotion, publiez le critère d’évaluation auprès des candidats lorsque cela est permis sur le plan éthique, tenez les humains informés des scores incertains, et alternez les questions afin que les modèles ne puissent pas mémoriser des réponses préétablies. Suivez trimestriellement les taux de faux échecs et de faux succès par rapport aux panels humains expérimentés.

La validation de l’architecture est un processus socio-technique. Les outils qui ignorent les contraintes de l’organisation, les limites budgétaires et la réalité opérationnelle évalueront de manière systématique de façon erronée les professionnels qui optimisent correctement en fonction de ces variables non exprimées. Codez ces variables ou cessez de prétendre que l’outil d’évaluation est neutre.

D’autres modes de défaillance pour lesquels il convient d’allouer un budget

Échec 6 : considérer le niveau de détail comme une marque de rigueur. Échec 7 : punir l’usage par les experts de termes exprimant de l’incertitude, ce qui est normal. Échec 8 : récompenser l’utilisation de frameworks sans rapport avec le système. Échec 9 : ignorer les éléments opérationnels tels que les guides de fonctionnement et les SLO. Échec 10 : modifier les critères d’évaluation d’une évaluation à l’autre sans préavis.

Chaque mode comporte une mesure corrective : limites de longueur, reconnaissance pour une incertitude calibrée, filtres de pertinence, exigences relatives aux éléments opérationnels, ainsi que des contrôles de cohérence dans les fiches de notes.

Plan d’action pratique

Commencez par des réponses idéales écrites par des humains. Calibrez le modèle afin qu’il soit d’accord sur les cas simples. Examinez en détail les cas où il y a des désaccords importants. Ce n’est qu’alors que vous pouvez automatiser l’évaluation initiale, avec une révision obligatoire par un humain dès que le seuil de risque est atteint. Ne laissez jamais une décision RH irréversible reposer sur un score de modèle non vérifié.

Détails sur l’alignement des objectifs

L’architecture existe pour atteindre les objectifs des parties prenantes dans le respect de contraintes. Un vérificateur qui ne peut pas identifier ces objectifs évaluera de manière brillante ce qui n’est pas le bon. Exigez des formulations claires des objectifs dans chaque ensemble de questions. Exigez que la réponse reformule ces objectifs avant de proposer une structure. Évaluez le lien entre les objectifs et les mécanismes, et non seulement l’élégance des mécanismes eux-mêmes.

Mise en œuvre au sein de l’organisation

Mettez en place des essais pilotes lors des revues de conception internes avant d’appliquer le processus aux cycles de développement. Mesurez le temps gagné par rapport au taux d’acceptation. Fournissez une voie de recours permettant de contacter rapidement un architecte humain. Documentez les biais connus du modèle. Réentraînez ou remplacez les critères d’évaluation lorsque le cadre technique change — fournisseurs de services cloud, régimes de conformité ou schémas de trafic.

Résumé

Les vérificateurs d’LLM améliorent la qualité des grilles d’évaluation. Des grilles faibles, une fois appliquées à grande échelle, amplifient les défauts. Des grilles solides associées à un contrôle humain peuvent accélérer l’examen des dossiers. Les échecs mentionnés ci-dessus ne sont pas des raisons d’abandonner ces outils ; ce sont plutôt les critères permettant de les utiliser sans se tromper soi-même.

Leçons complémentaires pour les processus de plateforme et de recrutement

Si vous intégrez des évaluateurs d’LLM dans les entretiens ou les dossiers de promotion, publiez la grille d’évaluation auprès des candidats lorsque cela est permis sur le plan éthique, impliquez des humains pour les scores incertains, et alternez les questions afin que les modèles ne puissent pas mémoriser des réponses superficielles. Suivez trimestriellement les taux de faux échecs et de faux succès par rapport aux panels humains expérimentés.

La validation de l’architecture est un processus socio-technique. Les outils qui ignorent les contraintes organisationnelles, les plafonds de coûts et la réalité opérationnelle évalueront systématiquement de manière erronée ceux qui optimisent correctement en fonction de ces variables non exprimées. Il faut encoder ces variables ou cesser de prétendre que l’évaluateur est neutre.

D’autres modes de défaillance pour lesquels il convient de prévoir un budget

Défaillance 6 : considérer la longueur des explications comme un signe de rigueur. Défaillance 7 : punir l’usage de termes liés à l’incertitude que les experts emploient correctement. Défaillance 8 : récompenser l’évocation de cadres non pertinents pour le système. Défaillance 9 : ignorer les éléments concrets liés à l’exploitation, tels que les manuels opérationnels et les SLO. Défaillance 10 : modifier sans préavis les critères d’évaluation entre différentes évaluations.

Chaque mode de défaillance dispose d’une mesure corrective : limites de longueur, reconnaissance des incertitudes mesurées, filtres de pertinence, exigences relatives aux éléments opérationnels et contrôles de cohérence des critères dans les archives d’évaluation.

Plan pratique

Commencez par des réponses d’or écrites par des humains. Calibrez le modèle pour qu’il s’accorde sur les cas simples. Examinez en détail les désaccords difficiles. Ce n’est qu’alors que vous pouvez automatiser l’évaluation en première passe, avec une révision humaine obligatoire dès que le seuil de risque est dépassé. Ne laissez jamais une décision RH irréversible reposer sur un score de modèle non vérifié.

Profondeur dans l’alignement des objectifs

L’architecture existe pour atteindre les objectifs des parties prenantes dans le respect de contraintes. Un vérificateur qui ne peut pas identifier ces objectifs évaluera brillamment le mauvais élément. Exigez des formulations claires des objectifs dans chaque ensemble de questions. Exigez que la réponse reformule ces objectifs avant de proposer une structure. Évaluez le lien entre les objectifs et les mécanismes, et non seulement l’élégance des mécanismes eux-mêmes.

Mise en œuvre au sein de l’organisation

Mener des revues de conception interne avant que les candidats ne fassent plusieurs tentatives. Mesurer le temps gagné par rapport au taux d’appels. Fournir une voie de recours permettant d’atteindre rapidement un architecte humain. Documenter les biais connus du modèle. Réentraîner ou remplacer les critères d’évaluation lorsque l’environnement évolue — fournisseurs de services cloud, régimes de conformité ou schémas de trafic.

Rappel

Les outils de vérification des LLM améliorent la qualité des critères d’évaluation. Des critères faibles, une fois appliqués à grande échelle, amplifient ces faiblesses. Des critères solides associés à un contrôle humain peuvent accélérer les revues. Les échecs mentionnés ci-dessus ne sont pas des raisons d’abandonner ces outils ; ce sont plutôt les directives pour les utiliser sans se tromper soi-même.

Lecons complémentaires pour les processus de plateforme et de recrutement

Si vous intégrez des outils d’évaluation basés sur des modèles de langage grand public dans les entretiens ou les dossiers de promotion, publiez le critère d’évaluation auprès des candidats lorsque cela est permis sur le plan éthique, tenez les humains informés des scores incertains, et alternez les questions afin que les modèles ne puissent pas mémoriser des réponses préétablies. Suivez trimestriellement les taux de faux échecs et de faux succès par rapport aux panels humains expérimentés.

La validation de l’architecture est un processus socio-technique. Les outils qui ignorent les contraintes de l’organisation, les limites budgétaires et la réalité opérationnelle évalueront de manière systématique de façon erronée les professionnels qui optimisent correctement en fonction de ces variables non exprimées. Codez ces variables ou cessez de prétendre que l’outil d’évaluation est neutre.

D’autres modes de défaillance pour lesquels il convient d’allouer un budget

Échec 6 : considérer le niveau de détail comme une marque de rigueur. Échec 7 : punir l’usage par les experts de termes exprimant de l’incertitude, ce qui est justifié. Échec 8 : récompenser l’utilisation de frameworks sans rapport avec le système. Échec 9 : ignorer les éléments opérationnels tels que les guides de fonctionnement et les SLO. Échec 10 : modifier les critères d’évaluation d’une évaluation à l’autre sans préavis.

Chaque mode comporte une mesure corrective : limites de longueur, reconnaissance pour une incertitude calibrée, filtres de pertinence, exigences relatives aux éléments opérationnels, ainsi que des contrôles de cohérence dans les fiches de notation.

Plan pratique

Commencez par des réponses idéales écrites par des humains. Calibrez le modèle afin qu’il soit d’accord sur les cas simples. Examinez en détail les cas où il y a des désaccords importants. Ce n’est qu’alors que vous pouvez automatiser la première évaluation, avec une révision humaine obligatoire dès qu’un seuil de risque est dépassé. Ne laissez jamais une décision RH irréversible reposer sur une note de modèle non vérifiée.

Détails sur l’alignement des objectifs

L’architecture existe pour atteindre les objectifs des parties prenantes dans le respect de contraintes. Un vérificateur qui ne peut pas identifier ces objectifs évaluera de manière brillante ce qui n’est pas le bon élément. Exigez des formulations claires des objectifs dans chaque ensemble de questions. Exigez que la réponse reformule ces objectifs avant de proposer une structure. Évaluez le lien entre les objectifs et les mécanismes, et non seulement l’élégance des mécanismes eux-mêmes.

Mise en œuvre au sein de l’organisation

Mettez en place des essais pilotes lors des revues de conception internes avant d’appliquer le processus aux cycles de développement. Mesurez le temps gagné par rapport au taux d’acceptation. Fournissez une voie de recours permettant de contacter rapidement un architecte humain. Documentez les biais connus du modèle. Réentraînez ou remplacez les critères d’évaluation lorsque l’environnement évolue — fournisseurs de services cloud, régimes de conformité ou schémas de trafic.

Résumé

Les vérificateurs d’LLM améliorent la qualité des grilles d’évaluation. Des grilles faibles, une fois appliquées à grande échelle, amplifient les défauts. Des grilles solides associées à un contrôle humain peuvent accélérer l’examen des dossiers. Les échecs mentionnés ci-dessus ne sont pas des raisons d’abandonner ces outils ; ce sont plutôt les critères permettant de les utiliser sans se tromper soi-même.

Leçons complémentaires pour les processus de plateforme et de recrutement

Si vous intégrez des évaluateurs d’LLM dans les entretiens ou les dossiers de promotion, publiez la grille d’évaluation auprès des candidats lorsque cela est permis sur le plan éthique, impliquez des humains pour les scores incertains, et alternez les questions afin que les modèles ne puissent pas mémoriser des réponses superficielles. Suivez trimestriellement les taux de faux échecs et de faux succès par rapport aux panels humains expérimentés.

La validation de l’architecture est un processus socio-technique. Les outils qui ignorent les contraintes organisationnelles, les plafonds de coûts et la réalité opérationnelle évalueront systématiquement de manière erronée ceux qui optimisent correctement en fonction de ces variables non exprimées. Il faut encoder ces variables ou cesser de prétendre que l’évaluateur est neutre.

D’autres modes de défaillance pour lesquels il convient de prévoir un budget

Défaillance 6 : considérer la longueur des explications comme un signe de rigueur. Défaillance 7 : punir l’usage de termes liés à l’incertitude que les experts emploient correctement. Défaillance 8 : récompenser l’évocation de cadres non pertinents pour le système. Défaillance 9 : ignorer les éléments concrets liés à l’exploitation, tels que les manuels opérationnels et les SLO. Défaillance 10 : modifier sans préavis les critères d’évaluation entre différentes évaluations.

Chaque mode de défaillance dispose d’une mesure corrective : limites de longueur, reconnaissance des incertitudes mesurées, filtres de pertinence, exigences relatives aux éléments opérationnels et contrôles de cohérence des critères dans les archives d’évaluation.

Plan pratique

Commencez par des réponses d’or écrites par des humains. Calibrez le modèle pour qu’il s’accorde sur les cas simples. Examinez en détail les désaccords difficiles. Ce n’est qu’alors que vous pouvez automatiser l’évaluation en première passe, avec une révision humaine obligatoire dès que le seuil de risque est dépassé. Ne laissez jamais une décision RH irréversible reposer sur un score de modèle non vérifié.

Profondeur dans l’alignement des objectifs

L’architecture existe pour atteindre les objectifs des parties prenantes dans le respect de contraintes. Un vérificateur qui ne peut pas identifier ces objectifs évaluera brillamment ce qu’il ne faut pas. Exigez des formulations claires des objectifs dans chaque ensemble de questions. Exigez que la réponse reformule ces objectifs avant de proposer une structure. Évaluez le lien entre les objectifs et les mécanismes, et non seulement l’élégance des mécanismes eux-mêmes.

Mise en œuvre au sein de l’organisation

Mener des revues de conception interne avant que les candidats ne fassent plusieurs tentatives. Mesurer le temps gagné par rapport au taux d’appels. Fournir une voie de recours permettant d’atteindre rapidement un architecte humain. Documenter les biais connus du modèle. Réentraîner ou remplacer les critères d’évaluation lorsque l’environnement évolue — fournisseurs de services cloud, régimes de conformité ou schémas de trafic.

Résumé

Les outils de vérification basés sur des LLM améliorent la qualité des critères d’évaluation. Des critères faibles, même amplifiés, conservent leurs faiblesses. Des critères solides associés à un contrôle humain peuvent accélérer les revues. Les échecs mentionnés ci-dessus ne sont pas des raisons d’abandonner ces outils ; ce sont plutôt les directives pour les utiliser sans se tromper soi-même.

Lecions complémentaires pour les processus de plateforme et de recrutement

Si vous intégrez des outils d’évaluation basés sur des modèles de langage grand public dans les entretiens ou les dossiers de promotion, publiez le critère d’évaluation auprès des candidats lorsque cela est permis sur le plan éthique, tenez les humains informés des scores incertains, et alternez les questions afin que les modèles ne puissent pas mémoriser des réponses préétablies. Suivez trimestriellement les taux de faux échecs et de faux succès par rapport aux panels humains expérimentés.

La validation de l’architecture est un processus socio-technique. Les outils qui ignorent les contraintes de l’organisation, les limites budgétaires et la réalité opérationnelle évalueront de manière systématique de façon erronée les professionnels qui optimisent correctement en fonction de ces variables non exprimées. Codez ces variables ou cessez de prétendre que l’outil d’évaluation est neutre.

D’autres modes de défaillance pour lesquels il convient d’allouer un budget

Échec 6 : considérer le niveau de détail comme une marque de rigueur. Échec 7 : punir l’usage par les experts d’un langage exprimant des incertitudes, ce qui est justifié. Échec 8 : récompenser l’utilisation de frameworks sans rapport avec le système. Échec 9 : ignorer les éléments opérationnels tels que les guides de fonctionnement et les SLO. Échec 10 : modifier les critères d’évaluation d’une évaluation à l’autre sans préavis.

Chaque mode comporte une mesure corrective : limites de longueur, reconnaissance des incertitudes calibrées, filtres de pertinence, exigences relatives aux éléments opérationnels, ainsi que des contrôles de cohérence dans les fiches de notation.

Plan d’action pratique

Commencez par des réponses idéales écrites par des humains. Calibrez le modèle afin qu’il soit d’accord sur les cas simples. Examinez en détail les cas où il y a des désaccords importants. Ce n’est qu’alors que vous pouvez automatiser la première évaluation, avec une révision humaine obligatoire dès qu’un seuil de risque est dépassé. Ne laissez jamais une décision RH irréversible reposer sur une note de modèle non vérifiée.

Détails sur l’alignement des objectifs

L’architecture existe pour atteindre les objectifs des parties prenantes dans le respect de contraintes. Un vérificateur qui ne peut pas identifier ces objectifs évaluera de manière brillante ce qui n’est pas le bon élément. Exigez des formulations claires des objectifs dans chaque ensemble de questions. Exigez que la réponse reformule ces objectifs avant de proposer une structure. Évaluez le lien entre les objectifs et les mécanismes, et non seulement l’élégance des mécanismes eux-mêmes.

Mise en œuvre au sein de l’organisation

Mettez en place des essais pilotes lors des revues de conception internes avant d’appliquer le processus aux cycles de développement. Mesurez le temps gagné par rapport au taux d’acceptation. Fournissez une voie de recours permettant de contacter rapidement un architecte humain. Documentez les biais connus du modèle. Réentraînez ou remplacez les critères d’évaluation lorsque l’environnement évolue — fournisseurs de services cloud, régimes de conformité ou schémas de trafic.

Résumé

Les vérificateurs d’LLM améliorent la qualité des grilles d’évaluation. Des grilles faibles, une fois appliquées à grande échelle, amplifient les défauts. Des grilles solides associées à un contrôle humain peuvent accélérer l’examen des dossiers. Les échecs mentionnés ci-dessus ne sont pas des raisons d’abandonner ces outils ; ce sont plutôt les critères permettant de les utiliser sans se tromper soi-même.

Leçons complémentaires pour les processus de plateforme et de recrutement

Si vous intégrez des évaluateurs d’LLM dans les entretiens ou les dossiers de promotion, publiez la grille d’évaluation auprès des candidats lorsque cela est permis sur le plan éthique, impliquez des humains pour les scores incertains, et alternez les questions afin que les modèles ne puissent pas mémoriser des réponses superficielles. Suivez trimestriellement les taux de faux échecs et de faux succès par rapport aux panels humains expérimentés.

La validation de l’architecture est un processus socio-technique. Les outils qui ignorent les contraintes organisationnelles, les plafonds de coûts et la réalité opérationnelle évalueront systématiquement de manière erronée ceux qui optimisent correctement en fonction de ces variables non exprimées. Il faut encoder ces variables ou cesser de prétendre que l’évaluateur est neutre.

D’autres modes de défaillance pour lesquels il convient de prévoir un budget

Défaillance 6 : considérer la longueur des explications comme un signe de rigueur. Défaillance 7 : punir l’usage de termes liés à l’incertitude que les experts emploient correctement. Défaillance 8 : récompenser l’évocation de cadres non pertinents pour le système. Défaillance 9 : ignorer les éléments concrets liés à l’exploitation, tels que les manuels opérationnels et les SLO. Défaillance 10 : modifier sans préavis les critères d’évaluation entre différentes évaluations.

Chaque mode de défaillance dispose d’une mesure corrective : limites de longueur, reconnaissance des incertitudes mesurées, filtres de pertinence, exigences relatives aux éléments opérationnels et contrôles de cohérence des critères dans les archives d’évaluation.

Plan pratique

Commencez par des réponses d’or écrites par des humains. Calibrez le modèle pour qu’il s’accorde sur les cas simples. Examinez en détail les désaccords difficiles. Ce n’est qu’alors que vous pouvez automatiser l’évaluation en première passe, avec une révision humaine obligatoire dès que le seuil de risque est dépassé. Ne laissez jamais une décision RH irréversible reposer sur un score de modèle non vérifié.

Profondeur dans l’alignement des objectifs

L’architecture existe pour atteindre les objectifs des parties prenantes dans le respect de contraintes. Un vérificateur qui ne peut pas identifier ces objectifs évaluera brillamment le mauvais élément. Exigez des formulations claires des objectifs dans chaque ensemble de questions. Exigez que la réponse reformule ces objectifs avant de proposer une structure. Évaluez le lien entre les objectifs et les mécanismes, et non seulement l’élégance des mécanismes eux-mêmes.

Mise en œuvre au sein de l’organisation

Mener des revues de conception interne avant que les candidats ne fassent des itérations. Mesurer le temps gagné par rapport au taux d’appels. Fournir une voie de recours permettant d’atteindre rapidement un architecte humain. Documenter les biais connus du modèle. Réentraîner ou remplacer les critères d’évaluation lorsque l’environnement change — fournisseurs de services cloud, régimes de conformité ou schémas de trafic.

Résumé

Les outils de vérification des LLM améliorent la qualité des critères d’évaluation. Des critères faibles, une fois amplifiés, renforcent la faiblesse. Des critères solides associés à un contrôle humain peuvent accélérer les revues. Les échecs mentionnés ci-dessus ne sont pas des raisons d’abandonner ces outils ; ce sont plutôt les directives pour les utiliser sans se tromper soi-même.