Accueil / Articles / Notes pratiques : Votre agent peut modifier son propre prompt. Voici comment faire.

Notes pratiques : Votre agent peut modifier son propre prompt. Voici comment faire.

Guide pratique pas à pas : Votre agent peut corriger son propre prompt. Voici comment : contrats, vérifications et emplacements pour du code à insérer destinés aux équipes utilisant ce modèle.

4018 mots

Ce guide reconstitue le parcours allant des matières premières à un système fonctionnel pour : Votre agent peut corriger ses propres prompts. Voici comment… L’accent est mis sur des étapes opérationnelles, des vérifications explicites et du code que vous pouvez intégrer directement dans un dépôt sans devoir deviner l’intention. Pour l’étape d’aperçu, définissez les entrées, le responsable de l’étape et les critères d’arrêt avant de modifier le code. Les opérateurs doivent pouvoir relancer l’étape à partir d’un point de contrôle connu sans avoir à deviner l’état caché. Enregistrez les temps d’exécution ainsi que le coût en tokens ou en requêtes à côté des résultats fonctionnels. Une visibilité précoce des coûts évite les factures inattendues lorsque le parcours passe de l’environnement de démonstration à des environnements partagés.

Apprenez à votre agent à tirer des leçons de ses propres erreurs et à créer une version améliorée de lui-même

Lorsque vous travaillez sur « Teach your agent to stage », notez d’abord le contrat : les données requises, le signal de succès, ainsi que ce qui se passe en cas d’échec partiel. Cette liste de contrôle permet de rester honnête lors des modifications ultérieures du code. Conservez la configuration en dehors du code de l’application. Les fichiers d’environnement, les bases de données secrètes et les indicateurs fonctionnels doivent être regroupés en un seul endroit que les opérateurs peuvent auditer sans devoir lire l’ensemble du système. Mémorisez les instructions stables du système ainsi que les schémas des outils. Envoyer à nouveau un préambule identique est une cause fréquente de gaspillage.

L’agent

Lors de la phase d’élaboration du scénario d’agent, notez d’abord le contrat : les entrées requises, le signal de succès, ainsi que ce qui se passe en cas d’échec partiel. Cette liste de contrôle permet de rester honnête lors des modifications ultérieures du code. Documentez ensemble le parcours normal et le parcours de récupération. Les tentatives répétées, les contrôles humains et la gestion des messages non livrés font partie intégrante du produit, et non d’améliorations apportées ultérieurement. Cachez les instructions système stables ainsi que les schémas des outils. Envoyer à nouveau un préambule identique est une cause fréquente de surcharge.

You are a helpful company information assistant.
You have the following knowledge about company policies:
- PTO: 20 days per year, accrued monthly. Up to 5 unused days roll over.
- Sick leave: 10 days per year, does not roll over.
- Remote work: Up to 3 days per week with manager approval.
- Benefits: The company offers competitive benefits.
Answer questions using only the information above. If a question is about
a topic not listed above, tell the user you do not have that information
and suggest they contact HR.

Les éléments de base

Lors de la phase des blocs de construction, notez d’abord le contrat : les entrées requises, le signal de succès et ce qui se passe en cas d’échec partiel. Cette liste de contrôle permet de rester honnête lors des modifications ultérieures du code. Préférez des unités petites et testables aux scripts volumineux. Lorsqu’une étape échoue, l’échec doit indiquer une seule responsabilité plutôt qu’un processus embrouillé. Cachez les instructions du système stables ainsi que les schémas des outils. Envoyer à nouveau un préambule identique est une cause fréquente de gaspillage. Lors de la phase des blocs de construction, notez d’abord le contrat : les entrées requises, le signal de succès et ce qui se passe en cas d’échec partiel. Cette liste de contrôle permet de rester honnête lors des modifications ultérieures du code. Enregistrez les temps d’exécution ainsi que le coût des tokens ou des requêtes à côté des résultats fonctionnels. Une visibilité précoce des coûts évite les factures inattendues lorsque le processus passe de la démonstration aux environnements partagés.

Le cycle d’amélioration

La phase du cycle d’amélioration fonctionne le mieux lorsqu’elle est considérée comme une surface mesurable. Capturez un transcript idéal, un cas d’échec et la note de réversion avant d’élargir le périmètre. Conservez la configuration en dehors du code de l’application. Les fichiers d’environnement, les bases de données secrètes et les indicateurs fonctionnels doivent être regroupés en un seul endroit que les opérateurs peuvent auditer sans devoir lire l’ensemble du système. Fixez des limites budgétaires par tour et par session. Les outils agents élargissent de manière importante le contexte ; des plafonds stricts empêchent que les démonstrations se transforment en factures inattendues.

git clone https://github.com/GoogleCloudPlatform/BigQuery-Agent-Analytics-SDK.git
cd examples/agent_improvement_cycle

export PROJECT_ID=<your-project-id>

./setup.sh
./run_cycle.sh               # single cycle, 10 questions, ~3-4 min
./run_cycle.sh --auto --cycles 3 --traffic-count 100

Étape par étape

La méthode étape par étape fonctionne le mieux lorsqu’elle est considérée comme une surface mesurable. Capturez un transcript idéal, un cas d’échec et la note de réversion avant d’élargir le périmètre. Documentez en même temps le parcours optimal et le parcours de récupération. Les tentatives répétées, les contrôles humains et la gestion des messages non livrés font partie intégrante du produit, et non d’une mise en forme ultérieure. Allouez des crédits budgétaires par tour et par session : les outils agents élargissent de manière importante le contexte ; des plafonds stricts empêchent que les démonstrations ne se transforment en factures inattendues.

Vérification préalable : exécution du jeu d’évaluation idéal

La phase de test préalable « Golden Stage » fonctionne le mieux lorsqu’elle est considérée comme une surface mesurable. Capturez un enregistrement idéal, un cas d’échec et une note de réversion avant d’élargir le périmètre. Préférez des unités petites et testables plutôt que des scripts complexes. Lorsqu’une étape échoue, l’erreur doit pointer vers une seule responsabilité et non vers un processus embrouillé. Fixez des limites de tokens par tour et par session. Les outils agents élargissent lourdement le contexte ; des plafonds stricts empêchent que les démos ne se transforment en factures inattendues. La phase de test préalable « Golden Stage » fonctionne le mieux lorsqu’elle est considérée comme une surface mesurable. Capturez un enregistrement idéal, un cas d’échec et une note de réversion avant d’élargir le périmètre. Enregistrez les temps d’exécution ainsi que le coût en tokens ou en requêtes à côté des résultats fonctionnels. Une visibilité précoce des coûts évite les factures inattendues lorsque le processus passe d’une démo à des environnements partagés.

{
  "eval_cases": [
    {"id": "pto_balance",     "question": "How many PTO days do I get per year?",
     "category": "pto",        "expected_tool": "lookup_company_policy"},
    {"id": "sick_leave_days", "question": "How many sick days do I have?",
     "category": "sick_leave", "expected_tool": "lookup_company_policy"},
    {"id": "remote_work_days","question": "How many days can I work from home?",
     "category": "remote_work","expected_tool": "lookup_company_policy"}
  ]
}
▶ PRE-FLIGHT: Verifying golden eval set passes with current prompt

PASS: pto_balance
     Answer: You receive 20 PTO days per year, accrued monthly.
             Up to 5 unused days can roll over.
     Tools called: lookup_company_policy
PASS: sick_leave_days
     Answer: You have 10 sick days per year. They do not roll over.
     Tools called: lookup_company_policy
PASS: remote_work_days
     Answer: You can work from home up to 3 days per week
             with manager approval.
     Tools called: lookup_company_policy
All cases pass.

Étapes 1–2 : Générer du trafic synthétique et le faire passer par l’agent

Pour les étapes 1 et 2 de génération, définissez les entrées, le responsable de l’étape ainsi que les critères d’arrêt avant de modifier le code. Les opérateurs doivent pouvoir relancer l’étape à partir d’un point de contrôle connu sans deviner l’état caché. Conservez la configuration en dehors du code de l’application. Les fichiers d’environnement, les bases de données secrètes et les indicateurs fonctionnels doivent être regroupés en un seul endroit que les opérateurs peuvent auditer sans avoir à lire l’ensemble du système. Préférez des sorties structurées avec validation de schéma plutôt que du texte libre lorsque l’étape suivante consiste en du code ou une appel à outil.

▶ STEP 1/5: GENERATE SYNTHETIC TRAFFIC
Goal:    Produce diverse user questions that differ from the golden eval set
  Method:  Gemini generates 100 questions

  ...

  Sample questions:
    - How many PTO days do I earn per month?
    - What's the maximum number of PTO days I can roll over into the next year?
    - I want to take a full week off for vacation. What is the advance notice required?

  ...

▶ STEP 2/5: RUN TRAFFIC THROUGH AGENT
Goal:    Send questions to the agent, log every session to BigQuery
...
  [62/100] traffic_expenses_window_to_submit: What is the timeframe for submitting expense reports?
           -> Business expenses must be submitted within 30 days.
  [64/100] traffic_benefits_health_company_contribution: What percentage of my health insurance premium does the company cover?
           -> The company covers 80% of health insurance premiums for employees.
  [65/100] traffic_benefits_dental_coverage: What does the dental insurance plan cover?
           -> I do not have specific information about what the dental insurance plan covers. The company offers competitive benefits, but details about specific plans like dental insurance are not something I have access to. Please contact HR for more information on dental insurance coverage.
  [67/100] traffic_benefits_401k_match: What is the company's 401k match policy?
           -> I do not have information about the company's 401k match policy. Please contact HR for details on this topic.
  [68/100] traffic_benefits_401k_vesting: How long do I need to be employed to be fully vested in the 401k match?
           -> I do not have information about 401k vesting. Please contact HR for details regarding the 401k match and vesting schedule.
  [69/100] traffic_benefits_parental_leave_primary: What is the parental leave duration for a primary caregiver?
           -> I do not have information about parental leave. Please contact HR for details on this policy.
  [66/100] traffic_benefits_vision_frames: How often can I get new frames under the vision plan?
           -> I do not have information about the vision plan or how often you can get new frames. Please contact HR for details about the vision plan.
  [60/100] traffic_expenses_receipt_required_over_x: Expenses over what amount require a receipt?
           -> I do not have information about the company's expense policy. Please contact HR for details.
  [89/100] traffic_holidays_next_company_holiday: When is the next company holiday?
           -> I do not have information about company holidays. Please contact HR for details.
...
Answer questions using only the information above. If a question is about
a topic not listed above, tell the user you do not have that information
and suggest they contact HR.

Étape 3 : Évaluer la qualité

Pour l’étape 3 « Évaluer la qualité », définissez les entrées, le responsable de l’étape ainsi que les critères d’achèvement avant de modifier le code. Les opérateurs doivent pouvoir relancer l’étape à partir d’un point de contrôle connu sans deviner l’état caché. Documentez conjointement le parcours idéal et le parcours de récupération. Les tentatives répétées, les contrôles humains et la gestion des messages non traités font partie intégrante du produit, et non d’une mise en forme ultérieure. Préférez des sorties structurées avec validation de schéma plutôt que du texte libre lorsque l’étape suivante consiste en du code ou une appel à outil.

QUALITY SUMMARY
  Total sessions evaluated : 100
  Meaningful               : 64
  Partial                  : 1
  Unhelpful                : 35
  Unhelpful rate           : 35.0%

[response_usefulness]
    HELPFUL         :   64  ( 64.0%) ################################
    NOT HELPFUL     :   35  ( 35.0%) #################
    PARTIAL         :    1  (  1.0%)
  [task_grounding]
    GROUNDED        :   90  ( 90.0%) #############################################
    NOT GROUNDED    :    9  (  9.0%) ####
    NO TOOL NEEDED  :    1  (  1.0%)
UNHELPFUL Sessions (showing 10 of 35)

Session:     52282245-d2a4-4998-9ad9-4373612019e8  → company_info_agent
  Question:    For what amount do I need to submit a receipt for expenses?
  Response:    "I do not have information about the specific amount for which you need to submit a receipt for expenses. Please contact HR for details on the expense policy."
  Usefulness:    ❌ NOT HELPFUL
  Reason:        The agent explicitly states it does not have the requested information and directs the user elsewhere, thus not providing a substantive answer to the user's question.
  Grounding:     ❌ NOT GROUNDED
  Reason:        The agent's response indicates a lack of specific information and directs the user to HR, suggesting it did not retrieve specific data from a tool to answer the question. The response is a generic LLM statement rather than tool-derived data.

Session:     3821b327-43d8-47c6-b922-dd8d7988c366  → company_info_agent
  Question:    After how many days of illness is a doctor's note mandatory?
  Response:    "I do not have information about when a doctor's note is mandatory for illness. Please contact HR for this information."
  Usefulness:    ❌ NOT HELPFUL
  Reason:        The agent explicitly states it does not have the requested information and directs the user elsewhere, failing to answer the user's question substantively.
  Grounding:     ❌ NOT GROUNDED
  Reason:        The agent's response indicates a lack of information, meaning it was not grounded in actual data retrieved from its tools. The question required tool usage, but no relevant data was found or presented.
...
Metric              V1              Budget        Status
-----------         -----------     -----------   ------
Avg latency         1482.3 ms       10000 ms      PASS
Total tokens        811.4 tokens    50000 tokens  PASS
Turn count          1 turns         10 turns      PASS
Tool error rate     0.0 rate        0.1 rate      PASS

Étape 4 : Améliorer le prompt

Pour l’étape 4 « Améliorer », définissez les entrées, le responsable de l’étape et les critères de fin avant de modifier du code. Les opérateurs doivent pouvoir relancer l’étape à partir d’un point de contrôle connu sans deviner l’état caché. Préférez des unités petites et testables aux scripts complexes. Lorsqu’une étape échoue, l’échec doit indiquer une seule responsabilité plutôt qu’un processus embrouillé. Préférez des sorties structurées avec validation de schéma à du texte libre lorsque l’étape suivante consiste en du code ou une appel d’outil. Pour l’étape 4 « Améliorer », définissez les entrées, le responsable de l’étape et les critères de fin avant de modifier du code. Les opérateurs doivent pouvoir relancer l’étape à partir d’un point de contrôle connu sans deviner l’état caché. Enregistrez les temps d’exécution ainsi que le coût en tokens ou en requêtes à côté des résultats fonctionnels. Une visibilité précoce des coûts évite des factures inattendues lorsque le processus passe d’un environnement de démonstration à des environnements partagés.

Extracted 12 failed cases, added 12 new to golden set (15 total).
Q: As a primary caregiver, how many weeks of parental leave am I eligible for?
  Agent:   I do not have information about parental leave. Contact HR.
  Teacher: As a primary caregiver, you are eligible for 16 weeks of paid parental leave.
Q: What percentage of my contributions does the company match for 401k?
  Agent:   I do not have information about 401k matching. Contact HR.
  Teacher: The company matches 4% of your contributions to the 401k. Fully vested after 1 year.
Q: When is the next company holiday?
  Agent:   I do not have information about company holidays. Contact HR.
  Teacher: The next company holiday is May 25, 2026.
Q: What are the core hours I need to be available if I'm working remotely?
  Agent:   I do not have information about core hours. Contact HR.
  Teacher: Core collaboration hours for remote employees are 10am-3pm in your local timezone.
Calling Vertex AI Prompt Optimizer with 12 ground truth examples...
(The optimizer is a server-side job -- typically 2-4 minutes.)
... still optimizing (15s elapsed)
... still optimizing (30s elapsed)
... still optimizing (45s elapsed)
Optimizer returned a candidate prompt.
PASS: pto_balance
       Question: How many PTO days do I get per year?
       Answer: You get 20 PTO days per year, which are accrued monthly...
       Tools called: lookup_company_policy | Expected: lookup_company_policy
  PASS: extracted_as_a_primary_caregiver_how_many_weeks_of
       Question: As a primary caregiver, how many weeks of parental leave am I eligible for?
       Answer: As a primary caregiver, you are eligible for 16 weeks of paid parental leave.
       Tools called: lookup_company_policy | Expected: lookup_company_policy
  PASS: extracted_what_percentage_of_my_contributions_does
       Question: What percentage of my contributions does the company match for 401k?
       Answer: The company matches 4% of your 401(k) contributions, and you are fully vested after 1 year of employment.
       Tools called: lookup_company_policy | Expected: lookup_company_policy
  PASS: extracted_what_does_the_dental_insurance_plan_cove
       Question: What does the dental insurance plan cover?
       Answer: The dental insurance plan covers full preventive care and 80% for major procedures.
       Tools called: lookup_company_policy | Expected: lookup_company_policy
  PASS: extracted_when_is_the_next_company_holiday
       Question: When is the next company holiday?
       Answer: The next company holiday is Memorial Day on May 25, 2026.
       Tools called: lookup_company_policy, get_current_date | Expected: lookup_company_policy
  ...
  15/15 passed

Prompt:      V1 -> V2
  Golden set:  3 -> 15 cases

Étape 5 : Mesurer l’amélioration

Lors de l’étape 5 consistant à mesurer l’amélioration, notez d’abord les exigences du contrat : les données nécessaires, le signal de succès et ce qui se passe en cas d’échec partiel. Cette liste de contrôle permet de garantir l’honnêteté des modifications ultérieures du code. Conservez la configuration en dehors du code de l’application. Les fichiers d’environnement, les bases de données secrètes et les indicateurs fonctionnels doivent être regroupés en un seul endroit que les administrateurs peuvent auditer sans devoir lire l’ensemble du système. Mémorisez les instructions du système stable ainsi que les schémas des outils. Envoyer à nouveau un préambule identique est une cause fréquente de gaspillage.

[44/100] traffic_expenses_004: I booked a flight for $600 for a business trip. Do I need pre-approval?
           -> Travel expenses over $500 require pre-approval from your manager. Since your flight is $600, you will need pre-approval.
  [80/100] traffic_benefits_020: If I leave the company after 6 months, will I get to keep the 401k match?
           -> No, the company 401(k) match is fully vested after 1 year of employment. If you leave after 6 months, you will not get to keep the 401k match.
  [84/100] traffic_holidays_004: Is the day after Thanksgiving a paid holiday?
           -> Yes, the day after Thanksgiving is a paid holiday.
  [19/100] traffic_sick_004: I was sick for two days; do I need to provide any documentation?
           -> Employees receive 10 sick days per year. A doctor's note is required for absences longer than 3 consecutive days. Since you were sick for two days, you do not need to provide any documentation.
QUALITY SUMMARY
  Total sessions evaluated : 100
  Meaningful               : 99
  Partial                  : 1
  Unhelpful                : 0
  Unhelpful rate           : 0.0%

[response_usefulness]
    HELPFUL         :   99  ( 99.0%) #################################################
    PARTIAL         :    1  (  1.0%)
  [task_grounding]
    GROUNDED        :   99  (100.0%) ##################################################
Session:     4e0ea11d-d4dc-4a59-b337-30415a595c90  → company_info_agent
  Question:    If I'm sick for more than 3 days, what kind of doctor's note is required?
  Response:    "If you are sick for more than 3 consecutive days, a doctor's note is required."
  Usefulness:    PARTIAL
  Reason:        The response confirms a doctor's note is required but does not specify
                 the 'kind' of note, which was part of the user's question.
  Grounding:     GROUNDED
  Reason:        The agent's response directly reflects the information retrieved
                 from the 'lookup_company_policy' tool.
CYCLE 1 RESULTS
  Before (V1):  64.0% meaningful  (64/100 sessions)
  After  (V2):  99.0% meaningful  (98/99 sessions)
Quality 99.0% meets threshold (95%) -- stopping auto-continue.

DONE  (total wall time: 12m 39s)
  Prompt version:   V2
  Golden eval set:  15 cases
Metric              V1              V2              Budget        Status
-----------         -----------     -----------     -----------   ------
Avg latency    (v)  1482.3 ms       1088.4 ms       10000 ms      PASS
Total tokens   (^)  811.4 tokens    1339.7 tokens   50000 tokens  PASS
Turn count     (=)  1 turns         1 turns         10 turns      PASS
Tool error     (=)  0.0 rate        0.0 rate        0.1 rate      PASS

Le prompt V2

Lors de la phase d’élaboration des prompts V2, notez d’abord le contrat : les entrées requises, le signal de succès et ce qui se passe en cas d’échec partiel. Cette liste de contrôle permet de rester honnête lors des modifications ultérieures du code. Documentez ensemble le parcours normal et le parcours de récupération. Les tentatives répétées, les contrôles humains et la gestion des messages non traités font partie intégrante du produit, et non d’améliorations ultérieures. Mémorisez les instructions système stables et les schémas des outils. Envoyer à nouveau un préambule identique est une cause fréquente de surcharge.

You are a helpful company information assistant. Your primary function
is to answer employee questions about company policies by using the
available tools.

Core Directives:
1. Tool-First Approach: For EVERY user question, your first and only
   action should be to use one of the provided tools to find the answer.
2. No Answering from Memory: Do not use any general knowledge. The
   tools are the only source of truth.
3. Mandatory Tool Use: You MUST call the appropriate tool to answer the
   question. Do not state that you don't have the information or direct
   the user to HR for topics that the tools can handle.
4. Topic Inference: Carefully analyze the user's prompt to determine
   the correct topic parameter for the lookup_company_policy tool.
   The user's language may not be an exact match for the available
   topics (e.g., 'parental leave' or '401k' should be mapped to
   the 'benefits' topic).
AVAILABLE TOOLS:
- lookup_company_policy(topic: str)
  - Looks up a company policy by topic.
  - topic: The policy topic to look up. Must be one of: pto, sick_leave,
    remote_work, expenses, benefits, holidays.
- get_current_date()
  - Gets the current date.
Your goal is to successfully call the correct tool with the correct
parameters based on the user's question.

Ce que le cycle enseigne sur la conception des prompts

Lors de la phase « What the cycle teaches », notez d’abord le contrat : les entrées requises, le signal de succès et ce qui se passe en cas d’échec partiel. Cette liste de contrôle permet de rester honnête lors des modifications ultérieures du code. Préférez des unités petites et testables plutôt que des scripts volumineux. Lorsqu’une étape échoue, l’échec doit indiquer une seule responsabilité et non un processus embrouillé. Cachez les instructions du système stables ainsi que les schémas des outils. Envoyer à nouveau un préambule identique est une cause fréquente de gaspillage. Lors de la phase « What the cycle teaches », notez d’abord le contrat : les entrées requises, le signal de succès et ce qui se passe en cas d’échec partiel. Cette liste de contrôle permet de rester honnête lors des modifications ultérieures du code. Enregistrez les temps d’exécution ainsi que le coût des tokens ou des requêtes à côté des résultats fonctionnels. Une visibilité précoce des coûts évite les factures inattendues lorsque le processus passe de la démonstration aux environnements partagés.

L’exécuter soi-même

La phase « L’exécuter soi-même » fonctionne le mieux lorsqu’elle est considérée comme une surface mesurable. Capturez un exemple réussi, un cas d’échec et la note de réversion avant d’élargir le périmètre. Conservez la configuration en dehors du code de l’application. Les fichiers d’environnement, les bases de données secrètes et les indicateurs fonctionnels doivent être regroupés en un seul endroit que les opérateurs peuvent auditer sans devoir lire l’ensemble du système. Fixez des limites budgétaires par tour et par session. Les outils agents élargissent de manière importante le contexte ; des plafonds stricts empêchent que les démonstrations se transforment en factures inattendues.

git clone https://github.com/GoogleCloudPlatform/BigQuery-Agent-Analytics-SDK.git
cd examples/agent_improvement_cycle

export PROJECT_ID=<your-project-id>

./setup.sh

./run_cycle.sh
./reset.sh

En résumé

La phase de récupération fonctionne le mieux lorsqu’elle est considérée comme une surface mesurable. Capturez un transcript idéal, un cas d’échec et la note de réversion avant d’élargir le périmètre.

Liste de contrôle opérationnelle

La phase de liste de contrôle opérationnelle fonctionne le mieux lorsqu’elle est considérée comme une surface mesurable. Capturez un transcript idéal, un cas d’échec et la note de réversion avant d’élargir le périmètre.

Considérez cette phase comme un contrat entre les entrées et les sorties validées. Donnez des noms aux artefacts, définez des critères de succès et refusez les complétions partielles silencieuses.

Jetons budgétisés par tour et par session. Les outils agents élargissent lourdement le contexte ; des plafonds stricts empêchent que les démos ne se transforment en factures inattendues.

Mettre en place une approbation humaine pour les cas où de l’argent est dépensé ou où des données de production sont modifiées. La connexion en temps de compilation ne garantit pas une couverture complète des besoins métier.

Rédigez un petit manuel opérationnel : comment rotationner les clés, comment vider la file d’attente, comment revenir en arrière après la dernière ingestion.

Dokumentez à la fois le parcours normal et celui de récupération. Les tentatives répétées, les contrôles humains et la gestion des messages échoués font partie intégrante du produit, et non d’améliorations ultérieures.

Au préalable de promouvoir l’ensemble, figez les versions, conservez une transcription exemplaire pour le parcours critique et confirmez les étapes de retrait en arrière. Les environnements partagés nécessitent des limites de débit, des vérifications d’attribution et un responsable clair pour la rotation des secrets. Préférez une fiabilité banale à de brillantes démos ponctuelles.

Note de lot pour f7bfa970ccb5 : éviter d’inclure les clés du fournisseur dans le répertoire, fixer une limite pour les tokens par session, et stocker les transcriptions à côté des fichiers d’évaluation afin que les remplacements ultérieurs de modèles restent comparables.

Pour la note de renforcement au stade 0, définir les entrées, le responsable de l’étape et les critères d’arrêt avant de modifier le code. Les opérateurs doivent pouvoir relancer l’étape à partir d’un point de contrôle connu sans deviner l’état caché. Documenter conjointement le parcours normal et le parcours de récupération. Les tentatives répétées, les contrôles humains et la gestion des messages non traités font partie du produit, et non d’améliorations ultérieures.

Détail de renforcement 0/963 : mesurer le temps d’exécution, la catégorie de l’erreur et la consommation de tokens pour cette note, puis décider de conserver ou non le changement en se basant sur un ensemble de questions prédéfini plutôt que sur des observations subjectives.

Lors de la première étape des notes de renforcement, notez d’abord le contrat : les entrées requises, le signal de succès et ce qui se passe en cas d’échec partiel. Cette liste de contrôle permet de rester honnête lors des modifications ultérieures du code. Considérez cette étape comme un contrat entre les entrées et les sorties validées. Donnez des noms aux artefacts, définez des vérifications de succès et refusez les terminaisons partielles silencieuses.

Détail de renforcement 1/963 : mesurez le temps d’exécution, la classe de l’erreur et la consommation de tokens pour cette note, puis décidez si vous souhaitez conserver la modification en vous basant sur un ensemble de questions prédéfini plutôt que sur des observations subjectives.

L’étape 2 des notes de renforcement fonctionne le mieux lorsqu’elle est considérée comme une surface mesurable. Capturez un exemple idéal, un cas d’échec et la note de réversion avant d’élargir le périmètre. Gardez la configuration en dehors du code de l’application. Les fichiers d’environnement, les stocks de secrets et les flags fonctionnels doivent être regroupés en un seul endroit que les opérateurs peuvent auditer sans devoir lire l’ensemble du système.

Détail de renforcement 2/963 : mesurer le temps d’exécution, la classe d’erreur et la consommation de tokens pour cette note, puis décider de conserver ou non le changement en se basant sur un ensemble de questions prédéfini plutôt que sur des anecdotes.

Pour la phase 3 de la note de renforcement, définir les entrées, le responsable de l’étape et les critères d’achèvement avant de modifier le code. Les opérateurs doivent pouvoir relancer l’étape à partir d’un point de contrôle connu sans deviner l’état caché. Préférer des unités petites et testables plutôt que des scripts complexes. Lorsqu’une étape échoue, l’échec doit indiquer une seule responsabilité plutôt qu’un processus embrouillé.

Détail de renforcement 3/963 : mesurer le temps d’exécution, la classe d’erreur et la consommation de tokens pour cette note, puis décider de conserver ou non le changement en se basant sur un ensemble de questions prédéfini plutôt que sur des anecdotes.