首页 / 文章 / 规划者、生成器、治愈者:我如何用三种人工智能运行完整的剧作家工具套件

规划者、生成器、治愈者:我如何用三种人工智能运行完整的剧作家工具套件

《规划者、生成器与修复者》操作指南:我如何运用三种人工智能运行完整的 Playwright 工具套件——为采用该模式的团队提供的合同模板、校验机制以及可直接插入的代码模块。

1390 词

可将此内容视为《规划者、生成器、修复者:我如何运用三个AI智能体与Playwright MCP运行完整的Playwright套件》一文中理念的面向操作员的重构版本:清晰的阶段划分、有序的代码模块,以及能在交接过程中保留的恢复说明。 将“概览”阶段视为可度量的界面使用效果最佳。在扩大范围之前,先记录一份理想的执行日志、一个故障案例以及回滚说明。 需同时记录正常流程与恢复流程。重试机制、人工审核环节以及死信处理都是产品本身的组成部分,而非后续需要补充的内容。

让智能体发挥作用的配置

在修改代码之前,需先确定构成流程的各个环节、输入参数、各步骤的负责人以及终止条件。操作人员应能够从已知的检查点重新运行相应步骤,而无需猜测隐藏的状态。相比庞大的脚本,更应采用小型且易于测试的单元。当某个步骤失败时,故障原因应能明确指向某个具体的责任模块,而非整个复杂的流程链。应在网关处进行身份验证,在数据层再次进行授权——仅凭承载令牌并不足以界定租户边界。

{
  "servers": {
    "playwright-test": {
      "type": "stdio",
      "command": "npx",
      "args": ["playwright", "run-test-mcp-server"]
    }
  }
}

代理1——规划者:“什么值得测试?”

对于代理1的规划阶段,在修改代码之前需明确输入参数、各步骤的负责人以及终止标准。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。 应将此阶段视为输入与经过验证的输出之间的契约。为相关成果命名,定义成功判定标准,并拒绝默许的半完成状态。 在网关处进行身份验证,在数据层再次授权。仅凭承载令牌并不足以界定租户边界。

代理2——生成器:“将这一场景变为现实”

对于 Agent 2 的生成器阶段,在修改代码之前需明确输入参数、该步骤的负责人以及终止条件。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。 应在功能结果旁记录执行时间以及令牌或查询成本。提前显示成本可避免在流程从演示环境切换到共享环境时出现意外费用。 在网关处进行身份验证,在数据层面重新授权。仅凭承载令牌并不足以界定租户边界。 对于 Agent 2 的生成器阶段,在修改代码之前需明确输入参数、该步骤的负责人以及终止条件。操作人员应能够从已知的检查点重新运行该步骤,而无需猜测隐藏状态。 需同时记录正常流程与故障恢复流程。重试机制、人工审核环节以及死信处理都是产品功能的一部分,而非后续需要补充的内容。

// spec: specs/checkout-e2e-plan.md
// seed: tests/web/seed.spec.js
import { test, expect } from '../../../fixtures';
import { users } from '../../../testdata';test.describe.configure({ mode: 'parallel' });test.describe('E2E checkout journey', () => {
  test('positive: login → add product → checkout → thank you → home', async ({ flow }) => {
    await flow.completeHappyPathPurchase();
  });
});
async completeHappyPathPurchase(user = users.standard, info = checkout.valid) {
  await this.goToCheckoutInformation(user);
  await this.fillValidInformation(info);
  await this.continueToOverview();
  await this.app.checkoutOverview.expectProductVisible(products.first.name);
  await this.finishOrder();
  await this.backHomeToProducts();
}

智能体3——治疗者:“它出故障了。修复对应的层级。”

在处理智能体3的治疗者阶段时,首先写下相关契约:所需的输入参数、成功信号以及部分失败时的处理方式。这样的检查清单能确保后续的代码修改始终符合预期。 建议使用小型、可测试的单元而非庞大的脚本。当某个步骤失败时,故障应指向单一的责任模块,而非复杂的流程链。 需为每次调用记录工具名称、参数哈希值、延迟时间以及最终结果。没有这些记录,调试智能体循环将会耗费大量时间。

如何从头到尾实际运行它

在处理“如何实际运行”这一阶段时,首先需写下相关契约:所需的输入参数、成功信号以及部分失败时的处理方式。这样的检查清单能确保后续的代码修改保持一致性。 将这一阶段视为输入与验证后输出之间的契约。为相关产物命名,明确成功判定标准,杜绝无声的半完成状态。 需记录每次调用的工具名称、参数哈希值、延迟时间以及最终结果。没有这些记录,调试过程将会浪费大量时间。

1. Copy .env.example → .env, set BASE_URL (+ credentials)
2. npm install && npx playwright install
3. Run the Planner
      → specs/checkout-e2e-plan.md   (22 scenarios, reviewed by me)4. Run the Generator, scenario by scenario
      → tests/web/login/login.spec.js
      → tests/web/cart/cart.spec.js
      → tests/web/checkout/checkout.spec.js
      → tests/web/e2e/checkout-journey.spec.js5. npm test        (4 workers, fully parallel)6. Any red? Run the Healer → re-run → green

那么它到底快了多少呢?

在“快多少”阶段工作时,首先需明确契约内容:所需输入、成功信号以及部分失败时的处理方式。这份清单能确保后续的代码修改保持一致性。 在功能结果旁记录执行时间以及令牌或查询成本。提前了解成本情况,可避免从演示环境过渡到共享环境时出现意外费用。 为每次调用记录工具名称、参数哈希值、延迟时间以及最终结果。没有这些记录,调试过程将会浪费大量时间。 在“快多少”阶段工作时,首先需明确契约内容:所需输入、成功信号以及部分失败时的处理方式。这份清单能确保后续的代码修改保持一致性。 需同时记录正常流程和异常恢复流程。重试机制、人工审核环节以及死信处理都是产品功能的一部分,而非后续需要补充的内容。

四项值得借鉴的经验

《值得借鉴的四个阶段经验》这一方法在被视为可度量的框架时效果最佳。在扩大范围之前,先记录一个成功的案例、一个失败案例以及回滚说明。 相较于庞大的脚本,应优先选择小型且可测试的单元。当某个步骤失败时,故障应指向单一责任点,而非复杂的流程链。 使用结构清晰、带有明确副作用标注的工具。主机需要在自动批准之前知道哪些调用会改变状态。

谁应该尝试这种方法

The Who团队应将此阶段视为可度量的界面来处理,这样效果最佳。在扩大范围之前,先记录一个成功的案例、一个失败案例以及回滚说明。把这一阶段视为输入与已验证输出之间的契约,为相关成果命名,明确成功标准,绝不允许默许部分完成的工作。应使用具有严格结构且带有明确副作用标注的工具,让负责人在自动批准之前就能知道哪些操作会改变系统状态。

运营检查清单

在处理运营检查清单阶段时,首先要明确契约内容:所需的输入、成功信号以及部分失败时的处理方式。这样的检查清单能确保后续的代码修改保持透明可追溯。

配置信息应与应用程序代码分开存放。环境文件、密钥存储以及功能开关都应集中于一个位置,以便操作人员无需查看整个系统结构即可进行审计。

记录每次调用的工具名称、参数哈希值、延迟时间以及执行结果。若没有这些记录,调试过程将会浪费大量时间。

保持数据结构的层次简单且类型明确。嵌套的数据结构会掩盖是哪个节点设置了哪个字段,还会在中断后导致流程无法继续。

只要预算允许,就在持续集成过程中使用测试用例而非真实的付费 API 来对关键路径进行验证。

将此阶段视为输入与经过验证的输出之间的契约。为相关输出文件命名,明确成功标准,绝不允许出现无声的、不完整的处理结果。

在升级技术栈之前,先冻结现有版本,为关键路径生成标准化的记录,并确认回滚步骤。共享环境需要设置速率限制、租户验证机制,以及明确的密钥轮换负责人。与其追求华丽的临时演示,不如注重扎实的可靠性。

关于 ebfa232e6bf7 的批量处理说明:不要将提供者密钥放入代码仓库,为每个会话设置令牌使用上限,并将转录内容存储在评估测试用例的旁边,以便后续更换模型时仍能保持可比性。

强化措施的第0阶段若被视为可量化的评估标准,则效果最佳。在扩大范围之前,需记录一份理想的转录样本、一个失败案例以及回滚说明。将此阶段视为输入与经过验证的输出之间的契约,为相关文件命名,明确成功标准,杜绝无声的半完成状态。

强化措施细节 0/959:需测量处理时间、错误类型以及令牌消耗情况,然后依据固定的评估标准而非主观判断来决定是否保留该变更。