REVIEW / 2026 LLM AGENT SYSTEMS

Agent 系统综述边界、构件、前沿与落地

不再把 Agent 当作一个框架名词,而是把模型、harness、工具、状态、协议、 环境、安全与评测放回同一套系统中研究。

RESEARCH CUTOFF 28 · 07 · 2026

面向技术决策、架构设计与内部评测

10章节
08核心构件
07研究路线
60+一手来源
核心判断

Agent 的公共骨架已高度开源;可靠自治仍是系统工程问题,而不是“换一个框架”就能解决的问题。

00 ABSTRACT & METHOD

先给结论,再说明证据

这不是框架推荐榜,而是一份以“系统边界—控制原语—可靠性证据—生产约束”为主线的综述。

ABSTRACT

2026 年的 Agent 开源生态已经拥有成熟的 loop、tool calling、handoff、状态图、 checkpoint、tracing、MCP 与 A2A;真正稀缺的仍是高质量任务环境、长轨迹数据、 可验证反馈、权限系统、恢复机制与持续评测闭环。因此,生产路线应是 确定性外壳 + 受限自治内核,而不是把所有流程都交给自由规划。

01

框架不是能力本体

公开榜单测到的是模型、harness、工具接口、上下文、环境、预算和 grader 的联合表现。

02

长任务仍在快速演进

短任务成功率提升很快,但时间跨度增长会放大状态漂移、错误累积和验证缺失。

03

多 Agent 是条件变量

只有可分解、可并行验证、上下文可天然隔离的任务,才可能覆盖协调成本。

04

安全必须是系统属性

提示词无法替代最小权限、凭据隔离、事务确认、可信边界和可回放审计。

已成型

可重复的工程能力

有多套实现、明确契约和生产案例,例如结构化输出、持久化图与基础 tracing。

快速演进

证据正在累积

结果稳定但边界仍移动,例如长任务 harness、上下文压缩和 computer use。

研究前沿

结论尚未收敛

论文结果有希望但复现、成本或外部有效性不足,例如 agentic RL 与动态多 Agent 图。

01 SYSTEM STACK

先分层,才能谈“开源到哪里”

Codex CLI、Agents SDK、LangGraph、MCP 和 OSWorld 都与 Agent 有关,但它们解决的是不同层的问题。

07

Application / Product

用户任务、UI、权限、连接器、云端运行与协作体验

Codex App · Claude Code · OpenHands
06

Harness / Scaffold

把模型、工具、上下文、编辑接口、循环与验证拼成可工作的 Agent

Codex CLI · SWE-agent · Aider
05

Workflow / Runtime

状态、分支、恢复、持久化、并行、人工审批和副作用管理

LangGraph · Microsoft Agent Framework
04

Agent SDK

Agent loop、tools、handoff、guardrails、sessions、tracing 的代码抽象

OpenAI Agents SDK · Google ADK · PydanticAI
03

Interoperability

工具、数据和远程 Agent 的发现、能力描述与消息交换

MCP · A2A
02

Environment & Evaluation

可执行任务环境、状态初始化、验证器、轨迹与安全测试

SWE-bench · τ-bench · OSWorld · AgentDojo
01

Model & Inference

推理、生成、工具选择、多模态感知和推理时计算

Frontier / open-weight models

02 SDK BOUNDARIES

Codex CLI 到底与 SDK 差在哪

最简单的区分:SDK 是造系统的零件;CLI 是已经装配好的、面向代码仓库的 Agent harness 与终端产品。

CODING SPECIALIST

Codex CLI

终端客户端 + 编码 harness

Repo / shell / patch / sandbox / approvals / compaction / TUI / exec
Codex SDK

从代码中创建和续接 Codex thread,用于 CI、内部工具和应用集成。

App Server

更底层的本地 JSON-RPC 接口,暴露 thread、turn、审批、历史和流式事件。

Agents SDK

通用 Agent 应用工具箱;可把 Codex 作为 MCP 专家纳入更大的业务工作流。

项目 / 形态核心抽象自带什么不负责什么最适场景
Codex CLIApplication / Harness

代码仓库中的 agent turn

终端 UX、shell、patch、文件上下文、沙箱、审批、MCP、非交互执行

通用业务图、跨域服务编排

编码、代码审查、终端自动化

Codex SDKProgrammatic control

Codex thread / turn

从 TS / Python 控制 Codex、结构化事件与线程延续

重新发明一个通用 agent loop

CI/CD、内部研发工具、产品内嵌 Codex

Codex App ServerClient backend

JSON-RPC client protocol

认证、历史、审批、thread / turn、流式事件

高层业务 Agent 设计

IDE、桌面端和自定义富客户端

OpenAI Agents SDKGeneral SDK

Agent run

loop、tools、agents-as-tools、handoffs、sessions、guardrails、traces

代码仓库专用 harness 与终端 UX

通用工具型 Agent、客服、研究与多 Agent 协作

LangGraphState runtime

持久化状态图

checkpoint、interrupt、time travel、并行、恢复

替你定义领域工具和业务正确性

长生命周期、可恢复、HITL 流程

Microsoft Agent FrameworkAgents + Harness + Workflows

Agent / workflow

多语言 agent、BSP 图、checkpoint、middleware、OTel

消除超步屏障和并行尾延迟

.NET / Python 与 Azure 企业体系

Google ADKFramework + Runtime

Agent / graph workflow

多语言、sessions、memory、evaluation、MCP、A2A、部署

替代应用自身权限与治理

Google 生态和多形态部署

PydanticAITyped Python SDK

类型化 Agent

typed deps / output、tools、MCP、evals、durable adapters

完整编码产品或 GUI runtime

重类型、验证和 Python 可维护性的团队

如果你要“让 Agent 写代码”

先用 Codex CLI / SDK

复用成熟的仓库接口、编辑工具、沙箱和上下文策略,避免从通用 SDK 重搭 coding harness。

如果你要“搭业务 Agent”

从 Agents SDK / ADK / PydanticAI 起步

工具契约与流程较简单时,先保持 loop 轻量,失败结构稳定后再引入图。

如果你要“长流程可恢复”

选状态图 / durable runtime

关键不是画图,而是持久化状态、幂等副作用、人工中断、版本迁移与恢复语义。

官方边界: Codex Glossary ↗ Codex SDK ↗ Agents SDK Orchestration ↗ Codex × Agents SDK ↗

03 CORE PRIMITIVES

八个常用词,拆到工程语义

每个构件都包含四层:它是什么、当前研究什么、系统卡在哪里、上线时如何收口。点击展开。

01

路由 Routing

决定下一步由哪个模型、工具、Agent 或流程分支处理。

展开

三种实现

规则路由最可控;模型分类器适应自然语言;学习型路由用历史成败与成本优化选择。三者通常应叠加,而不是互斥。

研究方向

带置信度的 abstention、成本感知模型选择、在线 taxonomy 演化、基于 trace 的路由器训练、风险分级和 policy gate。

现状卡点

标签边界漂移、低频类缺数据、路由错了却被下游“勉强完成”、模型自报置信度不校准,以及线上分布变化。

工程收口

先规则守住权限与合规,再让模型做语义选择;保留 fallback、top-2、拒答路径,并单独评估 route accuracy 与端到端 utility。

02

并行 Parallelism

将独立子任务或多条候选路径 fan-out,再由 reducer 汇总。

展开

适用条件

检索多个来源、独立文件检查、候选解法采样、可并行验证的分片任务。顺序依赖强的任务不应硬拆。

研究方向

动态并发宽度、early stopping、预算分配、异质模型组合、相关错误建模、流式聚合和推测执行。

现状卡点

相关错误不会因投票消失;慢分支拖累尾延迟;合并器可能丢失少数正确证据;共享工具还会产生资源竞争与副作用冲突。

工程收口

为每个分支设 deadline、预算和幂等键;fan-in 依据证据而非文风投票;明确“少一个分支是否仍可完成”。

03

交接 Handoff

把后续回复的所有权、上下文和部分权限转移给专门 Agent。

展开

与 Agent-as-tool 的差别

Handoff 后专家成为新的对话所有者;Agent-as-tool 中经理仍负责最终答案,只把专家当作一次受控调用。

研究方向

最小充分上下文、所有权协议、权限委托、handoff 质量评分、自动回退、跨组织 agent card 与能力发现。

现状卡点

上下文丢失、重复工作、责任模糊、循环交接、权限无意升级,以及“转交成功但任务无人闭环”。

工程收口

使用结构化交接包:目标、已知事实、证据、产物、未决问题、权限、完成条件、返回路径;默认优先 manager + specialists。

04

图编排 Graph Orchestration

用节点、边、状态、条件、循环和中断表达可恢复的控制流。

展开

它解决什么

图把控制面显式化:哪些步骤可并行、何时中断、哪里审批、失败后从哪里恢复。它不自动让模型更聪明。

研究方向

从静态模板到动态运行时图、图结构优化、自动分解、拓扑学习、基于 trace 的重写,以及图成本与鲁棒性联合评价。

现状卡点

节点粒度难定、状态 schema 演化困难、动态图难审计;Pregel/BSP 的超步屏障可靠但会让并行路径互相等待。

工程收口

先画业务状态机,再嵌 Agent 节点;副作用和推理节点分离;为每条边定义 guard、timeout、retry、compensation 与 done 条件。

05

结构化输出 Structured Output

让模型输出满足 JSON Schema / 类型契约的机器可消费结果。

展开

能力边界

约束解码能保证语法和部分 schema,有效 JSON 并不等于事实正确、字段完整或符合业务语义。

研究方向

复杂 schema 覆盖、语义约束、可解释 repair、跨 provider 一致性、流式结构化输出和 schema-aware agent planning。

现状卡点

深层 union / recursion 支持不一致;schema 越复杂推理越脆;自动修复可能把错误“修成可解析”。

工程收口

保持 schema 小而稳定;做语义校验、跨字段不变量和外部查验;高风险字段 fail closed,不用无限 repair loop。

06

检查点 Checkpoint

持久化执行状态,以便暂停、人工介入、故障恢复和时间旅行。

展开

不是模型 checkpoint

这里保存的是 thread、节点位置、消息、业务状态、待处理工具结果和审批状态,不是训练权重。

研究方向

细粒度增量快照、跨版本迁移、分布式一致性、事件溯源、长期记忆与执行状态分离,以及隐私感知 TTL。

现状卡点

外部副作用无法随状态一起回滚;恢复时可能重复发邮件或扣款;不可序列化对象和 schema 升级会破坏旧状态。

工程收口

所有写操作使用幂等键和事务记录;保存“意图—执行—结果”三态;明确至少一次/至多一次语义,并定期做恢复演练。

07

基础 Tracing

把 agent run、model call、tool、handoff、guardrail 和错误记录成关联 span。

展开

Tracing ≠ Evaluation

Trace 解释“发生了什么”;eval 判断“做得好不好”。前者是诊断、回放、数据生产和失效归因的基础。

研究方向

统一 GenAI 语义约定、因果归因、反事实回放、自动 failure labeling、trace compression 和可观测性驱动训练。

现状卡点

轨迹巨大且含敏感内容;provider 字段不统一;最终失败常由多步共同导致,单点根因标签过于粗糙。

工程收口

记录模型/版本、prompt hash、工具参数摘要、token、延迟、成本、状态转移和审批;正文默认脱敏并设采样与保留期。

08

MCP / A2A 互操作

MCP 连接 Agent 与工具/数据;A2A 连接自治边界内外的 Agent 与任务。

展开

MCP

基于 JSON-RPC 的有状态连接与能力协商;server 暴露 tools、resources、prompts,client 可提供 sampling、roots、elicitation。

A2A

通过 Agent Card 发现能力,以 task、message、artifact 建模长任务,支持流式、异步、取消、订阅与多种协议绑定。

研究方向

语义互操作、可信能力描述、策略协商、跨组织身份与计费、可验证 artifact、协议网关和最小上下文交换。

现状卡点

协议标准化了连接,不会自动解决信任;tool 描述与远端响应都可能是恶意输入,能力声明也可能过期或夸大。

04 OPEN-SOURCE LANDSCAPE

同一生态,不同主战场

筛选只是阅读辅助;真正比较要固定模型、工具、环境、预算和 grader。

GENERAL SDKMIT

OpenAI Agents SDK

抽象克制,围绕 run、tools、handoff、guardrails、sessions 与 traces。

强项
快速跑通通用 agent loop
边界
不是 coding harness 或 durable graph
FRAMEWORKAPACHE-2.0

Google ADK

Python / TS / Go / Java / Kotlin,多 Agent、图工作流、memory、eval、MCP 与 A2A。

强项
覆盖广、部署形态多
边界
广度带来更多概念与治理面
ENTERPRISEMIT

Microsoft Agent Framework

整合 Agents、Harness 与基于 BSP 超步的 Workflows,覆盖 Python / .NET。

强项
类型、checkpoint、OTel、Azure
边界
并行路径受 barrier 约束
TYPED PYTHONMIT

PydanticAI

类型化依赖与输出,支持 MCP、evals、compaction 和 durable execution adapters。

强项
验证、可维护性、模型中立
边界
Python 中心,不是完整产品
ROLE-BASEDMIT

CrewAI

角色化 crews 与确定性 flows,便于表达协作原型。

强项
多 Agent 概念直观
边界
协调、token 与调试成本
MINIMALAPACHE-2.0

smolagents

CodeAgent / ToolCallingAgent 的透明最小实现,适合学习和研究。

强项
实现小、实验快
边界
生产能力需自行补齐
CODING HARNESSAPACHE-2.0

Codex CLI

面向代码仓库的终端 Agent:shell、patch、sandbox、approval、MCP 与 compaction。

强项
成熟 coding interface
边界
不是通用业务 workflow SDK
CODING PLATFORMMIT

OpenHands

可自托管的软件工程 Agent 平台,包含运行时、沙箱与多种交互界面。

强项
端到端、自托管
边界
部署和环境成本较高

05 RESEARCH FRONTIERS

七条路线:已知什么,还卡在哪里

每条路线都按研究问题、最新证据、可落地做法和未解难题组织;论文结论只在其任务分布内成立。

01
快速演进

长任务可靠性与有效自治时间

能否在几十分钟至数小时内保持目标、识别失败、恢复进度,并让监督成本低于人工完成?

20.6%

OSWorld 2.0 截止快照的最佳 500-step 完整完成率;108 个任务的人类中位耗时约 1.6 小时。

现在知道

METR 的 50% time horizon 给出可比较趋势,但任务偏软件与推理。OSWorld 2.0 显示,长任务失败已从“不会点”转向状态丢失、冲突未解、动态信息漏看和最后不验证。

研究方向

分段目标与 rolling horizon、失败检测器、进度价值函数、可验证中间状态、预算感知 stopping、恢复策略和人类监督经济学。

核心卡点

小错误复合增长;最终 reward 太晚;Agent 会把“文件存在”误当“任务正确”;基准任务时长与真实岗位分布仍不一致。

落地做法

把任务拆成可验证里程碑;保存 done / next / blockers;每次写操作后读回验证;为长任务设置人工接管点与失败预算。

02
方法成型

Context engineering 与长期记忆

如何在有限上下文中保留最小高信号状态,并知道何时检索、压缩、更新和遗忘?

4 能力

MemoryAgentBench 将长期记忆拆成准确检索、测试时学习、长程理解和选择性遗忘;现有方法尚无全能解。

现在知道

“把全部历史塞进去”不是长期记忆。有效系统通常分离工作状态、情节记录、语义记忆和外部 artifact,并对旧上下文做渐进披露。

研究方向

主动 compaction、分支/折叠轨迹、记忆写入策略、时序与冲突更新、可学习遗忘、超长 web experience memory 和 provenance-aware retrieval。

核心卡点

写错的记忆比没记更危险;摘要会丢约束;检索相关不等于当前有效;不同 session 的身份与权限边界容易泄漏。

落地做法

用结构化 task state 保存事实、约束、未决项和下一步;原始证据保留引用;记忆设来源、时间、置信度、作用域和 TTL。

03
关键变量

Harness 与工具接口设计

怎样的 tool schema、返回粒度、编辑接口与环境反馈,能让同一模型更稳定地完成任务?

ACI

SWE-agent 把 Agent-Computer Interface 作为独立研究变量:repo 导航、文件编辑和反馈设计会显著改变行为。

现在知道

工具命名、参数 schema、错误语义、返回长度、patch 原语、repo map、DOM / accessibility tree 都是能力的一部分,不是“胶水”。

研究方向

自动工具压缩与选择、schema 生成、环境 affordance 学习、错误可恢复接口、tool result distillation、接口共设计与 harness-aware post-training。

核心卡点

工具越多选择越难;返回太短缺证据、太长污染上下文;错误文本不可操作;接口变化会让历史轨迹失效。

落地做法

一个工具完成一个可验证动作;参数使用领域名词;错误返回 reason / retryable / next action;写操作默认返回可读回的对象标识。

04
研究前沿

Agentic post-training 与强化学习

如何用多步工具轨迹和环境反馈训练 Agent,又不被稀疏奖励、归因误差与奖励作弊拖垮?

100+ turns

长轨迹可达百轮乃至百万 token;只给终局 outcome reward,无法稳定判断哪一步值得强化。

现在知道

环境内训练、可验证结果和训练—执行解耦正在形成工具链;Agent Lightning 用 Agent MDP 与统一数据接口尝试兼容不同框架。

研究方向

turn / step / segment credit assignment、过程奖励、反事实优势估计、自生成任务、课程学习、在线环境训练和可验证 reward model。

核心卡点

环境昂贵且非平稳;reward 会漏掉隐性质量;Agent 学会迎合 grader;策略升级后旧轨迹分布失配;安全约束难与探索兼容。

落地做法

先做高质量 trace 与失败标签,再谈 RL;优先可执行 verifier;保留 holdout 环境和红队任务;同时监控任务成功、成本和策略退化。

05
条件成立

多 Agent 的可控扩展

什么时候更多 Agent 产生净收益,什么时候只是把一次错误变成昂贵的协调错误?

−39–70%

一项 180-config 控制研究中,多 Agent 在强顺序推理任务上整体退化;并行可分任务才出现明显增益。

现在知道

并行搜索、独立审查和天然上下文分区最有机会获益;集中式 manager 通常比无中心对话更易控制错误传播。

研究方向

动态团队规模、能力路由、共享黑板、通信压缩、可验证 delegation、社会学习、异质权限和运行时动态图。

核心卡点

信息发出不等于被正确整合;相同模型产生相关错误;通信吞掉 token;最终责任归属与失败归因困难。

落地做法

先建立单 Agent 基线;只拆独立且可验证的子任务;manager 保持所有权;每个专家返回证据、置信度和完成条件。

06
环境耦合

Computer use、浏览器与多模态

从 DOM / API 走向截图、鼠标、键盘和混合感知后,如何保持定位、状态与操作后验证?

318 calls

OSWorld 2.0 的基线 Agent 平均约 318 次工具调用;远高于 OSWorld 1.0 的约 30 次。

现在知道

视觉 grounding 仍重要,但专业长任务更难的是跨来源对账、隐状态推断、多条目跟踪、动态更新和视觉结果验收。

研究方向

视觉 + DOM + API 混合策略、时序视觉、主动观察、UI 世界模型、跨应用状态、操作前后 diff、可验证 artifact 和可扩展训练环境。

核心卡点

UI 非平稳、像素坐标脆弱、弹窗和焦点不可预测;任务可能产生真实副作用;多模态结果往往难用确定性 grader 验证。

落地做法

API/DOM 优先,GUI 作为补洞;每次动作后重新观察;高风险提交前展示 final diff;运行于可重置隔离环境,并保留状态截图。

07
落地底线

安全、权限与人类控制

当不可信网页、邮件、工具描述和远程 Agent 都进入上下文时,怎样守住用户意图与真实权限?

12 attacks

MCP Security Bench 覆盖名称碰撞、工具描述注入、冒充用户、错误升级等 12 类攻击与 400+ 工具。

现在知道

模型的 instruction hierarchy 能提高鲁棒性,但无法单独形成安全边界。能力越强的工具调用模型,有时也更能执行攻击者指令。

研究方向

任务对齐监控、信息流控制、capability security、短期凭据、可信工具元数据、动态攻击环境、自动 policy synthesis 和安全经济学。

核心卡点

间接提示注入没有通用彻底解法;过度防御损害正常任务;跨工具组合产生 emergent 权限;用户确认也会疲劳。

落地做法

数据与指令分层;最小权限与短期 token;读写分离;不可逆动作逐笔确认;高风险参数由可信代码生成;全轨迹可回放。

06 PRODUCTION BLUEPRINT

受控自治的参考架构

让 workflow 管风险、状态和预算;让 Agent 只在局部不确定区间内选择行动。

01

Task Contract

目标、边界、权限、done、预算、超时

02

Policy Router

风险分级、模型/工具选择、拒绝与澄清

03

Bounded Agent Loop

plan → act → observe → verify

06

Outcome & Regression

结果验证、人工反馈、失败入回归集

05

Approval / Recovery

人工确认、checkpoint、补偿与接管

04

Tool Gateway

schema、权限、幂等、审计、MCP / API

STATE STORETRACE & COSTMEMORY WITH PROVENANCESANDBOX & CREDENTIALS
HANDOFF CONTRACT

交接包必须包含

  • 目标与当前 owner
  • 事实、证据和来源
  • 已产出 artifact
  • 未决问题与风险
  • 可用权限与禁区
  • 完成条件与返回路径
CHECKPOINT CONTRACT

恢复点必须包含

  • 业务状态与 schema 版本
  • 节点位置和待执行意图
  • 外部副作用 ledger
  • 工具结果与幂等键
  • 审批状态和超时
  • 恢复 / 补偿策略
TRACE CONTRACT

每次运行至少记录

  • 模型、版本与 prompt hash
  • 工具参数摘要和结果状态
  • 状态转移与 handoff
  • token、费用和延迟
  • 重试、错误和人工介入
  • 最终 grader 与失败标签

07 EVALUATION SYSTEM

评测系统,不评测“品牌”

公共 benchmark 给外部坐标;固定变量的内部真实任务,才负责选型、上线和回归。

!

静态公开题库正面临污染、饱和和 verifier 质量问题

OpenAI 2026 年审计报告指出,SWE-Bench Pro 公共子集在 8 个月内从 23.3% 升至 80.3%, 并估计 27.4%–34.1% 任务存在测试、提示或覆盖问题。高分必须结合任务新颖性、验证器和人工审查理解。

审计原文 ↗
pass@1

一次成功

最接近普通用户单次运行体验。

pass@k

能力上限

给 k 次机会至少一次成功。

passk

连续可靠

连续 k 次均成功,衡量可依赖性。

HITL

监督成本

人工澄清、确认、纠错和接管时间。

Σ cost

总拥有成本

token、墙钟时间、工具调用、环境和工程维护。

risk

安全损失

越权、错误写入、泄露、拒绝不足与过度拒绝。

CONTROLLED SHOOTOUT

比较框架时,固定六项

  1. 01同一模型版本与推理设置
  2. 02同一系统任务契约
  3. 03同一工具与 JSON schema
  4. 04同一初始环境与数据快照
  5. 05同一 token / 时间 / 费用预算
  6. 06同一 grader、done 与安全标准

每任务至少 3–5 次;报告置信区间和失败分布;保留完整 trace;同时记录代码量、 开发时间、调试成本、恢复成功率与人工介入分钟数。

F1

理解失败:目标或约束读错

F2

路由失败:选错工具 / Agent / 分支

F3

状态失败:遗忘、污染、冲突未更新

F4

执行失败:参数、定位、权限、环境错误

F5

恢复失败:重试、补偿、checkpoint 无效

F6

验证失败:没查、grader 漏判、提前结束

F7

安全失败:越权、注入、泄露、错误确认

F8

经济失败:虽成功但比人工更贵或更慢

08 ADOPTION GUIDE

从场景约束出发,再选实现

这里给的是 PoC 起点,不是免评测的最终答案。

场景优先候选先验证什么
A

确定性企业流程

LangGraph / Microsoft Agent Framework / PydanticAI

状态、checkpoint、审批、幂等、副作用恢复

B

轻量通用 Agent

OpenAI Agents SDK / Google ADK / smolagents

工具闭环、结构化输出、trace、失败分类

C

知识与文档流程

LlamaIndex / LangGraph + retrieval / PydanticAI

解析、权限、召回、引用、知识更新

D

多 Agent 研究

ADK / CrewAI / Agents SDK / LangGraph

单 Agent 基线、可分解性、协调成本、归因

E

Coding Agent

Codex CLI / SDK / OpenHands / SWE-agent / Aider

repo map、patch、测试反馈、沙箱、compaction

F

Browser / Computer use

API / DOM 优先的混合 harness + 隔离环境

动态定位、验证、安全副作用、人工接管

90-DAY LAB PLAN

把综述变成内部能力

W01–0201

定义任务契约

  • 20–50 个真实高价值任务
  • done、权限、预算、停止条件
  • 应拒绝 / 应澄清负样本
W03–0502

最小单 Agent 基线

  • 固定模型、工具和 sandbox
  • 确定性 grader 与 trace
  • 建立失败 taxonomy
W06–0903

受控对照实验

  • 选择 3–5 个候选实现
  • 每任务运行 3–5 次
  • 评估效果、成本与介入
W10–1204

灰度与回归闭环

  • 低风险自动化,高风险确认
  • 线上失败进入回归集
  • 每周复盘 trace 与权限
FINAL TAKE

Workflow 提供确定性骨架,Agent 提供局部适应性,工具与环境提供真值; checkpoint 提供恢复,tracing 提供解释,eval 提供进化方向,权限系统决定它能否真正进入生产。

APPENDIX PRIMARY SOURCES

论文、官方文档与评测入口

优先列一手来源;预印本结论按“尚待更多复现”理解。

SDK、运行时与协议 16
长任务、上下文与记忆 11
Harness、图、Tracing 与强化学习 14
多 Agent、Computer Use 与安全 15
评测、方法与审计 12

调研截止:2026-07-28

覆盖范围:通用 Agent、企业工作流、研究 / 浏览、Coding、Computer use、协议、运行时、安全与评测。

使用提示:项目能力、许可证、协议版本和榜单会变化,正式选型时应再次核验。