00 ABSTRACT & METHOD
先给结论,再说明证据
这不是框架推荐榜,而是一份以“系统边界—控制原语—可靠性证据—生产约束”为主线的综述。
2026 年的 Agent 开源生态已经拥有成熟的 loop、tool calling、handoff、状态图、 checkpoint、tracing、MCP 与 A2A;真正稀缺的仍是高质量任务环境、长轨迹数据、 可验证反馈、权限系统、恢复机制与持续评测闭环。因此,生产路线应是 确定性外壳 + 受限自治内核,而不是把所有流程都交给自由规划。
框架不是能力本体
公开榜单测到的是模型、harness、工具接口、上下文、环境、预算和 grader 的联合表现。
长任务仍在快速演进
短任务成功率提升很快,但时间跨度增长会放大状态漂移、错误累积和验证缺失。
多 Agent 是条件变量
只有可分解、可并行验证、上下文可天然隔离的任务,才可能覆盖协调成本。
安全必须是系统属性
提示词无法替代最小权限、凭据隔离、事务确认、可信边界和可回放审计。
可重复的工程能力
有多套实现、明确契约和生产案例,例如结构化输出、持久化图与基础 tracing。
证据正在累积
结果稳定但边界仍移动,例如长任务 harness、上下文压缩和 computer use。
结论尚未收敛
论文结果有希望但复现、成本或外部有效性不足,例如 agentic RL 与动态多 Agent 图。
01 SYSTEM STACK
先分层,才能谈“开源到哪里”
Codex CLI、Agents SDK、LangGraph、MCP 和 OSWorld 都与 Agent 有关,但它们解决的是不同层的问题。
Application / Product
用户任务、UI、权限、连接器、云端运行与协作体验
Harness / Scaffold
把模型、工具、上下文、编辑接口、循环与验证拼成可工作的 Agent
Workflow / Runtime
状态、分支、恢复、持久化、并行、人工审批和副作用管理
Agent SDK
Agent loop、tools、handoff、guardrails、sessions、tracing 的代码抽象
Interoperability
工具、数据和远程 Agent 的发现、能力描述与消息交换
Environment & Evaluation
可执行任务环境、状态初始化、验证器、轨迹与安全测试
Model & Inference
推理、生成、工具选择、多模态感知和推理时计算
02 SDK BOUNDARIES
Codex CLI 到底与 SDK 差在哪
最简单的区分:SDK 是造系统的零件;CLI 是已经装配好的、面向代码仓库的 Agent harness 与终端产品。
Codex CLI
终端客户端 + 编码 harness
Repo / shell / patch / sandbox / approvals / compaction / TUI / exec从代码中创建和续接 Codex thread,用于 CI、内部工具和应用集成。
更底层的本地 JSON-RPC 接口,暴露 thread、turn、审批、历史和流式事件。
通用 Agent 应用工具箱;可把 Codex 作为 MCP 专家纳入更大的业务工作流。
代码仓库中的 agent turn
终端 UX、shell、patch、文件上下文、沙箱、审批、MCP、非交互执行
通用业务图、跨域服务编排
编码、代码审查、终端自动化
Codex thread / turn
从 TS / Python 控制 Codex、结构化事件与线程延续
重新发明一个通用 agent loop
CI/CD、内部研发工具、产品内嵌 Codex
JSON-RPC client protocol
认证、历史、审批、thread / turn、流式事件
高层业务 Agent 设计
IDE、桌面端和自定义富客户端
Agent run
loop、tools、agents-as-tools、handoffs、sessions、guardrails、traces
代码仓库专用 harness 与终端 UX
通用工具型 Agent、客服、研究与多 Agent 协作
持久化状态图
checkpoint、interrupt、time travel、并行、恢复
替你定义领域工具和业务正确性
长生命周期、可恢复、HITL 流程
Agent / workflow
多语言 agent、BSP 图、checkpoint、middleware、OTel
消除超步屏障和并行尾延迟
.NET / Python 与 Azure 企业体系
Agent / graph workflow
多语言、sessions、memory、evaluation、MCP、A2A、部署
替代应用自身权限与治理
Google 生态和多形态部署
类型化 Agent
typed deps / output、tools、MCP、evals、durable adapters
完整编码产品或 GUI runtime
重类型、验证和 Python 可维护性的团队
先用 Codex CLI / SDK
复用成熟的仓库接口、编辑工具、沙箱和上下文策略,避免从通用 SDK 重搭 coding harness。
从 Agents SDK / ADK / PydanticAI 起步
工具契约与流程较简单时,先保持 loop 轻量,失败结构稳定后再引入图。
选状态图 / durable runtime
关键不是画图,而是持久化状态、幂等副作用、人工中断、版本迁移与恢复语义。
官方边界: Codex Glossary ↗ Codex SDK ↗ Agents SDK Orchestration ↗ Codex × Agents SDK ↗
03 CORE PRIMITIVES
八个常用词,拆到工程语义
每个构件都包含四层:它是什么、当前研究什么、系统卡在哪里、上线时如何收口。点击展开。
01
路由 Routing
决定下一步由哪个模型、工具、Agent 或流程分支处理。
展开
路由 Routing
决定下一步由哪个模型、工具、Agent 或流程分支处理。
三种实现
规则路由最可控;模型分类器适应自然语言;学习型路由用历史成败与成本优化选择。三者通常应叠加,而不是互斥。
研究方向
带置信度的 abstention、成本感知模型选择、在线 taxonomy 演化、基于 trace 的路由器训练、风险分级和 policy gate。
现状卡点
标签边界漂移、低频类缺数据、路由错了却被下游“勉强完成”、模型自报置信度不校准,以及线上分布变化。
工程收口
先规则守住权限与合规,再让模型做语义选择;保留 fallback、top-2、拒答路径,并单独评估 route accuracy 与端到端 utility。
02
并行 Parallelism
将独立子任务或多条候选路径 fan-out,再由 reducer 汇总。
展开
并行 Parallelism
将独立子任务或多条候选路径 fan-out,再由 reducer 汇总。
适用条件
检索多个来源、独立文件检查、候选解法采样、可并行验证的分片任务。顺序依赖强的任务不应硬拆。
研究方向
动态并发宽度、early stopping、预算分配、异质模型组合、相关错误建模、流式聚合和推测执行。
现状卡点
相关错误不会因投票消失;慢分支拖累尾延迟;合并器可能丢失少数正确证据;共享工具还会产生资源竞争与副作用冲突。
工程收口
为每个分支设 deadline、预算和幂等键;fan-in 依据证据而非文风投票;明确“少一个分支是否仍可完成”。
03
交接 Handoff
把后续回复的所有权、上下文和部分权限转移给专门 Agent。
展开
交接 Handoff
把后续回复的所有权、上下文和部分权限转移给专门 Agent。
与 Agent-as-tool 的差别
Handoff 后专家成为新的对话所有者;Agent-as-tool 中经理仍负责最终答案,只把专家当作一次受控调用。
研究方向
最小充分上下文、所有权协议、权限委托、handoff 质量评分、自动回退、跨组织 agent card 与能力发现。
现状卡点
上下文丢失、重复工作、责任模糊、循环交接、权限无意升级,以及“转交成功但任务无人闭环”。
工程收口
使用结构化交接包:目标、已知事实、证据、产物、未决问题、权限、完成条件、返回路径;默认优先 manager + specialists。
04
图编排 Graph Orchestration
用节点、边、状态、条件、循环和中断表达可恢复的控制流。
展开
图编排 Graph Orchestration
用节点、边、状态、条件、循环和中断表达可恢复的控制流。
它解决什么
图把控制面显式化:哪些步骤可并行、何时中断、哪里审批、失败后从哪里恢复。它不自动让模型更聪明。
研究方向
从静态模板到动态运行时图、图结构优化、自动分解、拓扑学习、基于 trace 的重写,以及图成本与鲁棒性联合评价。
现状卡点
节点粒度难定、状态 schema 演化困难、动态图难审计;Pregel/BSP 的超步屏障可靠但会让并行路径互相等待。
工程收口
先画业务状态机,再嵌 Agent 节点;副作用和推理节点分离;为每条边定义 guard、timeout、retry、compensation 与 done 条件。
05
结构化输出 Structured Output
让模型输出满足 JSON Schema / 类型契约的机器可消费结果。
展开
结构化输出 Structured Output
让模型输出满足 JSON Schema / 类型契约的机器可消费结果。
能力边界
约束解码能保证语法和部分 schema,有效 JSON 并不等于事实正确、字段完整或符合业务语义。
研究方向
复杂 schema 覆盖、语义约束、可解释 repair、跨 provider 一致性、流式结构化输出和 schema-aware agent planning。
现状卡点
深层 union / recursion 支持不一致;schema 越复杂推理越脆;自动修复可能把错误“修成可解析”。
工程收口
保持 schema 小而稳定;做语义校验、跨字段不变量和外部查验;高风险字段 fail closed,不用无限 repair loop。
06
检查点 Checkpoint
持久化执行状态,以便暂停、人工介入、故障恢复和时间旅行。
展开
检查点 Checkpoint
持久化执行状态,以便暂停、人工介入、故障恢复和时间旅行。
不是模型 checkpoint
这里保存的是 thread、节点位置、消息、业务状态、待处理工具结果和审批状态,不是训练权重。
研究方向
细粒度增量快照、跨版本迁移、分布式一致性、事件溯源、长期记忆与执行状态分离,以及隐私感知 TTL。
现状卡点
外部副作用无法随状态一起回滚;恢复时可能重复发邮件或扣款;不可序列化对象和 schema 升级会破坏旧状态。
工程收口
所有写操作使用幂等键和事务记录;保存“意图—执行—结果”三态;明确至少一次/至多一次语义,并定期做恢复演练。
07
基础 Tracing
把 agent run、model call、tool、handoff、guardrail 和错误记录成关联 span。
展开
基础 Tracing
把 agent run、model call、tool、handoff、guardrail 和错误记录成关联 span。
Tracing ≠ Evaluation
Trace 解释“发生了什么”;eval 判断“做得好不好”。前者是诊断、回放、数据生产和失效归因的基础。
研究方向
统一 GenAI 语义约定、因果归因、反事实回放、自动 failure labeling、trace compression 和可观测性驱动训练。
现状卡点
轨迹巨大且含敏感内容;provider 字段不统一;最终失败常由多步共同导致,单点根因标签过于粗糙。
工程收口
记录模型/版本、prompt hash、工具参数摘要、token、延迟、成本、状态转移和审批;正文默认脱敏并设采样与保留期。
08
MCP / A2A 互操作
MCP 连接 Agent 与工具/数据;A2A 连接自治边界内外的 Agent 与任务。
展开
MCP / A2A 互操作
MCP 连接 Agent 与工具/数据;A2A 连接自治边界内外的 Agent 与任务。
MCP
基于 JSON-RPC 的有状态连接与能力协商;server 暴露 tools、resources、prompts,client 可提供 sampling、roots、elicitation。
A2A
通过 Agent Card 发现能力,以 task、message、artifact 建模长任务,支持流式、异步、取消、订阅与多种协议绑定。
研究方向
语义互操作、可信能力描述、策略协商、跨组织身份与计费、可验证 artifact、协议网关和最小上下文交换。
现状卡点
协议标准化了连接,不会自动解决信任;tool 描述与远端响应都可能是恶意输入,能力声明也可能过期或夸大。
04 OPEN-SOURCE LANDSCAPE
同一生态,不同主战场
筛选只是阅读辅助;真正比较要固定模型、工具、环境、预算和 grader。
OpenAI Agents SDK
抽象克制,围绕 run、tools、handoff、guardrails、sessions 与 traces。
- 强项
- 快速跑通通用 agent loop
- 边界
- 不是 coding harness 或 durable graph
Google ADK
Python / TS / Go / Java / Kotlin,多 Agent、图工作流、memory、eval、MCP 与 A2A。
- 强项
- 覆盖广、部署形态多
- 边界
- 广度带来更多概念与治理面
LangGraph
长生命周期的状态图、checkpoint、interrupt、time travel 与 fault tolerance。
- 强项
- 状态与恢复是一等公民
- 边界
- 图不会替代业务正确性设计
Microsoft Agent Framework
整合 Agents、Harness 与基于 BSP 超步的 Workflows,覆盖 Python / .NET。
- 强项
- 类型、checkpoint、OTel、Azure
- 边界
- 并行路径受 barrier 约束
PydanticAI
类型化依赖与输出,支持 MCP、evals、compaction 和 durable execution adapters。
- 强项
- 验证、可维护性、模型中立
- 边界
- Python 中心,不是完整产品
CrewAI
角色化 crews 与确定性 flows,便于表达协作原型。
- 强项
- 多 Agent 概念直观
- 边界
- 协调、token 与调试成本
smolagents
CodeAgent / ToolCallingAgent 的透明最小实现,适合学习和研究。
- 强项
- 实现小、实验快
- 边界
- 生产能力需自行补齐
Codex CLI
面向代码仓库的终端 Agent:shell、patch、sandbox、approval、MCP 与 compaction。
- 强项
- 成熟 coding interface
- 边界
- 不是通用业务 workflow SDK
OpenHands
可自托管的软件工程 Agent 平台,包含运行时、沙箱与多种交互界面。
- 强项
- 端到端、自托管
- 边界
- 部署和环境成本较高
05 RESEARCH FRONTIERS
七条路线:已知什么,还卡在哪里
每条路线都按研究问题、最新证据、可落地做法和未解难题组织;论文结论只在其任务分布内成立。
长任务可靠性与有效自治时间
能否在几十分钟至数小时内保持目标、识别失败、恢复进度,并让监督成本低于人工完成?
OSWorld 2.0 截止快照的最佳 500-step 完整完成率;108 个任务的人类中位耗时约 1.6 小时。
现在知道
METR 的 50% time horizon 给出可比较趋势,但任务偏软件与推理。OSWorld 2.0 显示,长任务失败已从“不会点”转向状态丢失、冲突未解、动态信息漏看和最后不验证。
研究方向
分段目标与 rolling horizon、失败检测器、进度价值函数、可验证中间状态、预算感知 stopping、恢复策略和人类监督经济学。
核心卡点
小错误复合增长;最终 reward 太晚;Agent 会把“文件存在”误当“任务正确”;基准任务时长与真实岗位分布仍不一致。
落地做法
把任务拆成可验证里程碑;保存 done / next / blockers;每次写操作后读回验证;为长任务设置人工接管点与失败预算。
Context engineering 与长期记忆
如何在有限上下文中保留最小高信号状态,并知道何时检索、压缩、更新和遗忘?
MemoryAgentBench 将长期记忆拆成准确检索、测试时学习、长程理解和选择性遗忘;现有方法尚无全能解。
现在知道
“把全部历史塞进去”不是长期记忆。有效系统通常分离工作状态、情节记录、语义记忆和外部 artifact,并对旧上下文做渐进披露。
研究方向
主动 compaction、分支/折叠轨迹、记忆写入策略、时序与冲突更新、可学习遗忘、超长 web experience memory 和 provenance-aware retrieval。
核心卡点
写错的记忆比没记更危险;摘要会丢约束;检索相关不等于当前有效;不同 session 的身份与权限边界容易泄漏。
落地做法
用结构化 task state 保存事实、约束、未决项和下一步;原始证据保留引用;记忆设来源、时间、置信度、作用域和 TTL。
Harness 与工具接口设计
怎样的 tool schema、返回粒度、编辑接口与环境反馈,能让同一模型更稳定地完成任务?
SWE-agent 把 Agent-Computer Interface 作为独立研究变量:repo 导航、文件编辑和反馈设计会显著改变行为。
现在知道
工具命名、参数 schema、错误语义、返回长度、patch 原语、repo map、DOM / accessibility tree 都是能力的一部分,不是“胶水”。
研究方向
自动工具压缩与选择、schema 生成、环境 affordance 学习、错误可恢复接口、tool result distillation、接口共设计与 harness-aware post-training。
核心卡点
工具越多选择越难;返回太短缺证据、太长污染上下文;错误文本不可操作;接口变化会让历史轨迹失效。
落地做法
一个工具完成一个可验证动作;参数使用领域名词;错误返回 reason / retryable / next action;写操作默认返回可读回的对象标识。
Agentic post-training 与强化学习
如何用多步工具轨迹和环境反馈训练 Agent,又不被稀疏奖励、归因误差与奖励作弊拖垮?
长轨迹可达百轮乃至百万 token;只给终局 outcome reward,无法稳定判断哪一步值得强化。
现在知道
环境内训练、可验证结果和训练—执行解耦正在形成工具链;Agent Lightning 用 Agent MDP 与统一数据接口尝试兼容不同框架。
研究方向
turn / step / segment credit assignment、过程奖励、反事实优势估计、自生成任务、课程学习、在线环境训练和可验证 reward model。
核心卡点
环境昂贵且非平稳;reward 会漏掉隐性质量;Agent 学会迎合 grader;策略升级后旧轨迹分布失配;安全约束难与探索兼容。
落地做法
先做高质量 trace 与失败标签,再谈 RL;优先可执行 verifier;保留 holdout 环境和红队任务;同时监控任务成功、成本和策略退化。
多 Agent 的可控扩展
什么时候更多 Agent 产生净收益,什么时候只是把一次错误变成昂贵的协调错误?
一项 180-config 控制研究中,多 Agent 在强顺序推理任务上整体退化;并行可分任务才出现明显增益。
现在知道
并行搜索、独立审查和天然上下文分区最有机会获益;集中式 manager 通常比无中心对话更易控制错误传播。
研究方向
动态团队规模、能力路由、共享黑板、通信压缩、可验证 delegation、社会学习、异质权限和运行时动态图。
核心卡点
信息发出不等于被正确整合;相同模型产生相关错误;通信吞掉 token;最终责任归属与失败归因困难。
落地做法
先建立单 Agent 基线;只拆独立且可验证的子任务;manager 保持所有权;每个专家返回证据、置信度和完成条件。
Computer use、浏览器与多模态
从 DOM / API 走向截图、鼠标、键盘和混合感知后,如何保持定位、状态与操作后验证?
OSWorld 2.0 的基线 Agent 平均约 318 次工具调用;远高于 OSWorld 1.0 的约 30 次。
现在知道
视觉 grounding 仍重要,但专业长任务更难的是跨来源对账、隐状态推断、多条目跟踪、动态更新和视觉结果验收。
研究方向
视觉 + DOM + API 混合策略、时序视觉、主动观察、UI 世界模型、跨应用状态、操作前后 diff、可验证 artifact 和可扩展训练环境。
核心卡点
UI 非平稳、像素坐标脆弱、弹窗和焦点不可预测;任务可能产生真实副作用;多模态结果往往难用确定性 grader 验证。
落地做法
API/DOM 优先,GUI 作为补洞;每次动作后重新观察;高风险提交前展示 final diff;运行于可重置隔离环境,并保留状态截图。
安全、权限与人类控制
当不可信网页、邮件、工具描述和远程 Agent 都进入上下文时,怎样守住用户意图与真实权限?
MCP Security Bench 覆盖名称碰撞、工具描述注入、冒充用户、错误升级等 12 类攻击与 400+ 工具。
现在知道
模型的 instruction hierarchy 能提高鲁棒性,但无法单独形成安全边界。能力越强的工具调用模型,有时也更能执行攻击者指令。
研究方向
任务对齐监控、信息流控制、capability security、短期凭据、可信工具元数据、动态攻击环境、自动 policy synthesis 和安全经济学。
核心卡点
间接提示注入没有通用彻底解法;过度防御损害正常任务;跨工具组合产生 emergent 权限;用户确认也会疲劳。
落地做法
数据与指令分层;最小权限与短期 token;读写分离;不可逆动作逐笔确认;高风险参数由可信代码生成;全轨迹可回放。
06 PRODUCTION BLUEPRINT
受控自治的参考架构
让 workflow 管风险、状态和预算;让 Agent 只在局部不确定区间内选择行动。
Task Contract
目标、边界、权限、done、预算、超时
Policy Router
风险分级、模型/工具选择、拒绝与澄清
Bounded Agent Loop
plan → act → observe → verify
Outcome & Regression
结果验证、人工反馈、失败入回归集
Approval / Recovery
人工确认、checkpoint、补偿与接管
Tool Gateway
schema、权限、幂等、审计、MCP / API
交接包必须包含
- 目标与当前 owner
- 事实、证据和来源
- 已产出 artifact
- 未决问题与风险
- 可用权限与禁区
- 完成条件与返回路径
恢复点必须包含
- 业务状态与 schema 版本
- 节点位置和待执行意图
- 外部副作用 ledger
- 工具结果与幂等键
- 审批状态和超时
- 恢复 / 补偿策略
每次运行至少记录
- 模型、版本与 prompt hash
- 工具参数摘要和结果状态
- 状态转移与 handoff
- token、费用和延迟
- 重试、错误和人工介入
- 最终 grader 与失败标签
07 EVALUATION SYSTEM
评测系统,不评测“品牌”
公共 benchmark 给外部坐标;固定变量的内部真实任务,才负责选型、上线和回归。
静态公开题库正面临污染、饱和和 verifier 质量问题
OpenAI 2026 年审计报告指出,SWE-Bench Pro 公共子集在 8 个月内从 23.3% 升至 80.3%, 并估计 27.4%–34.1% 任务存在测试、提示或覆盖问题。高分必须结合任务新颖性、验证器和人工审查理解。
一次成功
最接近普通用户单次运行体验。
能力上限
给 k 次机会至少一次成功。
连续可靠
连续 k 次均成功,衡量可依赖性。
监督成本
人工澄清、确认、纠错和接管时间。
总拥有成本
token、墙钟时间、工具调用、环境和工程维护。
安全损失
越权、错误写入、泄露、拒绝不足与过度拒绝。
真实 Linux 终端任务
CLI / coding / DevOps harness
对模型、环境、预算强耦合
SWE-bench真实仓库 issue 修复
软件工程 Agent
污染、测试质量、版本差异
DeepSWE原创长程软件任务
新一代 coding Agent
规模小、独立复现仍有限
BFCL函数调用与格式
工具型模型 / Agent
不是完整业务闭环
τ-bench多轮工具与策略遵循
客服 / 企业流程
领域和用户模拟有限
WebArena真实网站端到端操作
Browser Agent
维护成本与网站覆盖
OSWorld 2.0长时跨应用 computer use
桌面 / 多模态 Agent
运行昂贵、系统耦合
AgentDojo任务能力 + 间接注入
工具型 Agent 安全
攻击面不可穷举
MCP-AgentBenchMCP 工具发现与组合
MCP client / Agent
聚焦协议工具层
METR Time Horizon可完成任务的时间跨度
长任务 Agent
任务分布偏技术类
比较框架时,固定六项
- 01同一模型版本与推理设置
- 02同一系统任务契约
- 03同一工具与 JSON schema
- 04同一初始环境与数据快照
- 05同一 token / 时间 / 费用预算
- 06同一 grader、done 与安全标准
每任务至少 3–5 次;报告置信区间和失败分布;保留完整 trace;同时记录代码量、 开发时间、调试成本、恢复成功率与人工介入分钟数。
理解失败:目标或约束读错
路由失败:选错工具 / Agent / 分支
状态失败:遗忘、污染、冲突未更新
执行失败:参数、定位、权限、环境错误
恢复失败:重试、补偿、checkpoint 无效
验证失败:没查、grader 漏判、提前结束
安全失败:越权、注入、泄露、错误确认
经济失败:虽成功但比人工更贵或更慢
08 ADOPTION GUIDE
从场景约束出发,再选实现
这里给的是 PoC 起点,不是免评测的最终答案。
确定性企业流程
LangGraph / Microsoft Agent Framework / PydanticAI
状态、checkpoint、审批、幂等、副作用恢复
轻量通用 Agent
OpenAI Agents SDK / Google ADK / smolagents
工具闭环、结构化输出、trace、失败分类
知识与文档流程
LlamaIndex / LangGraph + retrieval / PydanticAI
解析、权限、召回、引用、知识更新
多 Agent 研究
ADK / CrewAI / Agents SDK / LangGraph
单 Agent 基线、可分解性、协调成本、归因
Coding Agent
Codex CLI / SDK / OpenHands / SWE-agent / Aider
repo map、patch、测试反馈、沙箱、compaction
Browser / Computer use
API / DOM 优先的混合 harness + 隔离环境
动态定位、验证、安全副作用、人工接管
把综述变成内部能力
定义任务契约
- 20–50 个真实高价值任务
- done、权限、预算、停止条件
- 应拒绝 / 应澄清负样本
最小单 Agent 基线
- 固定模型、工具和 sandbox
- 确定性 grader 与 trace
- 建立失败 taxonomy
受控对照实验
- 选择 3–5 个候选实现
- 每任务运行 3–5 次
- 评估效果、成本与介入
灰度与回归闭环
- 低风险自动化,高风险确认
- 线上失败进入回归集
- 每周复盘 trace 与权限
Workflow 提供确定性骨架,Agent 提供局部适应性,工具与环境提供真值; checkpoint 提供恢复,tracing 提供解释,eval 提供进化方向,权限系统决定它能否真正进入生产。
APPENDIX PRIMARY SOURCES
论文、官方文档与评测入口
优先列一手来源;预印本结论按“尚待更多复现”理解。
SDK、运行时与协议 16
长任务、上下文与记忆 11
Harness、图、Tracing 与强化学习 14
多 Agent、Computer Use 与安全 15
评测、方法与审计 12
调研截止:2026-07-28
覆盖范围:通用 Agent、企业工作流、研究 / 浏览、Coding、Computer use、协议、运行时、安全与评测。
使用提示:项目能力、许可证、协议版本和榜单会变化,正式选型时应再次核验。