跳转至

Agent 工具全景

研究快照:2026-09-26。基础 Wiki 的价格与硬件快照仍遵循 2026-09-04;本页只记录本轮重新核对过的 Agent 官方入口与源码状态。

Agent 产品不能只按“哪个模型最强”比较。真正决定交付能力的是 模型 × harness × 工具权限 × 环境 × 评测闭环。

一览

Agent / Harness 源码状态 核心抽象 最值得研究的地方 适合先用在哪
DeepSeek Harness / dsh MIT,官方开源,developer preview Cordis 插件树、Profile、可替换能力 把模型、工具、循环、会话、沙箱和 UI 都插件化 需要自己组装 Agent runtime、做插件或多模式运行时
pi MIT,开源 monorepo pi-ai + pi-agent-core + coding-agent 极简工具面、树状会话、RPC/SDK、跨模型切换 个人开发、可嵌入的 coding harness、快速实验
Muse 名称有歧义;本页主分析开源 M.U.S.E 任务图、specialist、peer review、交付器 自我改进技能和多代理任务编排 长任务、研究、报告和跨渠道交付,但需强审计
OpenCode MIT,官方开源 TUI/桌面/IDE、build/plan agent、权限与 MCP 多模型 provider、项目 AGENTS.md、可配置子代理 团队日常编码、模型供应商切换
Codex Apache-2.0,官方开源 CLI Rust 核心、沙箱、审批、补丁和本地执行 将本地 Agent 的安全边界做成产品默认值 需要可审计 coding agent、沙箱和企业工作流
Gemini CLI Apache-2.0,官方开源 policy engine、trusted folders、checkpoint、MCP 浏览器/搜索/上下文/记忆和扩展组合 Google 生态、长上下文和终端自动化
Qwen Code Apache-2.0,官方开源 Gemini CLI 分叉后的多协议 Agent 中文/国产模型、ACP/MCP、多平台桌面 Qwen/DeepSeek/Kimi/MiniMax/GLM 混合 provider
Claude Code CLI 开源资料与插件,但核心二进制不是完全开源 工具调用、权限、hooks、skills、MCP 产品级 coding workflow 和安全策略 需要成熟的 Claude 编码体验,不能把 GitHub 当作核心源码

先看架构,不先看星数

层 关键问题 观察证据
Model adapter 是否支持多供应商、reasoning、tool call、流式和中断 provider 目录、请求类型、模型 resolver
Context 如何载入项目指令、历史、文件和工具结果 AGENTS.md、session tree、压缩/截断策略
Tool runtime 工具是否有 schema、权限、超时、取消和输出上限 tool registry、permission/policy、sandbox
Loop 失败后重试、继续、分支还是停止 agent loop、step budget、stop reason
State 是否能恢复、fork、回放和审计 JSONL/event log、session store、trajectory
Harness extension 新工具是改核心代码还是挂插件 plugin API、MCP、skills、hooks、ACP
Eval 能否固定环境和 workload,不靠截图判断 benchmark runner、trace、replay、grader

初步判断

  • 想研究可组合 Harness:先读 dsh,再对照 pi 的简洁 runtime。
  • 想研究生产安全默认值:先读 Codex 的 sandbox/approval,再看 OpenCode 的 permission/policy。
  • 想研究持续任务与交付:看 Muse 的图式任务和评审,但要把“自我改进”当成高风险能力。
  • 想研究模型可替换:看 OpenCode、pi、Qwen Code 的 provider 抽象,不要把 Agent 逻辑和单一模型 SDK 绑定。
  • 想做企业平台:组合 stable core + provider adapter + policy engine + append-only trace + eval gate,不要直接把任一 CLI 当平台后端。

本 Wiki 的统一分析模板

每个 Agent 页面固定回答:

  1. 是什么:官方定位、源码许可、成熟度和目标用户。
  2. 源码在哪里:仓库、关键目录、入口和可扩展点。
  3. 运行时怎么走:从用户输入到模型、工具、状态和输出。
  4. 安全边界:沙箱、审批、权限、网络和密钥的默认行为。
  5. 适用条件、代价、验证方式:不只写优点。
  6. 追踪字段:版本、commit、重大变更、待核对事项和下一次检查日期。

研究结论

“Agent”已经分成三类产品:

  1. Coding CLI:Codex、OpenCode、pi、Claude Code、Gemini CLI,重点是代码库上下文、工具执行与回滚。
  2. Composable harness:dsh、pi-core、部分 Qwen Code,重点是把模型、工具、会话、策略和 UI 拆成可替换部件。
  3. Long-horizon orchestrator:Muse 一类系统,重点是任务图、子代理、评审和对外发布。

FDE 选型应先决定要解决哪一类问题,再选工具。把 Coding CLI 当成企业 Agent 平台,或把长任务 orchestrator 当成简单终端助手,都会付出不必要的复杂度。

追踪记录

对象 官方主页 源码入口 本次检查 下一次检查
dsh dshai.org deepseek-ai/deepseek-harness 2026-09-26 新 release / profile API
pi pi.dev earendil-works/pi-mono 2026-09-26 包名迁移与 agent-core API
Muse M.U.S.E docs M.U.S.E 2026-09-26 名称与官方归属确认
OpenCode opencode.ai anomalyco/opencode 2026-09-26 provider / permission schema
Codex developers.openai.com/codex openai/codex 2026-09-26 sandbox、approval、MCP 接口
证据边界:仓库 README 能证明源码和公开接口,不能自动证明生产稳定性、模型质量或安全完备。所有“更适合”判断都要回到目标 workload 的 trace、评测和故障演练。