Agent 工具全景¶
研究快照:2026-09-26。基础 Wiki 的价格与硬件快照仍遵循 2026-09-04;本页只记录本轮重新核对过的 Agent 官方入口与源码状态。
Agent 产品不能只按“哪个模型最强”比较。真正决定交付能力的是 模型 × harness × 工具权限 × 环境 × 评测闭环。
一览¶
| Agent / Harness | 源码状态 | 核心抽象 | 最值得研究的地方 | 适合先用在哪 |
|---|---|---|---|---|
| DeepSeek Harness / dsh | MIT,官方开源,developer preview | Cordis 插件树、Profile、可替换能力 | 把模型、工具、循环、会话、沙箱和 UI 都插件化 | 需要自己组装 Agent runtime、做插件或多模式运行时 |
| pi | MIT,开源 monorepo | pi-ai + pi-agent-core + coding-agent |
极简工具面、树状会话、RPC/SDK、跨模型切换 | 个人开发、可嵌入的 coding harness、快速实验 |
| Muse | 名称有歧义;本页主分析开源 M.U.S.E | 任务图、specialist、peer review、交付器 | 自我改进技能和多代理任务编排 | 长任务、研究、报告和跨渠道交付,但需强审计 |
| OpenCode | MIT,官方开源 | TUI/桌面/IDE、build/plan agent、权限与 MCP | 多模型 provider、项目 AGENTS.md、可配置子代理 | 团队日常编码、模型供应商切换 |
| Codex | Apache-2.0,官方开源 CLI | Rust 核心、沙箱、审批、补丁和本地执行 | 将本地 Agent 的安全边界做成产品默认值 | 需要可审计 coding agent、沙箱和企业工作流 |
| Gemini CLI | Apache-2.0,官方开源 | policy engine、trusted folders、checkpoint、MCP | 浏览器/搜索/上下文/记忆和扩展组合 | Google 生态、长上下文和终端自动化 |
| Qwen Code | Apache-2.0,官方开源 | Gemini CLI 分叉后的多协议 Agent | 中文/国产模型、ACP/MCP、多平台桌面 | Qwen/DeepSeek/Kimi/MiniMax/GLM 混合 provider |
| Claude Code | CLI 开源资料与插件,但核心二进制不是完全开源 | 工具调用、权限、hooks、skills、MCP | 产品级 coding workflow 和安全策略 | 需要成熟的 Claude 编码体验,不能把 GitHub 当作核心源码 |
先看架构,不先看星数¶
| 层 | 关键问题 | 观察证据 |
|---|---|---|
| Model adapter | 是否支持多供应商、reasoning、tool call、流式和中断 | provider 目录、请求类型、模型 resolver |
| Context | 如何载入项目指令、历史、文件和工具结果 | AGENTS.md、session tree、压缩/截断策略 |
| Tool runtime | 工具是否有 schema、权限、超时、取消和输出上限 | tool registry、permission/policy、sandbox |
| Loop | 失败后重试、继续、分支还是停止 | agent loop、step budget、stop reason |
| State | 是否能恢复、fork、回放和审计 | JSONL/event log、session store、trajectory |
| Harness extension | 新工具是改核心代码还是挂插件 | plugin API、MCP、skills、hooks、ACP |
| Eval | 能否固定环境和 workload,不靠截图判断 | benchmark runner、trace、replay、grader |
初步判断¶
- 想研究可组合 Harness:先读 dsh,再对照 pi 的简洁 runtime。
- 想研究生产安全默认值:先读 Codex 的 sandbox/approval,再看 OpenCode 的 permission/policy。
- 想研究持续任务与交付:看 Muse 的图式任务和评审,但要把“自我改进”当成高风险能力。
- 想研究模型可替换:看 OpenCode、pi、Qwen Code 的 provider 抽象,不要把 Agent 逻辑和单一模型 SDK 绑定。
- 想做企业平台:组合
stable core + provider adapter + policy engine + append-only trace + eval gate,不要直接把任一 CLI 当平台后端。
本 Wiki 的统一分析模板¶
每个 Agent 页面固定回答:
- 是什么:官方定位、源码许可、成熟度和目标用户。
- 源码在哪里:仓库、关键目录、入口和可扩展点。
- 运行时怎么走:从用户输入到模型、工具、状态和输出。
- 安全边界:沙箱、审批、权限、网络和密钥的默认行为。
- 适用条件、代价、验证方式:不只写优点。
- 追踪字段:版本、commit、重大变更、待核对事项和下一次检查日期。
研究结论¶
“Agent”已经分成三类产品:
- Coding CLI:Codex、OpenCode、pi、Claude Code、Gemini CLI,重点是代码库上下文、工具执行与回滚。
- Composable harness:dsh、pi-core、部分 Qwen Code,重点是把模型、工具、会话、策略和 UI 拆成可替换部件。
- Long-horizon orchestrator:Muse 一类系统,重点是任务图、子代理、评审和对外发布。
FDE 选型应先决定要解决哪一类问题,再选工具。把 Coding CLI 当成企业 Agent 平台,或把长任务 orchestrator 当成简单终端助手,都会付出不必要的复杂度。
追踪记录¶
| 对象 | 官方主页 | 源码入口 | 本次检查 | 下一次检查 |
|---|---|---|---|---|
| dsh | dshai.org | deepseek-ai/deepseek-harness | 2026-09-26 | 新 release / profile API |
| pi | pi.dev | earendil-works/pi-mono | 2026-09-26 | 包名迁移与 agent-core API |
| Muse | M.U.S.E docs | M.U.S.E | 2026-09-26 | 名称与官方归属确认 |
| OpenCode | opencode.ai | anomalyco/opencode | 2026-09-26 | provider / permission schema |
| Codex | developers.openai.com/codex | openai/codex | 2026-09-26 | sandbox、approval、MCP 接口 |
证据边界:仓库 README 能证明源码和公开接口,不能自动证明生产稳定性、模型质量或安全完备。所有“更适合”判断都要回到目标 workload 的 trace、评测和故障演练。