重估 Agent 能力:2026 评测范式横评
用真实环境、过程合规与工作流路由三条尺度,重新审视 Agent 评测分数在工程选型中的意义。
Alex Xiang 的个人技术博客
我写代码三十多年,现在仍在一线做 AI 产品和工程开发。这里主要记录 AI 编程、软件工程、 本地模型和真实项目中的技术判断,也保存一个程序员亲历行业变化的长期笔记。 了解作者经历
用真实环境、过程合规与工作流路由三条尺度,重新审视 Agent 评测分数在工程选型中的意义。
核对 DeepSeek V4 Pro 正式版的 1M 上下文、384K 最大输出、API 价格与官方 Codex 配置脚本,并判断已有本机配置在什么情况下需要更新。
不必频繁手动切换模型:让 Sol 掌舵、Terra 实现、Luna 侦察,在单一 Codex 会话中按任务边界调度多个 Agent。
Agent 能发现彼此、调用彼此,并不代表它们有办法验证对方的能力声明。本文借“柠檬市场”分析开放智能体网络中的信息不对称,以及信号、筛选和声誉机制如何补上一层信任。
David Silver 与 Richard Sutton 认为,AI 的下一阶段将从模仿人类数据转向在环境中持续行动和学习。本文梳理“体验时代”的四个特征,并讨论奖励设计、长期智能体与安全边界。
Prime Intellect 新发布的 Prime Agent 把 Pi 放进持久 IPython 控制环境,补上递归子代理、守护进程、持续目标与可回滚的 harness 演化。本文拆解它的信息流、上手方式、实践边界,以及它和 Pi 到底该怎么选。
2026 年 8 月,OpenAI、Amazon、Cursor、Microsoft、Vercel 联合发布 Agent Plugins 1.0:一个把 Agent Skills 和 MCP 服务器打包成可移植插件的目录格式。本文拆解规范本身的边界设计、治理结构,再讨论三个真正的缺口:信任模型、Anthropic 缺席,以及“包能搬家但行为不能”。
MCP 解决了 Agent 怎么调用工具,ARD 解决的是更早一环:Agent 怎么找到工具。2026 年 6 月 Google 联合微软、GitHub 等发布 ARD 规范,核心是域名下的 ai-catalog.json 和聚合注册中心。本文拆解 Catalog/Registry 机制、与 MCP/A2A 的分工,以及验证机制背后的供应链安全账。
从 2021 年的“更快 JavaScript 运行时”到 2026 年 Anthropic 收购、成为 Claude Code 的基础设施,再到用 Claude Code 把自己重写成 Rust。这篇讲清 Bun 的基本概念、它要解决的 Node 工具链痛点、1.3 时代的全栈能力,以及收购和重写背后的趋势判断。
2026 年端侧 AI 被反复称为元年:AI 手机出货 1.47 亿台、端侧模型装机 4200 万台、量产车里跑起座舱智能体。本文从模型、芯片、场景三个条件讲清为什么是今年,再用 roofline 模型和量化三件套解释真正的瓶颈为什么是内存带宽。