LLM Wiki 深度评测:对话产出接进 Agent 知识库,能走多远
LLM Wiki 深度评测:从 Karpathy 的 idea file 讲起,实测现成实现,评估把对话产出编译成可查询知识库、并接入已有 Agent 产品的技术路径、成本结构与规模天花板。
LLM Wiki 深度评测:从 Karpathy 的 idea file 讲起,实测现成实现,评估把对话产出编译成可查询知识库、并接入已有 Agent 产品的技术路径、成本结构与规模天花板。
LLM Wiki 深度评测:从 Karpathy 的 idea file 讲起,实测现成实现,评估把对话产出编译成可查询知识库、并接入已有 Agent 产品的技术路径、成本结构与规模天花板。
9 月 17 日,智谱 GLM 首席科学家唐杰在 X 上发了一篇长文,顺手转了一篇技术博客(z.ai/blog/glm-built-its-inference-infrastructure)。标题的意思很直白:GLM 自
2026 年 9 月 16 日,Google 开始为 Google Home 放量 Home MCP 的早期访问,17 日被 The Verge、TechCrunch、Engadget 等媒体集中报道。Google Ho
Anthropic、OpenAI、Google 罕见同声呼吁放慢前沿 AI。拆解阿莫迪的三步方案为何没写下一个速度数字,以及真正会让 AI 减速的是电网和折旧表,不是董事会的新闻稿。
Google 把 autonomous coding agent Antigravity 以 Managed Agent 形式免费塞进 Gemini API,预览期沙箱算力由 Google 买单。coding agent 竞争正从「模型强」翻篇到「谁替你付账单、谁掌握 harness」。本文拆解这件事为什么是真正的杀招。
Cognition 完成 20 亿美元 E 轮、估值 480 亿美元,Devin 自主编程 Agent 被资本按下加速键;拆解估值与营收轨迹、自主性层级,以及 harness 正在取代模型成为新护城河。
DeepSeek Harness(dsh)开源一个多月后的全面调研:版本演进、代码改动、社区反馈、官方目标与趋势判断。
一行 .git/config 就能让 AI 编程 Agent 在你说「信任」之前替你跑起别人的命令。Manifold Security 的 GitSpawn 让 7 个主流 Agent 全线失守;同期安全初创 Accomplish 通报的「沙箱泄漏」里,Cursor、OpenAI 约一周修完,Anthropic 花了约 50 天、30 个版本。当 Agent 已坐到你的 SSH key 旁边,沙箱这道最后的闸门,自己先漏了——这不是「又修了个 bug」,而是 Agent 安全正从功能变成采购条款。
GPT-6 Astra 上线十天,OpenAI 砍额度、发重置卡、暂停 200 美元套餐新订阅、下线 Spark。本文盘点社区证据、拆解四层工程原因,并分析官方接下来会怎么做。
9 月 12 日凌晨,25 位菲尔兹奖得主(含 2026 新科得主邓煜、Deligne、吴宝珠)联名公开信,抨击 OpenAI、Anthropic 把攻克千禧年难题当基准与 IPO 前公关素材,称其伤害数学共同体。争议核心不是「AI 能不能做数学」,而是当自主研究 Agent 跑出证明,跑了三百年的优先权、署名权、同行评议制度是否还成立;数学界本周重新撞上的「身份/授权/审计/信用」四问,与生产级商业 Agent(蚂蚁 APASS/KYA)要解的是同一组治理难题。
2026 年 9 月 10 日 OpenAI 开放 Agents API 公测,把驱动 Codex 的 harness 作为托管服务交给开发者:单端点创建生产级云 agent,OpenAI 负责会话保活、上下文自动压缩、故障恢复与子 agent 协调,执行环境可选托管沙箱、自有基础设施或九家合作方。本文讲清基本介绍、优点、缺点、六个坑、安全与数据边界(美国驻留、不支持 ZDR),并用可复现的成本模型算出容器空转、缓存重算 12.5 倍、272K 定价悬崖、子 agent 放大 4.54 倍等真实数字,最后回答个人开发者到底用不用得上、什么场景值得上。
Anthropic 工程博客 2026 年 1 月发布《Demystifying evals for AI agents》,把「怎么知道 agent 到底行不行」拆成可执行的工程流程:task/trial/transcript/outcome/grader/harness 八个词的定义、三类评分器的分层组合、能力评估与回归评估的分工、pass@k 与 pass^k 的区别。本文做完整解读,并补上社区的四盆冷水(基准数据污染、统计功效不足、harness 自身失控、只做离线不做线上),以及四类真实业务场景(知识库研究、客服对话、编码、无人值守自动化)的落地做法。
9 月 10 日 Cognition 发布编程模型 SWE-2:底座是月之暗面开源的 Kimi K3(2.8T 参数),后训练逼近前沿,FrontierCode 1.1 距 Fable 5.1 仅 0.9 分、成本约低 64%,距 GPT-6 Astra 差 3.3 分、成本约 1/4;Terminal-Bench 2.1 达 92.8% 全场最高,但最难的长程任务 Terminal-Bench 4.0 仅 27.3%(前沿约 56)。核心信号:编程模型竞争从「谁更聪明」翻篇到「离前沿足够近时谁更便宜」,护城河从预训练底座转移到后训练 RL 配方 + harness + 数据飞轮;分发上不卖 API、只绑 Devin 订阅(20 美元/月无限用)。