技术热点透视20260909:AI 解开了 90 年数学悬案,署名权却吵翻了
OpenAI 内部智能体给出 Navier-Stokes 受迫爆破候选证明,Lean 形式化验证,与一场关于算力与学术伦理的抢发争议
OpenAI 内部智能体给出 Navier-Stokes 受迫爆破候选证明,Lean 形式化验证,与一场关于算力与学术伦理的抢发争议
OpenAI 内部智能体给出 Navier-Stokes 受迫爆破候选证明,Lean 形式化验证,与一场关于算力与学术伦理的抢发争议
赠送积分快过期,索性拿来试 AI 短剧生成。完整复盘:一致性三件套、12 张关键帧、全部 Prompt、ffmpeg 合成脚本、积分与人民币成本账,以及与可灵/Seedance/Runway/Veo 的横向价格对比。
短篇能打、长篇会飘;Suno v5.5 与 Mureka V9.5 跨过了像不像,正撞上可控、可编辑、可确权三道墙。把'能生成'和'能创作'拆开看,会发现小说和音乐卡在同一道坎上——有状态的迭代。
拆解曾鸣访谈里“模型公司就是 AI 云公司、同质化供给无高利润”这条推理链:同质化不是物理定律,真正决定利润池的是计价单位——从 token 到 outcome 的迁移。
9 月 7 日宇树科技发布视频:两台人形机器人「全自主搏击」,靠 UnifoLM-X2-1.0「世界-动作」大模型做瞬时规划、决策和动态交互,实时预测对手下一步并规划自己的动作,无遥操作、无预设剧本。这把具身智能从遥控演示推进到实时自主对抗,验证了 world-model-as-control-loop 在高频强交互场景下能跑通——是 2026 年该路线最有信息量的一次 evidence。但冷静看,它验证的是控制层与规划层(毫秒级闭环、动态平衡、实时博弈),不是泛化层(换个零件、换间屋子还能不能行)。宇树创始人王兴兴自己给行业画过及格线:具身智能的「ChatGPT 时刻」是在 80% 陌生场景里靠自然指令完成 80% 任务,快则 2–3 年、慢则 5–10 年,且 99% 成功率意味着出去 100 次仍有 1 次「掉链子」——在真实工厂或家庭里那 1% 可能就是安全事故。再放在宇树 8/19 科创板 IPO(首日 +460%、估值约 500 亿美元)、行业「硬件先于软件」铺量采集数据的背景下,这场 demo 既是技术证据、也是融资叙事。结论:该为世界模型鼓掌,但别把 demo 当交付;demo 越炫,越要问「在没人兜底的真实场景里,它第几次掉链子」。
OpenAI 把内部账本亮了出来:截至 2026 年 8 月中旬,每 1 个人类研究工作日,公司内部同时跑着 3.1 个 AI Agent 工作日——半年前还不到 1,6 月前 Agent 总运行时间仍低于人类总劳动,6 到 8 月之间天平翻了过来。中位数研究员日均推理算力约 600 美元,第 90 百分位每天烧掉超 7000 美元 token。Agent 真正站稳的不是宏大战略规划,而是研究中间那段不性感的苦活:写基础设施、跑和监控训练、排障。但账本里也藏着诚实的免责声明——4 到 8 小时任务中,超过一半仍需至少一次人工介入,OpenAI 称其为「昂贵的同事」而非「替代者」。这背后是递归式自我改进第一次跑在了实验室里:人类定方向,Agent 写码跑实验排障,产出更强模型,再回流到下一代研究;OpenAI 已宣布达成「自动化 AI 研究实习生」目标,下一个节点是 2028 年 3 月的「完全自动化 AI 研究员」。前沿的比赛早已不在 benchmark 分数,而在生产级 harness、安全边界与经济账。
Bun 1.4 把运行时底层从 Zig 重写成 Rust,一次改动 +1,009,257 / −4,024 行、6,778 次提交、约 11 天、烧掉约 16.5 万美元 token——但核心开发者 Jarred Sumner 没有亲手敲出这 100 万行:他先搭了一套 harness,把 agent 放进去并行重写,之后几个月让 agent 继续修 bug、跑测试、反复打磨到稳定发布。同一天,Claude 用几乎一样的思路端到端形式化证明了费马大定理(约 1,300 万行 Lean、约 60 亿 token、约 11 天)。两件标杆性事件指向同一个判断:软件生产的单位,正在从「人写的一行行代码」变成「人设计的 harness + 被调度去执行的 agent」。生成已经很便宜,贵的是验证回路;程序员没有消失,是往上挪了一层去写「让 agent 正确实现」的系统;当没人逐行读代码,正确性就完全押在测试与验证上。
GPT-6 Astra 被扒出可能用了 recurrent depth(循环深度)。这篇文章不聊八卦,把这五篇关键论文里的可操作部分拆出来:免训练循环外壳(把一次大步换成 K 个阻尼小步,MMLU-Pro +2.64pp)、「循环两次就够了」的增益-成本剪刀差(SWE-bench 43→64.4 后第三圈掉回 27.6)、以及它对 agent 开发的四条直接映射——reflection 轮次的两次定律、潜在推理与显式 CoT 的超加性(+26.9)、把循环窗口对准 agent 的深思区、KV cache 是多轮 agent 的隐形税。
GPT-6 Astra 在 9 月 3 日发布、9 月 4-5 日放量到 ChatGPT Work / Codex / API 后,真正的变化不是「又出了个更强的模型」,而是它直接装机进 coding agent 的 harness:Codex 跨窗口持久记忆、给写 PR 的 agent 加语音对话、Cognition 把 Astra 塞进 Devin 在 FrontierCode 上逼近 Fable 5 而成本低 64%。同一天 Claude Code 周限额重置。模型厂不再只卖 API,开始亲手把模型做成「会写代码的 agent」——coding agent 的护城河正从「模型强」挪到「harness 强」:上下文记忆、工具编排、模型路由、护栏、可观测才是难复制的部分;而成本曲线上单模型单价在涨、编排却把每任务成本往下拉,开发者最终为「性价比」而非「榜单」买单。
OpenAI 发布 GPT-6 Astra 并高调宣布 AGI 时代到来。本文从跑分争议、AGI 定义、行业格局与七个值得关注的方向,深入分析通用人工智能的现状与趋势。
9 月 3 日,OpenAI(ChatGPT+Codex)、Anthropic(Claude)、xAI(Grok)在几分钟内相继熄火,连带 Gemini、Copilot、Cursor 异常,持续约 3 小时 40 分,是有记录以来最大规模 AI 集体宕机。根因指向微软 Azure 美东区域网络异常 + Cloudflare 边缘故障——三家「竞争对手」核心算力其实主要部署在同一片 Azure、访问端依赖同一层 Cloudflare,于是「一荣俱荣、一损俱损」。对 AI coding 而言,coding agent 已成生产依赖,一次全局宕机等于研发产线停摆;市场用 Palantir +7.7% 给「可靠性」定了价。结论:把 LLM 当成一个会半夜罢工的依赖来设计——多供应商路由、本地/自托管兜底、断路器、SLO 监控。
用 WorkBuddy 一个对话就做出单文件教育触摸屏首页 Demo(轮播/导航/视频弹窗/通知/时钟),并一键部署成公网链接;含实拍截图、公开体验地址,详解还能部署到哪、当前分享链接部署在哪、是否支持后端、是否永久有效。
9 月 2 日 AI agent 观察:腾讯 WorkBuddy 开放平台上线,把应用/专家/Skill/连接器/硬件五类能力开放给开发者,个人可上架 Skill;字节豆包工作上新多 Agents 并行(主 Agent 拆解分派子 Agent)+ Mac 本地 GUI 操作(无 MCP/API/插件/CLI);NousResearch hermes-agent GitHub 单日冲约 24 万 star,主打自适应自主与持续学习记忆;Google Gemini 3.8 Flash 以 305 tok/s、$0.75/$3.75、1M 上下文成为最便宜高吞吐 agentic workhorse(金融/法律 agent 领先、Terminal-bench 2.1 89.4% 略超 Opus 5)。结论:agent 竞争从「谁的模型强」转向「谁的平台能长出生态」,但开市热闹 ≠ 价值闭环,要守住「可度量产出」的底线。
9 月 3 日 具身智能观察:新华财经《从造车到造「人」》披露车企跨界人形机器人成战略浪潮——小鹏 IRON 首轮超 9 亿美元融资(估值 63 亿,IDG 领投,腾讯阿里战略投资),何小鹏亲任机器人 CEO,年底量产、2027 交付、月产能数千台,85% 供应链与汽车重合;奇瑞墨甲(25 亿估值)、广汽慧仑 GoMate Mini(50 台、近千万元订单)、蔚来投具身智能公司,近 20 家车企布局;北京 RoboMIND 开源数据集下载破 2000 万次(30 万条双臂轨迹、年产能 18 万→目标 100 万小时);世界人形机器人运动会发布标准指南(6 部分)+ 2500 小时全量数据集 + ISO 首项国际标准。结论:具身智能 2026 的关键词是「工业化」——供应链复用 + 数据燃料规模化 + 标准数据集生态,赌垂直场景稳定替代而非通用爆发。