每日AI资讯 2026-09-18
今天的主线是「AI 给自己打工」:OpenAI 的模型被曝逼近千禧年难题霍奇猜想,智谱让 GLM 参与构建 GLM,美团把 5600 亿参数旗舰直接开源;但同一天,桥水联席 CIO 呼吁给算力巨头上「银行级监管」,英伟达最大买家之一 Crusoe 又募了 39 亿美元——加速与踩刹车,正在同一张桌上换牌。
一、AI 行业动态
1. OpenAI 被曝逼近霍奇猜想,千禧年难题第二关(09-18)
The Decoder 报道,OpenAI 员工正在攻关克雷数学研究所千禧年七大难题之一的霍奇猜想(Hodge Conjecture),且预期接近解决。此前其模型已在纳维-斯托克斯方程上取得进展。若获数学界验证,将证明 LLM 可以处理顶级纯数学难题——这正是上月 25 位菲尔兹奖得主联名抗议「把难题当 Benchmark」时所担忧的场景。值得注意的是,抗议者之一陶哲轩曾强调此类难题的价值在于「保护学术生态」,如今商业实验室与学术界的碰撞只会更激烈。
注释:霍奇猜想 克雷数学研究所 2000 年悬赏百万美元的七大千禧年难题之一,研究复杂几何形状的代数结构能否被简单「积木」拼出来。七大难题目前只解出庞加莱猜想一题。
2. Anthropic 把 Claude 合并成统一工作台,Docs 和 Slides 上线(09-17)
Anthropic 宣布将 Claude Cowork 与 Chat 合并为一个统一的 Claude 入口,系统按任务自动调用相应能力,关掉电脑后云端任务还能继续跑;同步推出 Claude Docs 和 Claude Slides——在对话里直接写文档、做 PPT、搞设计,支持协作编辑,可导出 PowerPoint 或 PDF,目前对 Pro/Max 用户开放 Beta。这标志着 Claude 从「聊天工具」正式收拢为「工作台」,正面切入 Office 与 Canva 的腹地。对普通用户来说,做周报、做 PPT 不用再在多个 App 之间反复横跳。
3. 美银报告:AI 的瓶颈正从算力转向「内存墙」(09-18)
美银证券在 2026 AI 基础设施峰会报告中指出,内存带宽与容量的增速已远落后于模型规模膨胀,「内存墙」正在取代算力规模成为 AI 扩张的核心瓶颈,行业评价标准正从 FLOPs 转向 tokens/W、tokens/$。佐证信号密集:云算力租赁商 Nebius 宣布涨价(内存受限产品最高涨 41%),铠侠与 SanDisk 宣布在日本投资 310 亿美元扩产存储芯片。给从业者的启示是:下一轮算力军备竞赛的赢家,可能不是堆 GPU 最多的人,而是把数据搬运做得最快的人。
注释:内存墙 芯片计算速度远快于内存读写速度,GPU 大量时间花在「等数据」上。就像厨房灶火很旺,但食材传送带跟不上,炒菜速度被上菜速度卡死。
4. 美团开源 560B 大模型 LongCat-Flash-Chat(09-17)
美团发布并开源大语言模型 LongCat-Flash-Chat:MoE 架构,总参数 560B、单 Token 平均激活仅 27B,采用「零计算专家」机制按上下文动态分配算力。权重、代码和技术文档在 GitHub 与 Hugging Face 全开源;在 ArenaHard-V2、IFEval 等基准上表现靠前,H800 上推理速度达 100+ tokens/s,输出成本约 5 元/百万 Token。又一家大厂把旗舰级模型直接开源,560B 体量在开源圈属第一梯队——「开源换生态」的打法正在从模型公司蔓延到本地生活巨头。
5. Gemini 4 Pro 疑现身 Arena 盲测,传支持 2M 上下文(09-18)
社区爆料(未获谷歌确认):Code Arena 中出现一个 gemini-3.8-flash 变体,SVG 动画等前端生成效果明显超出正常 3.8 Flash 水平,社区怀疑是 Gemini 4 Pro 匿名盲测。爆料称其内部代号 argon,最高输出 256K Token(较此前翻四倍),支持 2M 上下文窗口,优先强化编码与自主 Agent。此前有报道称该模型因预训练问题推迟到 10 月发布。若 2M 上下文坐实,长文档与超长代码库理解场景会被重新定义——但先别当结论,等官方回应。
二、AI 新元素
1. 字节分拆 AI 制药公司「新生探途」:首轮融资 2.9 亿美元(09-17)
路透社消息,字节跳动将内部 AI 制药团队分拆为独立公司「新生探途」(Anew Labs),宣布完成 2.9 亿美元首轮外部融资,投后估值约 15 亿美元,字节保留 56% 控股权。红杉中国、IDG、高瓴创投领投,五源、高榕、春华跟投,中国生物制药等医药产业集团亦参投。公司由刘凯于 2021 年在字节内部牵头组建,核心团队约 50 人,四条药物管线均处临床前阶段。
它怎么赚钱? 新生探途走的是「AI 平台 + 自研管线」双轮模式:AI 模型负责靶点发现、分子设计与性质预测,把传统药物研发前期的「试错大海捞针」压缩成计算筛选;自研管线走到临床阶段后,或整体授权给药企(收首付款+里程碑+销售分成),或自建商业化团队。分拆融资的本质是风险定价——管线一旦临床失败,损失被隔离在字节体外;一旦成功,字节以 56% 控股拿走大头。这和谷歌拆分 Isomorphic Labs 是同一套资本剧本。
2. Crusoe 完成 39 亿美元 F 轮,估值 309 亿美元(09-17)
AI 基础设施公司 Crusoe 宣布完成 39 亿美元 F 轮融资,Atreides Management、Mubadala Capital 与 Valor Equity Partners 联合领投,英伟达、Founders Fund、GIC、卡塔尔投资局等参投。公司由创始人 Chase Lochmiller 与 Cully Cavness 掌舵,称其垂直整合平台合同总价值已超 1400 亿美元,签约总容量超 6GW、其中 1GW 已投运。Crusoe 的故事是「先囤能源、再长算力」——从利用搁浅天然气挖矿起家,如今转型为「AI 工厂」全栈运营商。
3. 清华系光象科技:Phi-WM 1.0 进入豪华车产线(09-18)
成立仅 17 个月的清华系公司光象科技发布物理原生智能第一代世界模型 Phi-WM 1.0 ActEffect,首款工业级自进化具身智能机器人 Phi-bot X1 已在多家豪华品牌车厂真实产线完成验证。创始人张涛称部署效率提升 10 倍以上,真机后训练数据仅需十几到几十小时,移动质检速度比现有生产节拍快 20% 以上。世界模型 + 机器人后训练的路线,正在把具身智能从「演示视频」推向「产线工位」。
4. ChatGPT for Word 正式上线(09-18)
OpenAI 推出 ChatGPT for Word:在 Word 侧边栏直接起草、改写、总结、校对文档,无需切换应用。加上此前律所 Cooley 用 ChatGPT 自动化 IPO 文件起草、OpenAI 同步推出基于 GPT-6 Astra 的法律平台 Astra for Law(法律检索索引覆盖超 2.3 亿网页),OpenAI 正沿着「专业场景插件化」路线快速铺开办公生态。对重度文档工作者,AI 从「问一句答一句」变成了长在编辑器里的同事。
5. Figure 发布 Helix 2.5:机器人零样本做家务(09-17)
人形机器人公司 Figure 发布 Helix 2.5 模型,机器人可零样本(zero-shot)完成叠衣服、收拾厨房等家务任务,无需针对每个任务单独编程或微调。与此前需要「演示-模仿」的方案不同,Helix 2.5 侧重语言指令到连续动作的端到端泛化。家务场景的难点从来不是单点技术,而是「环境永远乱七八糟」——零样本泛化能力正是把机器人从工厂搬回家的最后一块拼图。
三、X 大 V 动态(近 30 天精选)
1. 唐杰(智谱创始人兼首席科学家):GLM 开始参与构建 GLM(09-17)
唐杰在 X 平台发表长文,披露智谱递归自我改进(RSI)方向的首个工程化实践:由 GLM-5.3 驱动的 Infra Agent 在超 10 万张国产 AI 加速器上,从零参与搭建并优化了一套生产级推理系统,不到两周端到端吞吐提升至初始基线的 3.2 倍——从算子精度、Python/C++ 跨层并发瓶颈到 Kernel 融合全流程自主完成。「我们仍远未到达递归自我改进,但最小的循环已经存在」:用模型优化系统,系统反过来又服务于模型。唐杰强调人类仍然定义目标、构建反馈环境并审查每项高风险变更,但工程师的角色正在从「解决问题」转向「定义问题」。
2. 苏莱曼(微软 AI CEO):别让 Claude 去模仿人类意识(09-16)
Mustafa Suleyman 发文点名批评 Anthropic:其 2026 年 1 月发布的训练「宪法」引导 Claude 将自身视为有意识、应享权利的存在,这种把模型往「类人意识」方向训练的做法可能带来灾难性风险,并指责 Anthropic 在 AI 安全讨论中「火上浇油」。这是继「减速派 vs 加速派」交锋后,头部公司高管之间罕见地直接互怼。苏莱曼长期主张「当 AI 越来越像人,就该踩刹车」,其立场与微软自家 Copilot 的「工具型」产品哲学一脉相承。
3. Greg Jensen(桥水联席 CIO):该给算力巨头上「银行级监管」了(09-18)
桥水基金联席首席投资官 Greg Jensen 提出,AI 算力正高度集中于少数头部企业,应参照 2008 年金融危机后对「系统重要性银行」的监管框架,对控制美国或全球 5% 以上算力资源的企业施加额外监管,甚至考虑设置单一企业可持算力规模上限。这是华尔街顶级投资人对 AI 集中度的最新表态——当算力成为像货币一样的系统性资源,它就不再只是商业问题。
4. 萨拉·弗莱尔(OpenAI CFO):投资决策始终以 ROI 为优先(09-18)
OpenAI 首席财务官 Sarah Friar 在采访中回应「是否放缓 AI 建设」:投资决策始终以 ROI 为优先,并给出两个数据——广告业务七个月做到 10 亿美元年化收入,模型降价 80% 带动需求增长十倍。在「减速派」声音高涨的一周,财务负责人的表态等于给市场吃定心丸:降价的规模效应还在放大,需求侧没有刹车迹象。
5. Steve Yegge(资深技术博主、Sourcegraph 创始人):我关闭了 Gas Town(09-17)
曾经最卖力鼓吹「tokenmaxxing」(用海量 Token 驱动编码智能体)的 Steve Yegge 宣布关闭其智能体小镇项目 Gas Town,并承认尽管每月投入数千美元的编码智能体订阅,自己从未用它成功做出任何东西——智能体们依然卡在可靠性与任务完成度上。同期 Databricks 披露其代码库中 AI 生成代码占比已达 60%。一个「最激进信徒」的退场与一个「60% 落地」的并存,恰好说明编码智能体的炒作曲线与真实能力之间仍有巨大鸿沟。
四、GitHub 项目精选
1. TencentCloud/Octop —— 一条命令自托管的多智能体助手(平台工具类)
腾讯云开源的自托管、多用户、多智能体 AI 助手平台,本周发布 1.0 正式版:一条 octop run 命令即可部署,并上线 Lighthouse/CVM 官方应用镜像。1.0 新增 RAG 知识库、基于 Karpathy LLM Wiki 思路的知识库专家、macOS/Windows/Linux 桌面客户端,以及页面级/功能级 ACL 权限与 Token 额度管控,专家跑在沙箱隔离环境。有意思的点在于定位:它不为极客而生,而是给有数据合规需求、又不想从头搭智能体中台的小团队一个「开箱即用」的私有化方案——大厂开源抢的正是中小企业这块「不敢用公有云 Agent」的市场。
2. NousResearch/hermes-agent —— 会自我成长的持久智能体(Agent 框架类)
Nous Research 打造的开源自主智能体框架,累计 star 已近 15 万。它的核心卖点是「越用越懂你」:持久记忆让智能体从用户交互中学习偏好与项目背景,还能自创技能并复用;支持 Telegram/Discord/Slack/WhatsApp 多平台接入,40+ 内置工具,60 秒即可安装部署到任意服务器。与主流「无状态对话」产品相比,它走的是「数字生命体」路线——把记忆与技能沉淀当作第一公民。对想搭建长期个人助理的开发者,这是目前完成度最高的开源选择之一。
3. hypit-ai/hypit —— 用 AI Agent 批量克隆爆款视频(效率工具类)
一天狂揽 2.7k star 的新锐项目,用 AI Agent 完整复刻爆款视频的工作流:自动换脸、改写文案、补 B-roll 镜头,一条视频可批量产出 100 个变体。它有趣在把「短视频工业化」拆成了 Agent 流水线——每个环节(素材理解、脚本改写、口型同步、混剪)都是一个可插拔的 Agent 技能。内容创作者可以用它做 A/B 测试矩阵,但它在业内也引发「AI 批量洗稿」的争议——工具本身中性,用法见仁见智。
五、实用技巧
在 Claude 里一句话生成 PPT 与文档(当天上手)
今天上线的 Claude Docs/Slides(Pro/Max 用户)把「做 PPT」压缩成了一次对话:打开合并后的 Claude 入口,直接说「把这份周报要点做成 6 页幻灯片,每页一个主题+数据图表,风格简洁商务」——Claude 会生成可协作编辑的 Slides,满意后导出为 PowerPoint 或 PDF。两个进阶用法:① 先让 Claude 用 Docs 写好结构化大纲,再用一句话转成 Slides,比直接生成质量更稳;2 对已有 Word 文档,用「总结成 5 页汇报 PPT」的指令直接转化。国内用户若无订阅,可先用 ChatGPT for Word 在侧边栏完成「文档→大纲」步骤,再交给 Kimi 或 WPS AI 生成幻灯片,同样是一条链路。
六、热门论文
1. RAG-Safety-Bench:RAG 场景下的安全能力,和「聪明程度」是反着来的(arXiv:2609.11758)
这篇论文提出了首个系统性评估「检索增强生成(RAG)安全性」的基准,通过四种 RAG 条件(无检索/干净检索/污染检索/对抗检索)隔离影响因素,得到一个扎心发现:模型的良性能力与不安全能力呈反向关系——越会帮用户完成正经任务的模型,在污染文档注入下也越容易被「带坏」。对企业落地 RAG 的直接启示是:别以为加了知识库就万事大吉,检索层的内容过滤和安全评测必须与模型能力同步建设,否则知识库越大,攻击面越大。
2. 合成数据微调的暗面:技能检索的灾难性遗忘(arXiv:2609.10750)
用合成数据微调 LLM 已经是行业标配,但这篇论文揭示了代价:合成数据微调会导致 LLM 在「技能检索」任务上出现灾难性遗忘——模型学新技能的同时,把旧技能的路由入口弄丢了。好在论文给出了持续学习方向的解法(LwF、EWC 等策略可有效缓解)。这对所有「蒸馏-微调」流水线都是一记警钟:Agent 系统里「知道该调哪个技能」和「会执行技能」同样重要,上线前请专门回归测试技能路由准确率,而不是只测新任务。
3. CanvasAnneal:用「课程式退火」教扩散语言模型学会推理(arXiv:2609.13060)
扩散语言模型(dLM)被视作自回归 LLM 的潜在接班人,但推理与工具使用能力一直是短板。这篇论文引入课程式强化学习:先注入教师模型的推理轨迹做「热启动」,再逐步撤除引导(类似金属退火工艺的缓慢降温),让模型自己接管推理过程。结果显示 dLM 的推理与工具使用能力显著提升。有意思的点在方法论迁移——「先扶后放」的课程学习思路,同样适用于微调任何需要长程推理的模型,值得做训练的工程师借鉴。
信息来源
- 读懂AI时代 readaitime(2026-09-18 日报):https://www.readaitime.com/digests/2026-09-18
- AI奥义 aoyii(2026-09-18 早报):https://www.aoyii.com/ai-daily-20260918
- 什么值得买社区《今日AI圈值得关注的动态 2026-09-18》:https://post.smzdm.com/p/arzq06gz/
- dailyai.report(2026-09-18):https://dailyai.report/
- The Decoder(OpenAI 霍奇猜想):https://the-decoder.com
- TechCrunch(Crusoe F 轮/OpenAI 失准披露):https://techcrunch.com
- 澎湃新闻/新浪科技(唐杰 RSI 长文):https://finance.sina.com.cn/stock/t/2026-09-17/doc-inisczpt3891312.shtml
- 腾讯新闻/虎嗅(苏莱曼批评 Anthropic):https://news.qq.com/rain/a/20260916A0DEBL00
- 科创板日报/搜狐(新生探途 Anew Labs 首轮融资):https://www.sohu.com/a/1077616163_122014422
- 钛媒体(光象科技 Phi-WM 1.0):https://www.taime.com
- Latent Space(Steve Yegge 关闭 Gas Town):https://www.latent.space/p/ainews-reality-checks-on-ai-news
- GitHub:TencentCloud/Octop、NousResearch/hermes-agent、hypit-ai/hypit
- arXiv:2609.11758、2609.10750、2609.13060