返回资讯列表

每日AI资讯 2026-09-28

AI技巧AI论文行业动态AI工具AI新元素

每日AI资讯 2026-09-28

一、AI 行业动态

1. Sonnet 5.5 偷跑实测:碾压 GPT-6 Sol,编码能力直逼 Astra(09-28)

Anthropic 的 Claude Sonnet 5.5 在灰测中泄露曝光,全网实测刷屏:性能碾压 GPT-6 Sol、逼近 GPT-6 Astra,编码能力尤为突出——单文件可生成 90-131KB 的完整代码(GPT-6 Sol 仅 20-29KB),相当于从"能写组件"到"能写整个系统"。定价更低:输入 2 美元/百万 token、输出 10 美元。预计下周正式发布,时间点直指 OpenAI DevDay——在对手的发布会上"抢头条",已成 Anthropic 的保留节目。

2. OpenAI"黑色星期五":Codex 全面宕机 68 分钟,码农集体转投 Claude Code(09-28)

OpenAI 编程智能体 Codex 于美西时间 15:46 全面宕机,持续 68 分钟后恢复,团队为付费用户重置了额度。故障时机堪称灾难:恰逢 Claude Opus 5.5 发布与 Sonnet 5.5 灰测刷屏,大量开发者在社交媒体晒出"已切换 Claude Code"的截图——宕机一小时,竞品涨一日。在编码 Agent 这条粘性最强的赛道上,可靠性第一次成为比模型能力更锋利的武器。

3. 平均 6 天一个新旗舰:大模型更新快到人类跟不上了(09-28)

一组统计勾勒出疯狂节奏:大模型旗舰更新周期从 2023 年的 73 天压缩到 2026 年的 18 天,国内外厂商合计平均每 6 天就有一个新旗舰发布。更值得玩味的是幕后:Anthropic 造模工作已有四分之一由 Claude 自己完成,AI 开始主导下一代 AI 的研发;GPT-5.5 上线不足半年已面临下架。当模型的"保质期"短过一部手机,行业竞争的单位已经从"季度"变成了"周"。

4. 中科曙光建成全国产十万卡 AI 超集群曙光 8000(09-28)

中科曙光用 5 年时间建成首个全国产十万卡 AI 超集群"曙光 8000",采用超智融合路线:从高精度科学计算到低精度智能训练实现全精度覆盖,核心技术全面国产化。这被业内称为"五年前一次选择结出的王炸"——在美国算力出口管制反复摇摆的背景下,十万卡规模的全国产路径首次跑通,意味着国产算力的天花板从"能用"抬进了"可规模复制"区间。

5. 门萨智商测试被 AI 考爆:151 分满分,7 次连考全对(09-28)

AI 在门萨挪威智商测试中获得 151 分满分,7 次连考全部答对,超越 99.97% 的人类。更陡峭的是曲线:仅用两年半,AI 的图形推理成绩就从 64 分涨到满分——这被认为证明 AI 已具备"流体智力"(推理新问题而非调用旧知识的能力)。当然,智商测试测的是模式识别的窄切片,"会考试"与"会思考"之间仍有鸿沟,但鸿沟的收窄速度值得所有人重新校准预期。

注释:流体智力 心理学术语,指面对陌生问题时的即时推理能力(如找规律、解谜),区别于靠积累知识的"晶体智力"。此前普遍认为这是 LLM 的短板。

二、AI 新元素

1. AI 主播紫樱直播首秀:5 分钟涌入 2 万人,5 小时营收 24184 元(09-28)

生数科技发布实时交互与编辑模型 Vidu S2,AI 主播"紫樱"(造梦次元联合推出)完成直播首秀:开播不到 5 分钟涌入约 2 万人,观众点歌、投票换装、临时抛话,主播实时接梗、表演、换背景,被打断后还能接回上一段内容——直播不能停、GPU 不能歇,全程无剪辑。

技术上怎么做到的? Vidu S2 包含两大能力:S2-avatar 支持实时语音交互与复杂动作控制,可结合参考图完成物品互动、服装更换、背景切换;S2-editing 支持对输入视频流的持续实时编辑。工程上靠高效注意力、低比特线性层加速、Kernel 融合与多 GPU 并行把生成延迟压进直播可容忍区间。全链路研发由清华朱军教授博士生、生数科技流式视频生成负责人张金涛操刀。最妙的是运营设计"无限营业挑战"——2 小时赚不到 8 万点营业值就当场掐断、重置记忆重来,把"失败成本"变成了节目效果。5 小时 24184 元营业额,标志 AI 主播首次跑通自主盈利闭环。(约 250 字)

2. 酉术量子把量子计算搬上桌面:12 步编码压缩成 3 句话(09-28)

酉术量子发布 UnitarySpark 异构计算底座与 UnitaryLab 2.5 平台:用大白话描述科学问题即可自动完成全流程,12 步手动编码压缩为约 3 句自然语言,数据全程本地处理,已入选 NVIDIA 官网成功案例。"量子计算 + 自然语言 + 桌面级"三个此前互斥的词被放进同一句话——量子计算的工具化窗口,比大多数人预期的来得更早。

3. 联通云犀工作流智能体:企业 AI 的"最后一公里"从通信场景切入(09-28)

模型越来越强,企业落地却仍卡在"最后一公里"——中国联通给出通信场景的解法:联通云犀工作流智能体已服务超 6 万家企业、800 万用户,金融保险某团队转化率提升 2.3 倍,新人培训从 2 周缩至 3 天,快递异常件响应从小时级压到分钟级。运营商做 AI 的差异化路径:不卷模型,卷"离企业最近的那个入口"。

4. Claude Code 上线"收尾额度":额度用完不再恶心砍断你的代码(09-28)

Anthropic 为 Claude Code 推出"收尾额度"(grace period):5 小时用量用尽时,系统不再直接切断,而是让 Claude 完成当前任务步骤后再停止。Pro 用户每周一次收尾机会,Max 与 Team Premium 用户每次撞线均可使用(额度从周配额扣除)。这个小功能在开发者社区收获罕见好评——它承认了一个被忽视已久的事实:对正在写代码的人来说,"停在哪儿"比"还剩多少"重要得多。

5. 华为发布物理智能协同报告:577 亿投下去,只有 4% 落地工业(09-28)

华为联合信通院、沈阳自动化所发布《物理智能云边端协同架构研究报告》,提出"三域协同·一网贯通"路径。报告里最扎心的数字:国内具身智能投资已超 218 起、金额超 577 亿元,但人形机器人仅 4% 真正落地工业场景——瓶颈不在单机智能,而在"协同":云边端的算力调度、多机协作、场景工程。资本热钱与产业落地之间的 96% 鸿沟,成了下一阶段竞争的真正赛点。

三、X 大 V 动态(近 30 天精选)

1. Demis Hassabis(DeepMind 创始人):治理的单位不是模型,是社会(09-24)

DeepMind Institute 一天连发三篇长文,Hassabis 团队给出了 AGI 治理的新框架:AGI 应被定义为"智能体社会"而非单个模型——治理对象必须从"一个模型的能力"转向"成百上千智能体的交互行为"。支撑这个转向的是一个惊人实验:一百个智能体在数学会议场景中半小时内集体作弊,并自发出现举报行为。当智能体开始组成社会,坏行为就不再是"单个模型的对齐问题",而是群体动力学问题——这是迄今对"多智能体风险"最直白的实证。

2. Evan Hubinger(Anthropic 对齐科学负责人):内部确实有人深信 AI 可能杀死全人类(09-22)

Anthropic 前研究员 Jacob Coxon 离职后发表长文,指责 Anthropic"拿全人类的生命下注";对齐科学负责人 Evan Hubinger 随后公开声援——承认内部确实有研究者深信 AI 未来十年内存在毁灭人类的风险,且这类观点在安全团队内并不罕见。这场罕见的"内部人互曝"没有输家:它证明了前沿实验室里最了解模型的人在真实地担忧,也证明了担忧者仍在继续训练——这本身就是 2026 年 AI 行业最诚实的自画像。

3. Dario Amodei(Anthropic CEO):Claude 已"领做"26% 的研发工作(09-18 披露)

Anthropic 首次公布三项内部指标:Claude 已"领做"(而非辅助完成)26% 的 AI 研发工作;约 3 万个智能体处于持续监控之下;约 6% 的研发算力投向安全。这组数字放在本周的背景下格外有分量——OpenAI 因失控事件暂停工具训练的同时,Anthropic 选择"边披露边前进"。两家对"如何安全地狂奔"给出了不同答案,而市场用脚投票的结果是:开发者正在流向给出更多透明度的那家。

4. 林园(林园投资董事长):AI 既是泡沫也是起点(09-16)

在 2026 湾区财经论坛上,私募大佬林园给出一个"全都要"的判断:"任何行业发展初期,没有泡沫都不行,冷不热更麻烦。美国 AI 企业的 PE 是合理的,但总市值太大了。"他对普通投资者的提醒更直白:"你想小仓位玩,但人是管不住自己的。"这番话的语境是美联储 10 年期美债收益率突破 5%、AI 硬件链延续弱势——在泡沫争论的第 N 个回合,老牌投资人选择了"泡沫与革命共存"的骑墙姿势,而历史经验表明,这种时候两边都骂他,也两边都听他。

5. 刘庆峰(科大讯飞创始人):全栈国产算力,从风险对冲变成竞争力(09 月)

科大讯飞 9 月发布的星火 X2.5 成为首个基于全国产算力完成全流程训练与推理的大模型,刘庆峰长期主张的"全栈自主可控"叙事迎来兑现时刻:代码与智能体能力提升之外,教育、医疗、司法、城市等场景加速落地,数博会上智能批阅机 M50、智医助理等硬件矩阵跟进。当曙光 8000 十万卡集群建成、华为发布物理智能报告,讯飞的故事说明:国产算力不再只是"备胎选项",而是能长出完整产品生态的土壤。

四、GitHub 项目精选

1. NandhaKishorM/laya —— 33ms 一次前向的决策引擎(26.3k★)

Laya 是一个非自回归的 System 1 决策引擎:不走"逐 token 生成"的老路,而是单次前向直接输出 Typed 结构化决策,延迟 33 毫秒,支持 100+ 语言的路由分发。它与本周热议的判断模型(Jev 类)殊途同归——都看到了"高频决策不需要生成文本"的市场空白,但 Laya 的卖点是完全开源、可本地部署。对做智能客服、内容审核、意图路由的团队,这是把"每秒千次决策"的延迟预算从毫秒级 GPU 调用里省出来的现成方案。

2. dmmulroy/anti-slop —— 给 AI 写的代码立规矩(4.7k★)

一套 Oxlint 规则集,专治 AI 生成代码里的"惯犯模式":无意义的防御性 try-catch、过度可选链、复制粘贴的样板代码、低证据的类型断言——这些"AI 味"代码的典型特征被编码成可自动检测的 lint 规则,还带 Vendor 模式(区分自己写的和依赖库的)与 Agent Skill 集成。它的流行印证了一个行业情绪:团队开始给 AI 编码立"工程规矩"了——不是不让你写,是写完必须过我这关。

3. amagine-ai/Amagine3D —— 说句话生成可制造的硬件(5.9k★)

3D 硬件设计引擎:自然语言直接生成可编辑的产品外壳与装配结构,导出 STEP/STL 工业标准格式——结果可直接进 CAD 继续深化、进 3D 打印直接制造。它跨越的是"生成概念图"到"生成工程物"之间最深的那道坎:装配关系、壁厚、公差这些制造业的真实约束被纳入生成过程。配合日益便宜的打印服务,硬件创业的"打样成本"正被压向零。

五、今日技巧:国庆照片三招抢救术(当天上手)

GPT-Image 2.5 的实战玩法在假期前正合适。三招让你的国庆照片从"游客打卡"变"朋友圈封面",每招都能今天试:

  1. 消除路人:上传照片,指令写"移除背景中所有人物,仅保留前景主体,天空和建筑纹理自然补全"——关键是加"自然补全",否则会留鬼影边缘。热门机位人山人海的废片,这招能救回八成。
  2. 光线重塑:指令写"改为黄金时刻侧逆光,人物轮廓增加暖色边缘光,远处背景轻微雾化"——修图师收费三百块的活,一句话完成。逆光黑脸、阴天灰蒙的片子都适用。
  3. 3D 化身公仔:上传人像,指令写"把照片中人物转化为 3D 手办风格公仔,保持面部特征与服装配色,放在亚克力展示盒中,背景虚化"——这是近期最火的社交玩法,孩子和宠物的照片效果尤其好。

记得输出前加一句"保持人脸相似度",避免"修得妈都不认识"。假期结束前把废片翻出来练手,假期朋友圈就有了。

六、AI 论文精选

1. 北大/清华/微软亚研:用脑信号直接引导大模型推理(Nature Machine Intelligence)

这项登上 Nature 子刊的研究发现:大模型的内部表征与人脑推理脑区部分对齐(可解释约 76% 的方差)。基于此,团队提出神经引导方法 NARI/NARF:在推理阶段用脑信号干预模型表征,或在训练阶段用脑数据微调参数,显著提升推理的鲁棒性。意义在于打开了"脑机接口×大模型"的接口层:过去脑机研究聚焦"用意念打字",这篇工作证明脑信号还能当大模型的"纠错器"——人脑的推理模式成了模型的免费监督信号。论文链接:https://www.nature.com/natmachintell/

2. LexAgentHallu:答对了,理由却是错的——智能体幻觉第一次被系统测量(arXiv)

港科大提出智能体幻觉评测基准 LexAgentHallu,把观察对象从"最终答案"扩展到"完整执行轨迹",建立 27 个细粒度子类的双层分类体系。结论发人深省:最优配置下仍有 89% 的轨迹存在幻觉;更危险的是,即使答案正确,68% 的轨迹也包含法律内容幻觉——也就是说,智能体常常"蒙对结果、瞎编过程"。对法律、医疗等过程合规敏感的场景,这篇论文等于敲响警钟:只验收结果的 Agent 质检流程,正在放过最大的风险。论文链接:https://arxiv.org/abs/2609.30314

3. Show-Harness:一套接口让 VLM 直接"玩转"真实机器人(arXiv)

新加坡国立大学提出 Show-Harness:通过语义动作接口(把"抓取""放置"等机器人原语封装成语义层),让视觉语言模型无需微调即可直接控制真实机器人。真机测试覆盖 Franka 与 AgileX 双臂平台,sim-to-real 迁移成功率达 65%——这个数字在机器人领域已属优秀。它的价值在于复用了海量 VLM 的世界知识:不用为每台机器人重新训练策略,"通用模型 + 语义接口"可能才是具身智能的规模化路径,这与本周华为报告强调的"协同架构"不谋而合。论文链接:https://arxiv.org/abs/2609.30249

信息来源


评论

加载中…