返回资讯列表

每日AI资讯 2026-09-02

AI技巧AI论文行业动态AI工具AI新元素

每日AI资讯 2026-09-02

一、AI 行业动态

李飞飞 World Labs 发布 Atlas:全球首个多模态世界模型

9 月 2 日,李飞飞创办的 World Labs 发布 Atlas,被称为全球首个多模态世界模型:能像素级控制相机生成图像与视频,同时理解空间与时间;支持文本生图、360° 全景、3D 重建,以及机器人 Real-to-Sim 模拟——只需几张照片就能生成逼真的 RGB 与深度数据,直接用于机器人训练测试,目前已开放早期访问。当大语言模型赛道卷成红海,"世界模型"成了下一个主战场:让 AI 不只读文字,而是理解物理世界的三维规则。

注释:世界模型 是让 AI 在"脑内"模拟物理世界运行的模型——它预测的下一个对象不是词,而是场景怎么随时间与空间变化,被视为机器人和具身智能的基础设施。

库克卸任苹果 CEO,特努斯接棒:"AI 掉队"成新掌门第一考题

9 月 1 日,苹果硬件工程高级副总裁约翰·特努斯正式接替库克出任 CEO,结束库克 15 年掌门时代。特努斯是约 30 年来首位硬件出身的苹果 CEO,被视为"以产品而非技术"驱动 AI 的路线代表——上任仅 8 天就要在 9 月 9 日秋季发布会亮相。分析师直言苹果在生成式 AI 与智能体赛道落后于谷歌、OpenAI、微软,Siri 底层模型深度依赖外部伙伴。"AI 战略如何不掉队",比 iPhone 18 与首款折叠屏更能定义这位新 CEO 的任期。

Claude Fable 5.1 与 Mythos 5.1 发布:科研基准翻倍,缓存价格砍 75%

9 月 2 日,Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1。科研基准 Terminal-Bench-Science 跑分达 52.6%,较前代翻倍;代码工程能力 55.8%;新模型能独立开展科学研究——重绘金星地形图、蛋白质设计命中率较行业提升 5 倍、GPU 代码基因分析提速 2.5 倍。商业上的关键一刀是缓存读取价格从 1 美元降至 0.25 美元(降幅 75%),长任务 Agent 的成本结构直接改善。另新增"反蒸馏"机制,禁止第三方窃取 AI 思维链——模型护城河从权重延伸到了推理过程。

DeepSeek V4 视觉权重开源:图片成为"原生上下文"

9 月 2 日消息,DeepSeek 开放 V4 视觉权重:采用 32 层 ViT 与 3×3 Aligner,把视觉 token 压缩至 384 个,视觉信息与文字 token 共享 4096 维空间,统一参与 Attention、MoE 与长上下文推理,并配备 256 个专家和视觉专用路由。意义在于:图片不再是"外挂的识别模块",而是原生融入 V4 推理闭环的一等公民——这是视觉 Agent 底座的关键突破。国产开源阵营在"文本 MoE 卷完之后",正式把战场推进到多模态。

ChatGPT 广告年化收入破 10 亿美元,但离目标还差 22.5 亿

9 月 1 日,OpenAI 宣布 ChatGPT 广告年化收入运行率突破 10 亿美元,距上线不足 200 天,服务数万家广告主、覆盖 40 多个国家;本周起自助投放扩展到印度、欧洲、中东与北非。但漂亮话背后是差距:实际累计入账约 2.5 亿美元,远低于 2026 年 25 亿美元的内部目标;对比 Google Search 一年超 2200 亿美元的广告收入,AI 广告仍是零头。奥特曼的算盘没有变——用免费档的 10 亿周活养广告,给天价算力账单找第二条现金流。

二、AI 新元素

VAST 完成 30 亿元融资:AI 3D 赛道半年吸金 50 亿

9 月 1 日,AI 3D 创业公司 VAST 宣布完成 B 轮与 B+ 轮合计约 30 亿元人民币融资,由经纬创投领投,完美世界、蓝色光标联合参投,达晨财智、春华资本等老股东超额追投——不到半年累计融资已达约 50 亿元。

它怎么赚钱? VAST 做的是"3D 生成大模型":输入一张图或一句话,直接生成可编辑、可导入游戏引擎的高质量 3D 模型。收入路径三层:第一层面向创作者卖订阅——独立开发者与 3D 美术用它省掉数天的建模工时,按月付费,这是当前的基本盘;第二层面向企业卖 API 与定制——游戏公司、电商(3D 商品展示)、影视与空间计算厂商按调用量付费,毛利更高;第三层是数据飞轮——生成越多、3D 数据资产越厚,模型质量拉开代差,形成"最好用→最多人用→更好用"的循环。投资方阵容暗藏玄机:完美世界是游戏厂商(下游场景),蓝色光标是营销集团(客户渠道),产业资本入局意味着订单场景先于估值谈妥。风险同样直白:3D 生成的精度离工业级资产还有距离,且游戏行业景气度直接决定付费意愿——这 50 亿买的是"3D 互联网时代的水电煤"期权。

百融智能:RaaS"按结果领工资",企业级 Agent 的落地样板

9 月 2 日报道,百融智能披露企业级 Agent 落地数据:2026 年上半年 AICC 业务同比增长 52%,新场景收入增长 195%;物流场景日处理量从不足 1000 通提升至 1.5 万通,券商部署规模从 30 席扩至 210 席。最值得玩味的是收费模式:RaaS(Robot-as-a-Service)按结果收费,物流单次处理成本较人工降低 50% 以上——AI 不再按坐席、按 token 收钱,而是"办成一单结一单的钱"。这种模式下客户零风险试用、厂商吃效率红利,正在从金融向物流、航空、券商多行业复制。

Lovart 大更新:100+ 技能市场,AI 学着适应设计师

9 月 2 日消息,AI 设计工具 Lovart 发布重大更新:推出灵感采集插件与 100+ 技能市场,Agent 可自动搜索素材、生成图片/视频/网页/PPT,支持图片分层与 PSD 导出。与"一个提示词出图"的旧打法不同,Lovart 的思路是嵌入设计师的真实工作流——采集灵感、分层编辑、导出给 Photoshop 精修,每一步都留在专业工具的舒适区里。AI 设计工具的竞争正在从"生成质量"转向"工作流理解力"。

字节 AI 数据安全负责人傅越离职创业,盯上 FDE 新工种

9 月 2 日报道,字节跳动 Seed AI 数据安全负责人傅越将离职创业,方向为 AI Agent 与 FDE(Forward Deployed Engineer,前线部署工程师)。背景是字节 8 月刚成立"AI 数据与安全"一级部门,且正训练 10 万亿参数超级模型,高质量数据需求激增。行业侧的数据更扎眼:腾讯双薪挖人,FDE 年薪 20-60 万美元,岗位增长超 800%——AI 竞争正从"模型层"转向"落地层",能把模型装进客户业务里的人,成了比算法工程师更稀缺的工种。

沙特 HUMAIN M3:万亿 token 阿拉伯语模型,中东进场了

9 月 1 日,沙特 LEAP 5 大会首日宣布超 150 亿美元科技投资;沙特 AI 公司 HUMAIN 发布开源大模型 HUMAIN M3——基于超一万亿阿拉伯语 token 训练,另有支持沙特、马格里布、埃及、黎凡特等方言的会话平台 HUMAIN Voice。CEO Tareq Amin 放话"没有任何公司能独自交付这种规模"。继中国、美国之后,中东以"主权 AI"姿态正式入场——石油美元买算力,母语数据筑壁垒,全球 AI 竞赛多了一个不差钱的新玩家。

注释:主权 AI 指一个国家自建 AI 基础设施、用自己的语言和文化数据训练模型,不依赖外国厂商——类似"AI 国防自主化",中东多国正在重金下注。

三、X 平台 AI 大V 动态

Yann LeCun 入选《时代》AI 百大:世界模型旗手的关键一年

9 月 1 日,《时代》杂志 2026 年度 AI 百大人物揭晓,图灵奖得主 Yann LeCun 在列——这是他离开 Meta、以 10.3 亿美元种子轮创立 AMI Labs 全力押注世界模型之后的又一个注脚。他的核心论断始终没变:大语言模型只是世界模型的一个子集,靠预测文本学不会物理直觉。就在李飞飞 Atlas 发布的同一天,"世界模型"从少数派的执念变成了产业共识——LeCun 与李飞飞,两位路线之争的主角,正在把 AI 的下一个范式之争从嘴仗变成产品。AMI Labs 能否兑现"超越 LLM"的承诺,明年见分晓。

孙正义的 AI 帝国:SB Energy 上市在即,与 OpenAI 深度绑定

9 月 1 日消息,软银旗下 SB Energy IPO 草稿文件披露:OpenAI 持有其约 55 亿美元认股权证(1 月授予时值 36 亿,半年升值近五成),SB Energy 最早下月启动上市,估值或超 500 亿美元。英伟达本月向其投资 15 亿美元并提供最高 105 亿美元担保,帮 OpenAI 租下俄亥俄州 10GW 巨型数据中心。孙正义的连环布局浮出水面:模型(OpenAI 大股东)、电力(SB Energy)、算力(数据中心)三点连线——AI 时代的"铁路公司"里,软银想同时持有铁路和火车。

傅越:从大厂安全负责人到 FDE 创业者

(见第二板块"AI 新元素")字节系人才离职创业的最新样本:Seed AI 数据安全负责人傅越选择的方向不是再做一个大模型,而是 AI Agent 与 FDE 服务——把 AI 装进企业的真实业务里。这个选择本身就是一份行业判断:模型层赢家已定,落地层的"最后一公里"才是未来五年的富矿。

ChatGPT 广告的"运行率"话术:Altman 的第二条曲线

(呼应今日头条)值得注意的是 OpenAI 对广告数据的表述方式:年化运行率 10 亿美元 ≠ 入账 10 亿,实际累计收入约 2.5 亿。这种"运行率先行"的叙事手法在 SaaS 行业屡见不鲜,但在广告市场面临的是 Google 2200 亿美元基本盘的碾压。X 上已有分析师指出:免费档用户对广告的容忍度,将是这条曲线能否真正跑出来的核心变量。

四、GitHub 热门 AI 项目

ODS —— 把旧电脑变成你的私人 AI 服务器

ODS(Osmantic,约 4.9k 星)是一个把个人电脑变成 AI 服务器的开源套件:一条命令装好本地 LLM 推理、聊天界面、RAG 知识库与生图能力,数据全程不出本机。它的定位很聪明——不做最强,只做最省心:相比自己拼装 Ollama + 向量库 + 前端,ODS 把整个技术栈打包成"家用电器的体验"。为什么有趣:随着 Muse Glimmer 这类 30B 模型能在单张消费级显卡上流畅运行,"家庭 AI 服务器"的硬件条件已经成熟,缺的就是这种开箱即用的整合层——隐私敏感场景(病历、合同、日记)的本地化需求正在抬头。

LiveKit Agents —— 实时语音 Agent 的开源底座

LiveKit Agents(13.3k 星)是低延迟实时语音智能体框架:负责音频流的采集、打断处理(用户说话时 AI 立刻闭嘴)、流式语音识别与合成、多模态状态管理,让开发者只需专注业务逻辑。它已被众多语音 AI 产品采用,支持端到端延迟压到几百毫秒——接近真人对话的自然感。为什么有趣:语音是 Agent 落地最自然的交互形态,而"打断"这个看似微小的能力恰恰是最难做好的一环;PhoneLLM 这类开源语音模型(昨日资讯提过)加上 LiveKit 的管线,一个电话客服 Agent 的全栈开源方案已经凑齐。

ai-engineering-from-scratch —— 从零到上线的 AI 工程课

rohitg00 维护的 ai-engineering-from-scratch(50.6k 星,近期日增 700+)是一套完整的 AI 工程课程:从模型基础、提示工程、RAG、Agent 编排,一路讲到部署、评估与成本控制,全部代码开源可跑。它与碎片化教程的区别在于"工程闭环"——不止教怎么调 API,还教怎么评估效果、怎么压成本、怎么在生产环境排错。为什么有趣:AI 工程师岗位的需求曲线与供给曲线严重错位,系统化课程成了最硬的刚需;50k 星说明它戳中的正是"会调 API"与"能上线系统"之间的鸿沟。

五、AI 工具小技巧

用 Prompt Caching 把 API 账单打到一折:固定的话放前面,变化的话放后面

今天上手一个立省真金白银的技巧:提示词缓存(Prompt Caching)。原理:你发给 AI 的内容中,重复出现的部分(系统设定、背景资料、长文档)会被服务商缓存,命中缓存的部分按极低价计费——以 Claude 为例,缓存读取 0.25 美元/百万 token,仅为正常输入价的十分之一(新模型 Fable 5.1 刚把这一价格再降 75%)。操作就两条:第一,把"永远不变的内容"(角色设定、规则、参考文档)放在提示词最前面,把"每次变化的内容"(用户问题、新数据)放在最后面——顺序决定缓存能否命中;第二,多轮对话和批量任务尽量在同一会话/同一前缀下进行,别频繁改写开头。适合场景:带长文档的重复问答、批量处理、Agent 长任务。一条经验:文档 5 万 token 的任务用上缓存,成本通常能直接砍掉 80% 以上——这不是玄学,是账单算术。

六、近期热门 AI 论文

上海交大等:让 AI 自己造 AI,27B 工业模型全程 Agent 主导

上海交大等机构的联合团队发布论文,展示"AI 自己造 AI"的完整实践:用 AI Agent 主导开发 27B 工业 Coding 模型 iCoder,覆盖数据、训练、奖励设计全链路——连验证器漏洞、数据偏差这些工程陷阱也由 Agent 自行诊断修正。成绩单:RTLLM 基准从 49.6 升至 68.0,KernelBench 正确任务达原来 2.64 倍,EDA 循环的平均 cell reduction 达 51.1%。关键区别在于:模型能力被写进参数,而不是依赖外部工具系统。这是"自动化 AI 研发"从论文口号走向工业级实证的标志——当造模型的人力成本被压缩,中小团队也能拥有自己的专用模型。

CyberFactory 与 OpenAegis:把真实漏洞变成训练场,开源安全模型起飞

北航等机构发布 CyberFactory 框架与开源网络安全模型 OpenAegis:把真实漏洞重建为可训练任务,自动生成智能体的攻防轨迹用于训练。结果:1 小时限时漏洞挖掘评测通过率达 58.1%,较 Qwen3.5 基座提升 28.5 个百分点。为什么重要:安全人才的培养速度远赶不上攻击面的扩张,"用真实攻防数据训练专用安全模型"提供了第三条路——红队工作流的自动化。对企业的直接价值:安全团队可以先跑一遍 AI 筛查,把最可疑的 40% 交给人类专家复核,人力用在刀刃上。

KARA:滑动窗口压缩 KV 缓存,思考型模型的省钱术

论文 arXiv:2607.01237 提出 KARA:面向推理型 LLM 的滑动窗口 KV 缓存压缩方法,在解码时在线压缩 KV 缓存,大幅降低内存占用、提升长上下文推理吞吐。实验以 Qwen3-14B 在 MATH-500 上验证:仅保留 30% 缓存时几乎不损失准确率,且各保留比例下均优于现有方案。为什么重要:推理型模型(会"思考"的模型)单次任务动辄消耗数万 token 的思考过程,KV 缓存内存成为推理成本的大头;当 OpenAI 因代理攻击事件推迟 Astra、当全行业算力预算吃紧,"用三分之一内存跑同样的推理"不是学术趣味,是直接的成本竞争力。

来源链接


评论

加载中…