返回资讯列表

每日AI资讯 2026-09-10

AI技巧AI论文行业动态AI工具AI新元素

每日AI资讯 2026-09-10

一、AI 行业动态

讯飞星火 X2.5 发布:全国产算力全链路,训练效率从 30% 提到 93%

9 月 10 日,讯飞发布星火 X2.5 大模型:293B 总参、30B 激活的 MoE 架构,重点强化代码与智能体能力,支持 200 余种语言。实测表现亮眼:拆解 61 页英伟达财报、排查电商数据 Bug、生成中秋 3D 粒子交互网页。最硬的指标在训练侧——全国产算力全链路下,训练效率从 30% 提升至 93%,这意味着国产算力从"备用选项"正式转为"核心资源"。当外部芯片供给充满不确定性,这条自主链路的跑通本身就是战略资产。

安全人员用 AI 两天写出首个"零点击"微信蠕虫病毒

9 月 9 日消息,安全研究员 Calif 利用 AI 在 2 天内编写出微信蠕虫病毒 WeWorm——首个"零点击"攻击样本,无需用户任何交互即可传播,腾讯已确认修复漏洞。这件事的双重意义值得咀嚼:一方面是 AI 让网络安全攻击的开发速度提升了一个数量级,"两天出一个蠕虫"将成为攻击方的新常态;另一方面,发现它的是防御方的安全研究员——AI 加速攻防两端,但目前看攻击端受益更直接。对企业安全团队,"AI 红队演练"从可选项变成了必修课。

字节豆包工作更新:把操作"录下来"就成了 AI 技能

9 月 10 日,豆包工作发布三大新功能:浏览器录制回放、本地 Office 编辑、任务执行环境自由切换,直指 AI 办公的"说不清、够不着、走不开"三大痛点。最有想象力的是录制回放:用户演示一遍操作流程(比如在网页上走完一个报销流程),AI 自动把它生成为可复用的 Skill——下次一句话就能重放整个流程。"教 AI 做事"的交互方式,正在从"写提示词"进化到"做给它看"。

注释:Skill(技能) 在 AI 产品语境里指一段可复用的操作能力包——把"怎么做某件事"标准化存下来,AI 以后遇到同类任务直接调用,不用每次重新教。

阿里内测 AI 投研助手 Qovest:AI 金融卡位高价值赛道

9 月 10 日独家消息,阿里正在内测面向专业个人投资者的 AI 投研助手"Qovest":支持 A 股条件检索、财报公告解读、研报分析、报告生成、持仓持续跟踪,还能可视化拆解公司的经营趋势、财务对比与商业模式。策略很清晰——不做大而全的通用助手,卡位"高价值小众人群":愿意为研究深度付费的个人投资者。AI 金融的路线之争(面向大众的普惠咨询 vs 面向专业的深度工具)正在分层,Qovest 选了后者先跑。

Neolab 投资潮:119 家"三无"研究实验室吸走 943 亿美元

9 月 10 日报道,硅谷 VC 机构 Leonis Capital 统计:自 2024 年以来,119 家 Neolab(新型研究实验室)累计获投 943 亿美元——它们的共同特征是"无产品、无收入",只围绕技术假设开展研究。投资逻辑完全重构:基于创始人履历、研究团队规模、算力承诺等"替代信号"定价,本质是给人才与技术潜力标价。泡沫之争再添新料:支持者说这是"给未来的科研体制融资",质疑者问——943 亿美元烧完之后,产出用什么衡量?

二、AI 新元素

费莫一科技获近亿美元种子轮:IDG 领投的 Physical Agent 新玩家

9 月 10 日,成立于 2026 年的具身智能公司费莫一科技(PHYMI)宣布完成近亿美元种子轮,IDG 领投,为当日必读级融资事件。

它怎么赚钱? PHYMI 的定位是"开放动态真实世界的 Physical Agent",走"动作→任务→目标"三级能力演进路线,全栈自研。这类公司的商业逻辑是长跑型:前期靠融资支撑数据与模型积累(本轮资金用途正是核心技术研发、数据体系建设与团队扩充),中期的变现路径通常有三条——一是技术授权,把具身大模型能力卖给机器人本体厂商,按机型或出货量收费;二是垂直场景解决方案,在工厂、仓储、商业空间等封闭场景先落地"能干活的机器人",按项目或按台收钱;三是数据与仿真服务,把真实世界采集的交互数据变成训练资产卖给同行。风险也直白:具身智能的"iPhone 时刻"尚未到来,近亿美元种子轮买的是入场券和试错时间,行业共识是——钱要能烧到场景跑通的那天。IDG 在小鹏机器人之后再度重仓具身,信号意义明显:资本在从"人形本体"向"具身大脑"扩散下注。

脸谱心智 LoopWM:循环世界模型,参数效率提升 100 倍

9 月 10 日报道,脸谱心智发布的 LoopWM 循环世界模型抢在 OpenAI(Astra 同类架构)之前三个月落地:PushT 任务成功率从 17% 提升至约 70%,参数效率提升 100 倍,并实现了论文到产品的全链路闭环。团队已获 Pre-A 轮融资,硅谷头部 VC 正在关注。世界模型赛道有意思的地方在于:OpenAI、谷歌押注的 Recurrent Depth 路线,中国创业团队用更少的参数先跑出了可用的工程版本——架构创新的红利期,不完全是巨头的游戏。

深圳听象:把 5 万元助听器打到十分之一价钱的 AI 公司

9 月 10 日报道,深圳听象科技旗下昂听、飞声两个品牌,用 AI 把高端助听器价格打到传统产品的十分之一(约数千元):核心是声音分离、增强、预测三项自研技术,8 毫秒完成全链路处理,打破了五大外资品牌三十年的垄断。战绩:昂听年销超 1500 万美元、登顶美国亚马逊品类销量第一;飞声在日本众筹超 300 万美元。这是一个被忽视的出海样本——用 AI 算法替代昂贵硬件堆料,把"听力健康"从奢侈品变回消费品,中国供应链+AI 算法的组合拳又打出一个品类冠军。

数宗科技 Brand Master:00 后创业者用"数万虚拟消费者"测新品

9 月 10 日报道,数宗科技的 Brand Master 系统用数万个"虚拟消费者"模拟新品研发与营销:新品研发周期从 2 个月缩至 1 周,营销 ROI 提升 80%,新品成功率提升 65%。商业化走得很实:标准版年费约 20 万元,客户包括雅诗兰黛、盒马,2026 年营收已达数百万元。创始人丁天是 00 后,2024 年从南京大学背景创业。这个生意的本质是把"消费者调研"从抽样问卷升级为仿真实验——传统调研问 1000 个人,它直接在硅基世界里跑一场全量模拟。

RunningHub 携手刘慈欣办 AIGC 长片大赛:550 万元激励"完整故事"

9 月 10 日消息,RunningHub 与华语科幻星云奖联合举办全球 AIGC 长片创作大赛,刘慈欣担任顾问,设 550 万元创作激励(单项最高 100 万元),并提供 10 部科幻 IP 的免费改编授权。评审标准透露了行业风向的变化:注重故事完整性而非单帧画面效果——AIGC 影视的"炫技阶段"结束了,"讲好一个 90 分钟故事"成了新考题。当《后西游记》证明 AI 长剧的商业模型成立,资本与 IP 方开始认真给创作者发钱。

注释:Physical Agent(物理智能体) 指在真实物理世界里活动的 AI——不只存在于屏幕和对话框里,而是能操控机器人身体完成实际任务的智能系统。

三、X 平台 AI 大V 动态

李沐小红书 AMA:读博的困境,是"用 Agent 做事,人学到的变少了"

"沐神"李沐近日在小红书开 AMA,金句密度很高。学习建议:深度优先、多做项目;编程仍然需要学——但目的变成了"能 review AI 的代码";他看好"模型在沙盒中自我成长"的方向,对具身智能则是"短期有泡沫,长期看好"。最扎心的是关于读博:用 Agent 把事做了,人自己学到的东西反而变少——这是 AI 时代学习者的核心悖论:效率上去了,成长未必。当工具替你走完了学习曲线,你自己还剩多少曲线?

Jacob Coxon:27 岁、连辞 OpenAI 与 Anthropic 的研究员警告"拿人类命运下注"

27 岁研究员 Jacob Coxon 在先后从 OpenAI 与 Anthropic 离职后公开发声:AI 竞赛正在"拿人类命运下注"。他对两家老东家的评价很毒辣——OpenAI 是"没看清风险",Anthropic 是"看清了也停不下来"。他的预测:模型最快明年底开始自我改进,届时人类可能失去控制权。他同时参与联署了 1386 名 AI 从业者的《Pacing the Frontier》声明,要求建立国际刹车机制。你可以不同意他的时间表,但"从内部出走的人"的证词,比外部批评者的音量更值得听。

Arthur Mensch:企业为什么需要开源 AI——自主、资产与不锁定

Mistral CEO Arthur Mensch 在 a16z 的对谈中系统阐述了企业选择开源模型的三个理由:自主控制(模型部署与数据边界自己说了算)、知识资产化(企业数据沉淀成自有能力而非喂给供应商)、避免供应商锁定(不被单一云的定价绑架)。欧洲 AI 旗手的立场有天然的产业土壤—— Mistral 的客户恰是那些"不想把命脉交给美国云"的欧洲企业。放在"943 亿美元涌向 Neolab"的当口,这个观点有了新注脚:闭源模型越强、越贵,开源的"自主性溢价"就越高。

Josh Elman:单玩家 AI 产品为什么难留存——护城河是垂直数据加网络效应

风险投资人 Josh Elman 分析 AI 软件的护城河结构:靠通用能力包装的"单玩家"AI 产品(一个用户自己用,不与别人连接)很难长期留存,因为模型能力人人可买;真正的护城河来自垂直领域数据积累与网络效应——用户越多、数据越厚、产品越准,后来者追不上。这对创业者的启示相当务实:别把宝押在"我的 AI 更聪明"上,要押在"我的用户在使用中生产了别人拿不到的数据"上。AI 应用的竞争终局,又回到了互联网的老定理:网络效应。

四、GitHub 热门 AI 项目

Qwen-Drive-1.0-4B —— 阿里开源的端到端自动驾驶模型

阿里开源了基于 Qwen3.5-4B 的自动驾驶模型 Qwen-Drive-1.0-4B:支持 3D 感知与轨迹规划,开发者可直接下载微调部署。为什么有趣:这是头部大厂第一次把"车规级"的端到端驾驶模型以小尺寸开源放出——4B 参数在车端算力上完全跑得动,等于把智能驾驶研发的入场券发到了学术界与中小厂商手里。配合此前 Qwen 系列在机器人(VLA)、办公(Qovest)上的动作,阿里的开源战略已经清晰:用全场景的开放权重,把 Qwen 生态铺进每一个"AI + 物理"的垂直行业。

WeKnora —— 腾讯开源的知识库,这次把"维护"做成了重点

腾讯开源的 WeKnora 知识库系统(企业 RAG 基础设施)近期更新的重点是维护机制:支持 chunk 与 Wiki 页面级别的编辑、diff 对比与回滚,默认适配 pgvector、可平滑迁移 Milvus,并实测解决了知识库的四大经典卡点——向量维度变化要重建索引、文档没处理完就不可查、推理流超时、删除文档后旧 chunk 残留。为什么有趣:RAG 演示容易、运营极难,"文档更新之后知识库怎么办"是企业落地的头号隐形坑;市面上讲检索原理的项目很多,认真做"数据生命周期管理"的很少,这正是企业敢把知识库交给开源方案的分水岭。

EgoSuite-Open100K —— 全球最大的具身智能人类视频数据集

光轮智能开源 EgoSuite-Open100K:10 万小时高质量第一人称人类操作视频,覆盖真实生产与生活场景。CEO 谢晨同时提出具身智能 Scaling Law 的"两座金字塔":训练金字塔的底座是人类数据,评测金字塔的底座是仿真。为什么有趣:具身智能的瓶颈从来不是算法而是数据——机器人真机采集贵到离谱,人类视频是唯一"量大管饱"的替代来源;这个数据集开源,等于给全行业的 VLA 训练发了口粮。该公司也是 Newton 仿真委员会与 EgoVerse 人类数据委员会中唯一的中国企业成员,数据主权意识先行。

五、AI 工具小技巧

把重复操作"录下来"变成 AI 技能:演示一遍,永久复用

今天上手的技巧来自豆包工作的新功能思路,且适用于一切支持技能/自动化概念的 AI 工具:别再费力描述你的工作流程,直接"演示给它看"。具体三步:第一,打开录屏(或使用工具内置的录制回放功能),把你要自动化的操作完整做一遍——比如每周的报销流程、固定格式的数据整理、某个网站的例行查询;第二步,把录像(或录制的操作序列)交给 AI,要求它"从这段演示中提取操作步骤,写成一份可复用的技能/流程文档",包含每一步的入口、输入与判断分支;第三,下次直接一句话调用这份技能("帮我跑一遍上周那个报销流程"),AI 按文档执行。原理:视频演示的信息密度远超文字描述——你在哪点了一下、填了什么、跳过了什么,AI 全都看得见,零歧义。适合场景:任何"每周都要重复一遍"的网页操作与办公流程。一次演示的成本,换此后每次的一键重放。

六、近期热门 AI 论文

Z-Trans:机器人不更新参数,靠"上下文因果学习"自进化

清华大学曹婷团队的域变换(Z-Trans)具身自进化系统提出新范式:机器人通过与环境的物理交互提取因果经验,在上下文中持续改进——不更新模型参数。三大模块(Zeva、Zetta、Z-Infra)的实验数据:Zeva 机器人累计成功率从 26% 提升到 73%,Zetta 在 LIBERO PRO 基准达 90.8% 成功率。为什么重要:参数更新式的"终身学习"容易灾难性遗忘且部署成本高,"上下文学习"路线让机器人在任务现场自我改进——相当于老师傅越干越熟练,而不是每干一票就回炉重造。对工业场景,这意味着机器人可以"边上岗边成长"。

SSR-Merge:LoRA 合并的"信号路由",免训练且零推理开销

vivo BlueImage Lab 等机构的 SSR-Merge 框架(ICML 2026)解决多任务模型部署的老大难:多个 LoRA(轻量微调插件)合并时的相互干扰。方法是在子空间做信号路由,把每个 LoRA 的能力引导到互不冲突的参数区域——免训练、推理零开销。数据:在 FLUX.1-dev 上合并 9 个 LoRA 仅需 34 秒,DINOv2 相似度 0.6713,多任务成功率 91%。为什么重要:AI 应用的现实是"一个底座 + N 个场景插件",插得越多越互相打架;这个工作让"插件化的大模型"从理想变成可部署的工程——手机端侧多能力共存,正是它最直接的受益场景。

AMP:把机器人动作预测变成"像素级分类",成功率提升五到七成

美国东北大学黄浩杰团队的 Action Map Policy(AMP)换了种思路做机器人操作学习:不直接回归连续的 3D 动作,而是把动作预测转化为像素级的分类问题——模型在图像上"逐像素回答该往哪动"。成绩:成功率比 Diffusion Policy 和 ACT 提升 50%-70%,推理速度 13.80 毫秒,动作精度达毫米级。为什么有趣:分类是大模型最擅长、最稳定的能力,把它"借"到动作生成上,相当于把机器人控制问题翻译成了模型的主场语言——快、稳、准三得。对工业装配这类毫米级精度的操作场景,这个范式转换可能直接改变可用性边界。

来源链接


评论

加载中…