返回资讯列表

每日AI资讯 2026-08-20

AI技巧AI论文行业动态AI工具

AI 行业动态:开源潮与资本大动作并行

蚂蚁集团开源 Ling-3.0 系列模型(8月20日凌晨):主打"高效"的稀疏 MoE(混合专家)架构——Ling-3.0-flash-base 总参数 124B,每 token 只激活 5.1B;内置 512 个路由专家(每次激活 8 个)+ 1 个共享专家,原生融合线性注意力,MIT 许可全开源,还发布了训练中间检查点,方便研究者复现。

MiniMax 发布视频创作应用 MiniMax Design:把 H3 视频模型与画布、3D 导演台、Skills、Agent 打包成"分镜—生图—视频生成—剪辑配乐"的全流程工具,定位从"生成素材"转向"争夺专业创作软件入口",被看作对 Adobe 等传统工具市场的正面冲击。

快手分拆"可灵"独立融资,估值 180 亿美元:视频生成大模型"可灵"正式独立融资,腾讯、阿里云各投 13.63 亿元,百度投 3.41 亿元——视频生成赛道成为巨头争夺的新高地。

OpenAI 计划 2027 年上市:CFO Sarah Friar 在全员会议上透露,公司已向 SEC 秘密提交招股书,若业务持续增长可能更早;目前季度收入运行率增长 35%,企业收入增长 50%,AI 编码产品周活跃用户已达 2000 万。

人物动态:黄仁勋与日本 Noetra 联盟合作——英伟达提供 GPU 集群、日本政府补贴 61 亿美元,打造独立于中美模型的机器人生态系统;同时黄仁勋入驻 X 平台亲自讲解 AI 业务布局,开始"亲自下场"经营舆论。

注释:MoE(Mixture of Experts,专家混合) 一种大模型架构,每次只激活部分专家,兼顾性能与效率;token 文本的最小单位,模型一次处理一个 token;SEC 美国证券交易委员会,上市公司需向其提交文件;ARR(Annual Recurring Revenue) 年化经常性收入。

AI 论文速览:Twin —— AI 自己"玩懂"未知游戏

本周很值得一读的 arXiv 论文:Twin: Playing an Unknown Game with a Test-Time Digital Twin(作者 Alexy Skoutnev)。

它讲的是什么? 传统 AI 玩游戏,要么提前给它规则,要么让它硬学几千局。这篇论文反其道而行:让前沿编码 Agent 在测试时(Test-Time)直接为游戏编写一个可执行的世界模型(digital twin,数字孪生)——AI 不靠脚本、不靠试错,而是通过模拟和交互自己推断游戏规则与目标,再基于这个模型来通关。

  • 在 ARC-AGI-3 基准上达到 97.8% 的关卡完成率(179/183)
  • 通过"回放验证"机制保证推断出的世界模型与真实环境一致
  • 作者因此登上本周 arXiv 热门贡献者榜第二名

有什么用? 它展示了 Agent 从"照脚本执行"迈向"从零理解环境"的可能性——这对游戏 AI、机器人测试、自适应模拟都有启示:以后机器人进陌生环境,也许不用预先编程,让它"先写个世界模型,再按模型行动"就行。

要注意:目前验证范围还限于游戏类环境,真实世界的物理与社交复杂性远比关卡规则复杂,通用落地仍需时日。

注释:测试时(Test-Time) 指模型部署使用阶段,与训练阶段相对;世界模型(World Model) 对环境运行规律的内部模拟,模型用它预测"下一步会发生什么";ARC-AGI 一个著名的抽象推理基准,专门考察模型从未见过的模式推理能力。

AI 工具技巧:让 AI 当自己的"对手",写完先挑刺再改

让 AI 一次写完美很难,但让 AI"自己审自己"很简单。技巧只有两步:先让 AI 以挑剔角色挑毛病,再让它逐条修改。

以"让 AI 写一份产品方案"为例:

【第一轮:挑刺】
请以"最挑剔的评审专家"身份,从准确性、逻辑漏洞、遗漏风险三个角度
审查这份方案,列出最关键的 5 个问题,每条附一句改进建议。

【第二轮:修改】
根据你的建议逐条修改,输出完整修订版;
每处改动用【】标注原因,不许跳过任何一条建议。

要点:

  1. 给 AI 设定"挑剔角色"并规定审查角度——不问"你觉得怎么样"(AI 会说"很好"),直接要求"列出 5 个问题"
  2. 两轮分开跑:先挑刺、再修改,而不是让它"边写边自查"
  3. 第二轮强制逐条回应:用"不许跳过任何一条建议"堵住 AI 敷衍的路
  4. 可以迭代 2-3 轮:每轮问题会越来越少、越来越尖锐,效果快速收敛

适用场景:写重要邮件/方案、生成代码后做 review、做关键决策前检查盲点——凡是"写完就发"容易翻车的内容都值得先过一轮自我反驳。

注释:Red Team(红队) 源自安全领域,指专门扮演攻击者/挑刺者来检验系统,这里借指让 AI 反向审视自己的输出。

GitHub AI Skill:pm-skills —— 把产品经理方法论装进 AI

近期 GitHub 上很火的技能库:phuryn/pm-skills(⭐ 25.4K)。作者 Paweł Huryn 把一整套产品经理方法论(Teresa Torres、Marty Cagan 等大师的框架)编码成了 AI 可执行的技能。

它做什么?68 个 PM 技能 + 42 条链式工作流,打包成 9 个插件,可安装到 Claude Code、Codex CLI 等 AI 编程工具里。核心 slogan 是:"通用 AI 只给你文本,PM Skills 给你结构"——

  • 产品发现:头脑风暴、假设排序、用户访谈脚本(/discover)
  • 产品策略:商业模式、定价策略、SWOT/波特五力分析(/strategy)
  • 执行落地:写 PRD、拆 OKR、Sprint 规划、复盘、发布说明(/write-prd)
  • 数据与增长:SQL 生成、群组分析、A/B 测试解读、GTM 上市策略(/analyze-test)

为什么有趣?它展示了"Skill"的终极形态——把行业方法论变成 AI 的肌肉记忆。产品经理输入一句需求,AI 就能按验证过的框架逐步引导产出结构化交付物,而不是泛泛而谈的"文本"。产品、运营、独立开发者都值得装一个感受下:

claude plugin marketplace add phuryn/pm-skills

注释:Skill(技能) 打包好的提示词+脚本组合,可被 AI 编程助手按需调用;PRD(Product Requirements Document) 产品需求文档;OKR 目标与关键结果,常见的目标管理方法。

AI Agent 动态

阿里开源 Qwen3.8-27B 登顶全球开源榜:4bit 量化后仅 17.1GB,单张 RTX 4090 即可运行,SWE-bench Pro 61.7 分超越 Claude Opus 4.6 Max,首次把前沿 Agent 能力搬上消费级显卡。


评论

加载中…