返回资讯列表

每日AI资讯 2026-08-21

AI技巧AI论文行业动态AI工具

AI 行业动态:Agent 开源潮、数学突破与资本大动作

OpenAI 全面开源 Codex Harness(8月19日):把 Codex 的底层 Agent 能力(CLI、官方 SDK 及 app-server 三件套)以 Apache 2.0 协议开源,开发者可以把 Codex 智能体嵌入自己的产品。最惊艳的数据:仅调整推理与上下文压缩,GPT-5.6 Sol 在 ARC-AGI-3 基准得分从 13.3% 飙升到 38.3%,输出 token 减少六倍——好的 Harness 设计比"换模型"更提效。

谷歌 DeepMind 发布 Gemma 4 系列:一次性开源五种尺寸(E2B 到 31B),支持文本/图像/音频/视频输入,上下文窗口最高 256K,Apache 2.0 许可。引入多 token 预测(MTP)草稿模型配合投机解码,解码速度提升 3 倍,被称为"开源模型卷王"。

智谱发布 GLM 5.3:Coding 能力与 Kimi K3 并列开源第一,超越 DeepSeek V4;ARR(年化收入)从 5-6 亿美元飙至 10 亿美元,市值突破万亿港元——中国开源模型正在"技术+商业"双线开花。

Anthropic 拟 IPO,或超 SpaceX 纪录:计划最快 8 月末向 SEC 递交 IPO 申请,CFO Rao 已牵头向投资者推介;同时签下 Riot Platforms 91 亿美元、为期 20 年的算力租约(191 兆瓦电力,可延长至 161 亿美元)——大模型公司开始"重资产"化。

宇树科技科创板上市(8月19日):发行价 150.80 元,首日盘中最高 1100 元(涨幅近 629%),市值一度达 4449 亿元;创始人王兴兴表示"机器人量产还需两三年"。次日股价大跌 18.7%,市盈率高达 475 倍,机器人泡沫论与产业论正面交锋。

人物动态:Jeff Dean 离职谷歌后首次公开访谈——坦陈 Gemini 早期 Coding 能力不足、TensorFlow 有设计失误,新公司 Discovery Loop 聚焦"科学发现自动化",目标是让模型具备"20 个博士"的跨领域科研能力;强化学习之父 Richard Sutton 则警告:AI 行业忽视了"机器停止学习"的问题。

注释:Harness 智能体的"运行底座",管理模型调用、工具执行、权限控制的框架层;MTP(Multi-Token Prediction) 一次预测多个 token 的机制,配合投机解码加速生成;ARC-AGI 著名的抽象推理基准,考察模型从未见过的模式推理能力;ARR 年化经常性收入。

AI 论文速览:Claude 联手数学家证伪百年猜想

近期最火的研究成果来自 Anthropic 与哈佛数学家 Levent Alpöge 的合作:Claude 帮助证伪了困扰数学界 超过 100 年 的 Carathéodory 猜想,顺带击碎了 Loewner 指数猜想。

它讲的是什么? Carathéodory 猜想(1907 年提出)断言:每个闭凸曲面上至少存在两个"脐点"(umbilical point,曲率处处相等的特殊点)。Claude 与数学家协作,构造出一个仅含 1 个脐点的 C∞ 光滑凸曲面作为反例,直接推翻了这个百年猜想——这也是继"黎曼猜想"之后,AI 在纯数学领域掀起的又一波高潮。

有什么用?

  • 人机协作新范式:不再是"AI 帮算数",而是 AI 在数学家引导下完成"构造反例"这种创造性工作
  • 方法可复用:Claude 在符号构造与推理上的能力,可迁移到微分几何、拓扑学等其他难题
  • 重新定义研究流程:数学家提方向、AI 穷举构造、人机共同验证,论文审稿周期大幅缩短

要注意:反例的构造依赖研究者对问题的深刻洞察,AI 目前是"得力助手"而非"独立发现者",距离全自动数学研究仍有距离。

注释:脐点(umbilical point) 曲面上各方向曲率相等的特殊点;反例(counterexample) 与猜想表述相矛盾的例子,一个反例即可证明猜想错误;C∞ 光滑 无限次可微,数学上非常"顺滑"的曲面。

AI 工具技巧:给 AI 配一个"外置大脑",实现跨对话记忆

大模型对话窗口有限,聊长了就"失忆"——长文档分析、多天项目、连载写作尤其痛苦。技巧:把 Markdown 文件当 AI 的外置记忆,让 AI 把中间成果写进文件、下次直接续读。

以"用 AI 写一本小册子"为例:

【第一轮:建立工作区】
请在 work/ 目录下创建三个文件:
- plan.md(大纲与结构)
- notes.md(素材与想法,随时追加)
- draft.md(成稿)
每轮对话结束后,把关键结论写回对应文件。

【后续任何一天:续写】
请先读取 work/plan.md 和 work/draft.md,
回顾我们上次写到哪里、接下来该做什么,
然后从上次结尾继续往下写。

要点:

  1. 固定"工作区文件":让 AI 始终把中间产物落在磁盘,而不是只存在对话里
  2. 明确写入时机:告诉 AI"每轮结束把结论写回文件",养成它"记账"的习惯
  3. 跨对话续接:新开对话先让它"读文件 + 复述进度",确认记忆恢复后再干活
  4. 配合版本管理:工作区建在 git 仓库里,还能顺手做版本回溯

适用场景:写书/长文连载、多天研发项目、需要反复迭代的方案——凡是"一次聊不完"的活,都值得给 AI 配个外置大脑。

注释:上下文窗口(context window) 模型一次能"记住"的文本量;token 文本最小处理单位,超窗就"遗忘";外置记忆 把信息存在模型之外,按需读取,绕开窗口限制。

GitHub AI Skill:DeepSeek Harness —— "一切皆插件"的 Agent 运行时

8 月 13 日 DeepSeek 开源首款 Agent 框架 DeepSeek Harness(github.com/deepseek-ai/deepseek-harness,MIT 协议),一周内引爆社区,核心理念只有六个字:一切皆插件(Everything is a Plugin)。

它做什么?如果把 DeepSeek 模型比作"大脑",Harness 就是"身体和工作台"——管理模型请求、工具执行、会话持久化、权限控制。架构上没有"特权核心",连 Agent 循环本身都是插件,用 Cordis 微内核把各插件组合成可运行的智能体,对标 Claude Code / Codex。

为什么有趣?

  • 16 个官方插件开箱即用:图片理解、搜索增强、浏览器操作、多 Agent 协作等
  • 社区脑洞插件满天飞:长期记忆、电子宠物、"4399 小游戏"、搞笑整活……GitHub 上 Awesome DeepSeek Harness Plugins 精选目录已收录大量作品,被戏称"Agent 版应用商店"
  • 模型能"改装自己":插件可以按需增删,省 token,Agent 可定制到极致

快速体验:

npx @deepseek-ai/dsh web

注释:Harness 智能体运行底座,见上文行业动态注释;插件(Plugin) 可独立装卸的功能模块,像 App 一样扩展 Agent 能力;Cordis 一个轻量微内核框架,用于组合各类插件。

AI Agent 动态

AWS AgentCore Payments 正式 GA:AI Agent 可在授权与预算限制下自主购买数字服务(支持 X402 协议),腾讯也已在测试"Agent 钱包"——AI 开始学会自己花钱,Agent 经济时代拉开序幕。


评论

加载中…