2026-07-10 AI大事件
今日摘要
OpenAI正式发布GPT-5.6三档模型。
Meta发布Muse Spark 1.1推理模型。
智谱提出异步强化学习新方案SAO。
RoboTALES具身智能新框架亮相。
Meta超级智能一周年进展全面曝光。
亚马逊云GraphRAG将药研周期缩短87%。模型与产品更新
1. OpenAI 正式发布 GPT-5.6 三档模型
OpenAI 正式发布 GPT-5.6 三档模型。 奥特曼带来了 🚀 全新旗舰系列大模型。此次发布涵盖 Sol、Terra、Luna 三个档次。开发者可通过 新模型接口详情页 直接部署使用。新模型在 代码能力 上有了质的飞跃。三档定价策略将深度影响开发者生态。 来源:原文。
2. Meta 发布 Muse Spark 1.1 推理模型
Meta 发布 Muse Spark 1.1 推理模型。 Meta 超级智能实验室推出全新 ⚡ 智能体推理模型。它具备 百万级上下文 深度理解能力。该项目同步开放了 全新付费模型接口。详细技术评测可参阅 科技媒体深度报道。Meta 首次推出付费 API 将 🔥 重塑商业竞争格局。 来源:原文。
3. OpenClaw 转型为非营利基金会
OpenClaw 转型为非营利基金会。 这个知名开源个人智能助理项目正式宣布转型。创始团队携手微软与英伟达共同 🤝 维护其独立性。该项目每周新增用户已达 四百五十万 名。机构致力于推广 中立独立的个人智能。多国科技巨头已确认加入生态建设。 来源:原文。
4. OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体
OpenAI 发布 ChatGPT Work,一个能跨应用和文件收集信息、将复杂项目分解为小步骤独立完成并持续工作数小时的 AI 智能体。它内置 Codex 技术,目前每周超 500 万用户使用 Codex,其中超 100 万用于非软件开发场景。ChatGPT Work 由今天同步推出的最新前沿模型 GPT‑5.6 驱动,具备多步骤推理和按模板生成材料的能力。该功能今天起面向 Pro、Enterprise 和 Edu 计划推出,未来几天扩展至 Plus 和 Business 计划。桌面版 ChatGPT 在所有计划(含免费版)中提供 Chat、Work 和 Codex 模式,且 Codex 应用已合并至新的桌面应用。 来源:原文。
5. 蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0
蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP …。 来源:原文。
6. 蚂蚁灵波开源全球首个面向具身智能的 MoE 视频基模 LingBot-Video
蚂蚁灵波科技正式开源 LingBot-Video,这是全球首个基于 MoE 架构、面向具身智能的视频生成基础模型。总参数 30B,推理时仅激活约 3B,效率较同规模 Dense 架构提升约 3 倍。模型引入 7 万小时 VLA、VLN、Ego 等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在 RBench 上总分 0.620,超越 Wan2.6 等模型;在 Physics-IQ Verified 评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。 来源:原文。
7. NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,服务器吞吐量提升 2.03 倍
NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量 ≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB 降至 44.5 GB。迭代式 Puzzle 方法平均得分比单步高 0.57。代价:Arena-Hard-V2 降 4.2 分、SWE-Bench 降 2.6 分。…。 来源:原文。
8. Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型
Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。 来源:原文。
9. Meta 发布 Muse Spark 1.1 模型
来自 @finkd 的消息 — Muse Spark 1.1 已上线。 来源:原文。
10. 微软发布 Flint:面向 AI 智能体的可视化语言
微软研究院推出 Flint,一种可视化中间语言,让 AI 智能体通过简洁的人类可编辑 spec 自动生成美观图表。用户只需提供数据、语义类型和图表类型,Flint 编译器即可推导坐标轴、配色、布局等底层参数。支持 46 种图表类型,可渲染到 Vega-Lite、ECharts 和 Chart.js 三个后端。项目通过 npm 安装(TypeScript/JavaScript),并提供 MCP 服务器用于智能体工作流集成。采用弹性布局模型自动优化图表尺寸与间距,已开源。 来源:原文。
11. Claude 推出反思功能(Beta)
Anthropic 为 Claude 推出一项反思功能(Beta),帮助用户追踪使用模式。用户可回顾过去 1、3、6 或 12 个月的活动总结,涵盖关键主题、使用频率和任务类型。功能结合 4D AI Fluency Framework(委托、描述、辨别、勤勉)提供协作分析,支持设定静音时段或定时休息提醒。隐私方面,不涉及无痕对话和健康集成工具,也不提取连接工具中的底层文件。该功能面向 Free、Pro 和 Max 用户,需开启记忆功能,可通过 Claude 网页或桌面应用设置。 来源:原文。
12. ChatGPT Sites 将创意变可发布网站
将一个想法变成可发布和分享的实时网站 以下是 OpenAI 团队的一些成员用 Sites 构建的示例 👇 @prd_008 用 Sites 将一个想法变成了个人专注应用:。 来源:原文。
13. Google 推出 LiteRT.js:高性能 Web AI 推理运行时
Google 发布 LiteRT.js,这是 LiteRT 跨平台边缘 AI 运行时的最新成员,专为 JavaScript 开发者设计,可直接在浏览器中运行机器学习模型。LiteRT.js 基于 WebGPU 和即将推出的 WebNN 实现 SOTA 推理性能,同时支持回退到 WebAssembly CPU 方案。 来源:原文。
14. Mistral 推出 Studio,为 AI 提示词和技能提供系统记录
Mistral 今日推出 Studio,为 AI 提示词和技能提供集中式系统记录。平台将 prompts 和 skills 视为生产资产,支持不可变版本、回滚、明确所有权、分类标签和审计日志,保证变更可追溯。非开发者可直接编辑测试,通过标签将变更推送至生产,保留原有 CI/CD 流程。可观测性让生产输出回溯到对应资产版本,形成闭环治理。现面向 Mistral Studio 客户开放。 来源:原文。
15. 1X 推出二十五轴人形灵巧手
1X 为 NEO 人形机器人推出 25 自由度、腱驱动的灵巧手,官方称其在灵活性、力量、安全性和可靠性上接近人类水平。手部加入触觉感知,重点解决机器人在真实家庭环境中抓取和操作物体的最后一段距离。 来源:原文。
前沿研究
1. 智谱提出异步强化学习新方案 SAO
智谱提出异步强化学习新方案 SAO。 该技术攻克了智能体训练 🤖 不稳定的核心难题。团队借助 异步优化技术论文 实现突破. 新算法在 代码和推理 基准上大幅领先同类方案。该方案已成功应用于 🚀 GLM-5.2 的训练流程。 来源:原文。
2. RoboTALES 具身智能新框架亮相
RoboTALES 具身智能新框架亮相。 科学家提出结合大语言模型与视觉模型的 🤖 双阶段框架。该系统利用 任务对齐视频生成的论文成果 进行规划。算法能让机器人预测未来并更稳定地执行 复杂操作。团队已在 开源代码托管平台 分享全部成果。 来源:原文。

3. 模拟部署提前预测大模型安全风险
模拟部署提前预测大模型安全风险。 科研人员开发了 模型安全评估新框架。研究通过 🕵️ 模拟真实部署 环境来测试大模型表现。方案在 GPT-5 系列 上成功预测了潜在安全风险。新评估方法能有效预防模型失控带来的隐患。 来源:原文。
4. 科学机器学习物理审计架构发布
科学机器学习物理审计架构发布。 科学家在 💥 科学机器学习 领域取得重要进展。传统 AI 代理模型经常会违反 因果关系 等物理规律。团队发布了 物理审计验证工作流。该技术显著提升了算法在工程场景中的可靠表现。 来源:原文。
5. 揭密在线策略蒸馏:何时有益、何时有害及原因
Apple 机器学习研究团队提出训练无关诊断框架,以每个 token、每个问题、每个教师的分辨率分析 on-policy 蒸馏。通过可扩展 targeted-rollout 算法估计理想梯度,并计算蒸馏梯度与理想梯度的余弦相似度(梯度对齐分数)。实验发现,蒸馏指导在错误 rollouts 上的对齐程度显著高于正确 rollouts;最优蒸馏上下文取决于学生模型容量和目标任务,无通用配置。这些发现推动每任务、每 token 的诊断分析。 来源:原文。
6. TGPO:通过可验证奖励强化学习激励第一人称视频时序感知
多模态大语言模型(MLLM)在第一人称视频理解中缺乏时序感知,常依赖空间捷径。为此,研究者提出 Temporal Global Policy Optimization(TGPO),一种基于可验证奖励的强化学习算法。TGPO 通过对比模型在时序有序与打乱帧上的输出,生成全局归一化奖励信号,明确奖励时序连贯推理。TGPO 可集成 GRPO 和 GSPO,支持冷启动 RL 训练,抑制 MLLM 的空间捷径行为。在五个第一人称视频基准上,TGPO 一致提升时序定位与因果连贯性,优于此前基于 RL 的视频推理方法。 来源:原文。
7. Apple 提出 SRLM:自反思程序搜索提升长上下文处理能力
Apple 机器学习研究团队提出 SRLM 框架,利用自一致性、推理链长度和口头置信度三种内在信号,让模型在推理时评估候选长上下文交互程序。实验表明,在相同时间预算下,SRLM 较传统递归语言模型(RLM)最高提升 22%。分析发现,递归本身并非 RLM 性能关键,简单的自反思程序搜索无需显式递归即可匹配或超越 RLM;在模型上下文窗口内,RLM 反而降低性能,而 SRLM 在短上下文和长上下文中均实现稳定增益。 来源:原文。
行业、政策与安全
1. Meta 超级智能一周年进展全面曝光
Meta 超级智能一周年进展全面曝光。 继今日发布 Muse Spark 1.1 模型后, 扎克伯格 的算力野心进一步浮出水面。团队已启动 🚀 五个 吉瓦级机房 建设工程。深度分析报告预测其算力将在明后年逼近 行业龙头水平。人才招募方面也在 💼 重金狂挖顶尖算法专家。 来源:原文。

2. 亚马逊云 GraphRAG 将药研周期缩短 87%
亚马逊云 GraphRAG 将药研周期缩短 87%。 该方案通过 🧬 知识图谱 加速分子筛选与分析。 亚马逊云科技药研技术详情 已公开发布。临床数据表明 研发周期 可缩短达 87%。制药企业已开始采用并预计大幅降低 💊 研发成本。 来源:原文。
3. DeepSeek 秘密启动自研 AI 芯片项目
DeepSeek 秘密启动自研 AI 芯片项目。 消息源自 路透社独家报道。该芯片主要针对大模型 推理场景 设计。团队已在 🤫 暗中大量招聘芯片 设计人才。此举将 ⚡ 显著减少对英伟达等 芯片巨头 的依赖。 来源:原文。
4. 莫斯科举办首场人形机器人婚礼
莫斯科举办首场人形机器人婚礼。 新郎罗伯特与芭蕾舞娘 🤖 玛蒂尔达结为夫妻。 机器狗 多格玛提克在现场递送了手圈。许多市民 围观机器人婚礼直播送祝福。这次婚礼展现出 💖 智能技术 融入日常生活的趋势。 来源:原文。

5. 消息称特斯拉三代擎天柱人形机器人初步定型,马斯克放话达不成产能目标就开掉整个采购团队
据晚点 LatePost 报道,特斯拉 Optimus Gen 3 经马斯克评审通过,即将量产。供应链要求供应商 9 月产能达 1000 台/周,年底升至 2000-2500 台/周,届时年产能可达 10 万台。马斯克六月底高管会上要求年底前实现产能目标,否则开除整个 Optimus 采购团队。弗里蒙特工厂已改造为 Optimus 生产线,Model S/X 于 5 月停产。马斯克表示初期生产极其缓慢,低产量夏季启动,高产量 2027 年展开。 来源:原文。
6. Ollama 开发者数达 890 万,B 轮融资由 Theory 领投
Ollama 让开源模型在本地或云端轻松运行,保持体验一致。目前拥有 890 万开发者、6.7 万集成,并与各大模型实验室及硬件供应商建立合作。B 轮融资由 Theory 领投。 来源:原文。
7. Anthropic 发起“硬问题”倡议,邀请公众提出 AI 相关尖锐问题
Anthropic 作为公益公司,发起“硬问题”倡议,邀请公众就 AI 对就业、社会、家庭、科学医学等领域的影响提出最尖锐的问题。此前已通过多种方式收集看法:首轮调查询问 5.2 万美国人;通过 Anthropic Interviewer 调查了 159 个国家 70 种语言的 8.1 万 Claude 用户;开展数十场线下焦点小组;并基于匿名真实数据研究 Claude 使用情况。公司还设立了 Anthropic Institute 和 Long-Term Benefit Trust 以监督公益使命进展。Anthropic 承诺将公开追踪并报告针对这些问题的具体行动及成效。 来源:原文。
8. Anthropic 长期利益信托任命本·伯南克为受托人
Anthropic 的长期利益信托(LTBT)任命前美联储主席、2022 年诺贝尔经济学奖得主本·伯南克为最新受托人。他将与另外三位受托人共同监督公司以对社会长期有益的方式负责任开发先进 AI 的使命。LTBT 独立于管理团队和投资者,受托人不持股、不分红,仅按服务时间获酬。该信托有权向 Anthropic 董事会任命成员,并就 AI 风险与社会影响等关键决策提供建议。伯南克将参与公司的经济研究,帮助理解 AI 对全球劳动力与经济的影响。 来源:原文。
9. GPT-5.5 生物漏洞赏金计划
OpenAI 将 GPT-5.5 Bio Bug Bounty 升级为持续私密项目 OpenAI Bio Bounty Program,以 GPT-5.6 为起点并覆盖后续前沿模型,旨在发现能突破预设生物安全挑战的通用越狱攻击。奖励从 $25,000 提高至 $50,000,适用于。 来源:原文。
10. Ollama 完成新一轮融资
Ollama 宣布新增 88M 美元融资,服务约 8.9M 名开发者,继续推动开源模型在本地设备上的运行。融资说明本地推理不再只是个人开发者的工具选择,也逐渐成为企业控制数据和成本的一条基础设施路线。 来源:原文。

11. Musk 称赞 Anthropic 并承诺不切断其算力
Elon Musk 公开称 Anthropic 当前处于 AI 领先位置,并表示不会通过 SpaceX 的基础设施切断竞争对手。Anthropic 已与相关基础设施签订长期算力协议,这件事把模型竞争、云端依赖和算力供应商关系放到了一起。 来源:原文。
快讯
前美联储主席伯南克加盟 Anthropic 信托。 前美联储主席伯南克加盟 Anthropic 信托。 他正式加入 Anthropic 的监督信托机构。该信托旨在确保技术发展符合 💼 伦理与安全标准。他将利用宏观经济与监管经验提供专业指导。详情见于 路透社最新报道。此举被视为行业治理的 📈 重要里程碑。 来源:原文。
纽约时报申请法院制裁 OpenAI。 纽约时报申请法院制裁 OpenAI。 原告方 ⚖️ 正式 指控 OpenAI 非法使用新闻训练。这场官司涉及美国 版权法 核心争议。诉讼裁决将直接影响 生成式 AI 的数据合规标准。整个行业规范面临 🔥 重大重塑考验。 来源:原文。
开源与开发者工具
1. 智能体 UI 设计规范项目即将破十万星 🌟99.6k
智能体 UI 设计规范项目即将破十万星。 开发者常因缺乏 设计规范 导致界面混乱。该项目包含 品牌设计规范文件。 智能体 🤖 可直接生成符合规范的界面。这个热门仓库已斩获 ⭐ 99.6k 标星即将突破十万。 来源:原文。
2. Crawl4AI 开源爬虫项目持续爆火 🌟71.8k
Crawl4AI 开源爬虫项目持续爆火。 传统 🕸️ 网页数据 收集痛点极多。开发者推出 专为大模型优化的爬虫工具。该工具目前已狂揽 ⭐ 71.8k 的火爆关注。官方已搭建 供全球开发者交流的 社区群组。 来源:原文。
3. 网络安全神器 PentAGI 开源 🌟19.3k
网络安全神器 PentAGI 开源。 它能解决人工 渗透测试 效率低的核心痛点。用 全自主 AI 安全代理工具 轻松搞定。该项目目前已狂揽 ⭐ 19.3k 星。安全人员可用它 🤖 实现全自动渗透扫描。 来源:原文。
4. 克劳德桌面终端控制工具开源 🌟6.5k
克劳德桌面终端控制工具开源。 该工具解决大模型缺乏 系统权限 的问题。用 MCP 终端控制工具 快速体验。项目已积累 ⭐ 6.5k 星的人气热度。开发者能实现 💻 终端控制与差异化文件编辑。 来源:原文。
社媒与观点
快讯
社交媒体 AI 生成内容泛滥:LinkedIn 超过 40%长文为 AI 写作。 安全公司 Pangram 通过 Chrome 扩展收集超 100 万条帖子,分析发现社交媒体 AI 生成内容泛滥。整体 AI 检测率 13.8%,长文(超 250 词)中 25.72%完全由 AI 生成。LinkedIn 最为严重,超 40%长文帖子被标记为完全 AI 生成,占全部 AI 内容的 62%;X/Twitter 近一半文章(23.9%完全 AI+22.9%混合)为 AI 写作。Reddit 整体 AI 率仅 4.4%,但顶层帖子 AI 率达 11.6%。分析使用 Pangram 3.3 模型,假阳性率 0.01%。Substack 上长文 AI 率反而略低。 来源:原文。
Bun 被 Anthropic 收购后用 Rust 重写,月下载超 2200 万。 Bun 于 2025 年 12 月被 Anthropic 收购,作者使用预发布版 Claude Fable 5 进行了大量 Rust 重写。Bun 最初用 Zig 在一年内构建,如今 CLI 月下载超 2200 万,被 Claude Code 等采用。广泛功能带来稳定性挑战,v1.3.14 修复了多项 use-after-free、内存泄漏等 bug。团队通过 ASAN、Fuzzilli 模糊测试等系统性预防,并借助 Rust 的内存安全特性减少此类缺陷。 来源:原文。
AI 能否回答 3 万亿美元的问题。 围绕 AI 是否能创造 3 万亿美元级别的经济价值,讨论重新回到生产率、组织改造和基础设施投入,而不只是模型榜单。真正的分水岭可能在于企业能否把模型接入长期流程,并把节省的时间转成可验证的业务产出。 来源:原文。
今日总结与启示
- 主线变化。 模型、代理和机器人继续进入真实产品与基础设施。
- 研究趋势。 世界模型、强化学习和评测方法共同推动能力边界。
- 治理要求。 数据、知识产权和安全审计需要伴随部署一起建设。
- 工程判断。 低成本、本地化和可迁移性会越来越影响模型选择。
- 最终落点。 能稳定交付结果的工作流,比单次演示更值得长期投入。

