Skip to content

2026-06-25 AI大事件

今日摘要

OpenAI Jalapeño、Gemini 3.5 Flash 计算机使用、豆包专业版和 Qwen-AgentWorld 把模型能力继续推向可执行工作流 🚀
DramaDirector、DFlash、Google Research 参数化知识研究显示,推理、生成与解码效率仍在快速迭代 🧠
Dify 高危漏洞、Mistral Connectors 权限控制和 NSA/Anthropic 纠纷提醒企业 AI 必须先处理安全边界 🔒
Notion + Cursor SDK、火山 Agent Ready、ECC 与 codebase-memory-mcp 说明智能体基础设施正在平台化 🛠️
OpenRouter ZDR、FFASR 远场 ASR 和 NVIDIA NeMo AutoModel 把“可控、可评测、可部署”放到更核心的位置 ☁️
今天的主线是从单点模型发布转向系统集成,真正的价值越来越取决于权限、数据、评测和成本闭环 (๑•̀ㅂ•́)و✧

模型与产品更新

1. 谷歌智能音箱体验曝光

新款 Google Home 智能音箱实机体验显示,它在嘈杂环境中依然能较稳定地响应语音指令,红色外观也成为这次硬件更新的显眼卖点 ✨。但早期上手仍指出操作逻辑略显繁琐,说明家居 AI 的关键不只是模型听懂,还要把多设备控制流程做得足够直觉。 来源:The Verge

2. 即梦 AI 上线原生 4K 功能

即梦 Seedance 2.0 支持在生成阶段直接输出 4K 视频,强调发丝、纹理和色彩层次从源头保留,而不是后期简单放大 🎬。这会进一步抬高视频生成工具在影视级工作流里的基线,也让创作者更容易把短片素材直接推进到剪辑和交付环节。 来源:AIbase

3. 特斯拉中国接入豆包大模型

特斯拉中国车机系统将通过 OTA 接入 豆包DeepSeek:豆包助手负责更自然的车控对话,DeepSeek 处理复杂问答。对车载 AI 来说,这类本土模型组合不只是语音助手升级,也是在适配中文语境、车辆硬件控制和实时安全边界 ( •̀ ω •́ )。 来源:AIbase

4. Claude 在 Slack 支持 @ 功能

Claude 在 Slack 中支持通过 @Claude 指派任务,AI 可读取频道上下文并在完成后回到对话里同步结果。协作型智能体正在从单人聊天框进入团队频道,但权限、审计和任务边界会决定它能否真正承接长期工作流 🔒。 来源:Gorden Sun

5. ChatGPT 语音测试双向 AI 语音模型 Bidi 1

部分用户反馈 ChatGPT 网页版和 App 的模型选择器中出现 Bidi 1,与标准语音和高级语音并列;它支持边说边听,用户可在模型输出中途打断并发出新指令。OpenAI 尚未正式官宣,现阶段更适合作为语音交互方向的早期信号,而不是稳定可用功能判断 🎙️。 来源:IT 之家

6. Qwen-AgentWorld 开源,让 Agent 先预测再行动

通义千问推出原生语言世界模型 Qwen-AgentWorld,覆盖 MCP、Search、Terminal、SWE、Web、OS、Android 七大领域,并基于超过 1000 万条真实交互轨迹训练。Qwen-AgentWorld-397B-A17B 在 AgentWorldBench 取得 58.71 分,且可作为环境模拟器支撑可控 Sim RL,让智能体先预测动作后果再执行 🧠。 来源:通义实验室

7. Gemini 3.5 Flash 原生集成计算机使用

Google 将 Computer use 作为内置工具集成到 Gemini 3.5 Flash,让开发者构建跨浏览器、移动端和桌面环境的智能体。安全层面包含针对性对抗训练、敏感操作用户确认和间接提示注入自动停止,说明通用操作能力正在和企业级防护一起打包 ☁️。 来源:Google Blog

8. 豆包正式推出专业版

豆包专业版基于 豆包 2.1 系列模型上线,面向复杂办公和生产力场景,支持操作本地电脑、浏览器、Skills、定时任务、Office 套件,并可生成带后端数据库的在线应用。定价覆盖 68 元/月、200 元/月和 500 元/月档位,大学生认证后标准套餐 38 元/月持续 6 个月,字节正把消费级助手推进到可付费的工作流产品 🚀。 来源:豆包

9. 火山引擎推出 Agent Ready 基础设施

火山引擎在 FORCE 大会发布 Agent Ready 基础设施,AgentKit 升级 Identity、Runtime、Sandbox、Evaluation 等模块,ArkClaw 企业版则提供 Agent 广场、技能中心、企业知识库和 IDP/SSO/OAuth 管控。案例中海底捞门店经营 Agent 将小时级工作压缩到分钟级,人工跟进时长缩减 70%,说明企业 Agent 的竞争点正在变成身份、沙箱和评测体系 🛠️。 来源:火山引擎

10. Notion 使用 Cursor SDK 嵌入编码智能体

Notion 通过 Cursor SDK 在数周内把编码智能体嵌入产品,用户可在文档、讨论串或数据库任务里 @Cursor,让它规划、构建、测试、验证并创建 PR。集成基于 Provider 无关的智能体框架,结果通过 SSE 流式传输并支持断连恢复,产品团队不必自建完整编码 Agent 基础设施也能获得端到端能力 (^_^)v。 来源:Cursor Blog

11. Mistral AI 为 Connectors 增加安全与可控能力

Mistral AI 发布 Connectors 多项新能力:Enriched admin controls、带 connector scopes 的 API keys、Multi-account connectors、Connectors Debugger,以及 Vibe Code 和 Workflows 中的连接器支持。重点是把连接器访问、身份冒充防护、MCP 调试和长任务执行纳入统一控制面,企业 AI 自动化的权限颗粒度继续变细 🔒。 来源:Mistral AI

12. FFASR 发布真实远场 ASR 评测排行榜

Treble Technologies 与 Hugging Face 联合推出 FFASR,这是面向真实远场声学条件的开源社区 ASR 评测基准。它覆盖 14 种房间、20–470 m³ 空间、三档信噪比和近场干燥条件,并同时报告 WER 与 NVIDIA L4 GPU 上的 RTFx,帮助语音模型从“近场干净音频”走向真实部署环境 🎙️。 来源:Hugging Face

13. OpenAI 公布自研推理芯片 Jalapeño

OpenAI 与 Broadcom 联合推出面向 LLM 推理的定制 AI 芯片 Jalapeño,目标是提高 AI 系统性能、效率和规模。对 OpenAI 来说,这代表从模型、产品走向硬件基础设施的更完整堆栈;对行业来说,推理成本控制会越来越像云厂商和模型公司的核心竞争力 ☁️。 来源:OpenAI

AI资讯:OpenAI定制推理芯片Jalapeño官方渲染图

前沿研究

1. 华为云推 VLA 即插即用挂载

华为云相关研究 HIL-ResRL 面向 VLA 机器人微调,强调 1 小时真机训练即可让成功率突破 95%。它通过残差策略缓解分布偏移,并尽量减少对底座模型的依赖,给工业机械臂提供了更务实的快速适配路径 🧠。 来源:量子位

2. DramaDirector 用几何引导短剧生成

论文提出 DramaDirector,将短剧镜头解耦为多维叙事条件,并借助真实拍摄深度信息提升生成一致性。短剧生成的难点不只是画面质量,还包括角色、镜头、空间和剧情节奏的持续可控;几何条件提供了更可解释的约束抓手 🎬。 来源:arXiv

3. Transformer 注意头对齐减少视觉幻觉

一项研究提出对特定注意头进行跨模态正则化,尤其关注“最不合群”的注意头,以减少视觉语言模型的幻觉输出。这个方向的价值在于,它没有把幻觉治理完全交给后处理,而是直接干预模型内部对齐结构 ( •̀ ω •́ )。 来源:arXiv

4. DFlash 用块扩散草稿模型提升投机解码

UC San Diego 团队提出 DFlash,用轻量块扩散草稿模型一次前向生成整块 token,再由目标模型并行验证,保证输出无损。相比 EAGLE-3,DFlash 最高实现 2.5 倍加速;在 Qwen3-8B 等模型上平均无损加速超过 6 倍,NVIDIA Blackwell 上 gpt-oss-120b 吞吐量最高提升 15 倍 ⚡。 来源:MarkTechPost

5. Google Research 研究推理如何解锁参数化知识

Google Research 发现,推理链能帮助 LLM 回忆原本无需复杂推导的简单事实;在 Gemini-2.5 Flash、Gemini-2.5 Pro 和 Qwen3-32B 上,启用推理后模型能回答原本无法直接回答的问题。研究认为机制包括推理 token 提供计算缓冲,以及相关事实产生 factual priming,这给“为什么慢思考有时更会背知识”提供了更细的解释 🧠。 来源:Google Research

行业、政策与安全

1. Dify 漏洞威胁百万级 AI 应用

安全研究披露 Dify 多个高危漏洞,可能导致跨租户数据泄露和敏感信息被窃听,沃尔沃等企业应用也被点名存在影响面。RAG 与 Agent 平台承载的往往是企业内部知识和工具权限,一旦租户隔离出问题,泄露风险会比普通 Web 应用更复杂 ⚠️。 来源:微信公众号

2. MiniMax 推出 6 亿港元全员股权计划

MiniMax 发布总额约 6 亿港元的全员股权激励计划,不设绩效目标,强调留任即可获得。AI 公司的人才竞争已经从招聘薪酬延伸到长期股权绑定,真金白银背后是模型、产品和商业化团队的持续争夺 💰。 来源:AIbase

3. 孙正义称太空算力“没有意义”

孙正义公开质疑太空数据中心,认为轨道算力省下的电费相对于高昂芯片成本并不关键,并表示还会继续领导软银十年。这个判断把 AI 基础设施竞争拉回现实账本:电力、芯片、散热、通信延迟和资本开支必须一起算 ☁️。 来源:搜狗微信

4. NSA 因与 Anthropic 纠纷失去 Mythos 访问权限

《纽约时报》报道称,美国国家安全局因与 Anthropic 的纠纷失去了对 Mythos 系统的访问权限。无论具体合同与合规细节如何,政府客户对前沿 AI 工具的依赖正在放大供应商关系、出口管制和模型访问策略之间的摩擦 ⚖️。 来源:The New York Times

开源与开发者工具

1. ECC 代码智能体优化框架 🌟220.5k

ECC 面向代码智能体提供性能优化、记忆与安全防御能力,定位在让复杂代码任务更稳定、更可追踪。它的高星标也说明开发者对“让 Agent 记得代码库、别乱改、能持续优化”的需求正在集中爆发 🛠️。 来源:GitHub

2. harness 生成领域智能体团队技能 🌟7.4k

harness 用于设计领域智能体团队的元技能工具,能自动生成专业技能定义,帮助团队把重复经验沉淀为可复用流程。相比一次性 Prompt,技能化的价值在于把上下文、工具约束和操作边界固化下来 (๑•̀ㅂ•́)و✧。 来源:GitHub

3. codebase-memory-mcp 构建代码知识图谱 🌟12.8k

codebase-memory-mcp 提供毫秒级响应的代码知识图谱,支持 158 种语言,并强调显著节省 token 消耗。对大型仓库里的编码 Agent 来说,检索效率和上下文压缩会直接影响任务成本与修改准确率 🛠️。 来源:GitHub

社媒与观点

1. 哥飞.ai 知识库问答上线

哥飞.ai 上线知识库问答,整合三年社群精华教程,并调用 DeepSeek V4 提供问答能力。它更像垂直社群知识沉淀的产品化样本:当内容足够结构化,问答系统就能把“翻历史资料”变成低成本检索服务 ✨。 来源:即刻

AI资讯:哥飞.ai知识问答系统主页预览

2. 字节跳动分享 AI Coding 实践

字节跳动技术副总裁洪定坤在火山引擎 FORCE 大会上分享 AI Coding 实践:过去一年字节 AI 代码贡献率增长 6 倍,tokens 消耗增长 5 倍;TRAE 团队代码超 90% 由 AI 生成,但人均需求吞吐率仅提升 60%。这提醒团队不要只盯单一生成指标,真正的交付还要看正确率、可交付性和协作治理 🛠️。 来源:火山引擎

3. OpenRouter 公布零数据留存实践

OpenRouter 的 ZDR 保证用户提示词和模型响应不被存储;自 1 月以来新增 97 款支持 ZDR 的模型,月度 token 量增长 4.3 倍,约占全部路由流量一半。它把隐私承诺拆成账户级、护栏级和单次请求级三层,企业可按 API Key、组织成员或单次参数控制路由范围 🔒。 来源:OpenRouter

4. NVIDIA NeMo AutoModel 加速 Transformer MoE 微调

NVIDIA NeMo AutoModel 基于 Transformers v5,加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核。MoE 微调中训练吞吐量提升 3.4–3.7 倍、GPU 内存减少 29–32%,全微调 Nemotron 3 Ultra 550B A55B 时通过 EP=64 专家并行让任务可行,工程优化继续成为大模型训练的关键杠杆 ☁️。 来源:Hugging Face

快讯

  • 杭州西湖首现 AI 叙事空间:全国首个 AI 文旅空间在杭州亮相,机器狗、VR 风光和外骨骼设备把景区体验变成可交互叙事场景 ✨。 来源:AIbase
  • Reid Hoffman 批评 SpaceX 与 xAI:Hoffman 在播客中称 SpaceX“不是一家人工智能公司”,并批评 xAI 组织状态,相关观点更适合作为投资人与创业者视角观察 ( •̀ ω •́ )。 来源:Fortune
  • 工程岗位仍具韧性:SignalFire 追踪数据显示,大型科技公司总招聘较 2019 年下降 25%,工程岗仅降 11%;早期初创公司 2025 年工程师招聘较 2019 年增长 7%。 来源:TechCrunch

今日总结与启示

  • 系统能力比单点模型更重要。 Gemini 计算机使用、Agent Ready、Notion + Cursor SDK 都说明,模型只有接入权限、工具和运行时后才会变成可交付工作流 🚀。
  • AI 基础设施正在向硬件和调度下沉。 Jalapeño、DFlash、NeMo AutoModel 和 FFASR 共同指向更低推理成本、更高吞吐和更真实的部署评测 ☁️。
  • 安全边界必须前置设计。 Dify 漏洞、Mistral Connectors 权限控制、OpenRouter ZDR 和 NSA/Anthropic 纠纷都说明,企业 AI 的第一性问题是“谁能访问什么” 🔒。
  • 研究仍在解决模型内部机制。 Qwen-AgentWorld、DramaDirector、注意头对齐和参数化知识研究都在把“能生成”推进到“知道为什么、能控制” 🧠。
  • AI Coding 的指标要回到交付。 代码生成占比、token 消耗和 PR 自动化都只是中间指标,最终还要看正确率、可维护性和团队吞吐率 ( •̀ ω •́ )。