Skip to content

2026-07-03 AI大事件

今日摘要

模型与产品更新:Meta推出AI社交应用Pocket、AI 版支付宝开放公测,蚂蚁阿宝无需邀请码即可体验、Google Health API 推出 CLI:ghealth 是一款针对 Fitbit 数据的开源工具 🚀
前沿研究:半导体先进封装取得突破、大模型自适应思考新框架、前沿大模型Seed2.0论文发布 🧠
行业、政策与安全:OpenAI计划向美政府赠股、中国低价模型赶超西方巨头、竞品红队安全评估陷入争议 🔒
开源与开发者工具:多模态检索工具开源发布、阿里开源网页端智能体助手、智能体交互系统开源发布 🛠️
社媒与观点:少年开发多模型辩论平台、千问团队朱达:C端Agent Harness的“多快好省”工程哲学与主动服务探索、Agent辅助的SGLang开发:初步探索 ( •̀ ω •́ )
今天的主线是模型、工具、研究与产业部署继续向可执行工作流收敛 (๑•̀ㅂ•́)و✧

模型与产品更新

1. Meta 推出 AI 社交应用 Pocket

Meta 推出 AI 社交应用 Pocket。 Meta 近期悄然发布 Pocket 应用。创始人 扎克伯格 亲自 📱 主导此项目。用户只需输入提示词即可定制 专属玩法。趣味互动体验让 (o_O) 大家倍感新奇。 点击链接获取新体验 开启社交新方式。 来源:点击链接获取新体验

前沿图集:Meta推出的Pocket社交软件交互界面图

2. AI 版支付宝开放公测,蚂蚁阿宝无需邀请码即可体验

支付宝阿宝 AI 助手今日正式开放公测,iOS 和安卓用户可在应用商店或支付宝 App 搜索“阿宝”或“蚂蚁阿宝”直接体验。开通后右滑进入新版,以对话方式安排办事,例如说出“查公积金”,阿宝会自动匹配对应小程序和服务入口,用户点击确认即可完成。支付宝承诺所有资金变动与支付环节均需用户本人确认,扫码、转账等功能已预留入口。 来源:IT 之家(RSS)

3. Google Health API 推出 CLI:ghealth 是一款针对 Fitbit 数据的开源工具

ghealth 是一款封装 Google Health API v4 的开源命令行工具,以单个 Go 二进制文件发布(Apache 2.0 协议)。它提供 40 种已验证的数据类型(包括步数、心率、睡眠、体重、血氧饱和度、心率变异性等)的结构化 JSON 输出。工具采用 Agent 优先设计,具备确定性退出码、--dry-run 和 --raw 标志,并附带两个 SKILL.md 文件供 AI 智能体使用。用户需自行创建 OAuth 凭据,通过 PKCE S256 认证。数据来源覆盖 Fitbit、Pixel Watch 及连接的第三方设备。 来源:MarkTechPost(RSS)

4. Senior SWE-Bench:评估 AI 智能体作为高级工程师的基准测试

Senior SWE-Bench 是一个开源基准测试,用于评估 AI 智能体完成高级软件工程师级别任务的能力。任务分功能开发与 Bug 修复两类:功能任务指令类似自然语言消息,采用验证智能体基于专家配方自动生成行为测试;Bug 任务要求根据日志、profiling 等运行时信息深入调查。排行榜显示,Claude Opus 4.8 搭配 Mini-SWE-Agent(max effort)通过率 24.0%,Claude Sonnet 5 为 19.4%,GPT-5.5 为 16.0%,最强前沿模型在超 75%任务中未能达到高级工程师级别的正确性与品味。每个功能任务平均涉及 11 个文件,最强智能体也需数百步完成;中位指令长度仅为 SWE-Bench Pro 的 31%。任… 来源:Hacker News 热门(buzzing.cc 中文翻译)

5. Kimi K2.7 Code 已在 GitHub Copilot 上正式发布

Kimi K2.7 Code 开源权重模型已在 GitHub Copilot 中正式可用,成为 Copilot 模型选择器首个可选的开源权重模型,为编程工作流提供更低成本选择。该模型由 GitHub 托管于 Microsoft Azure,按供应商列表价格以用量计费。逐步向 Copilot Pro、Pro+ 和 Max 计划用户推送,用户可在 Visual Studio Code 1.127.0 或更新版本、Visual Studio 17.14.6 或更新版本、JetBrains 1.9.1-251 或更新版本、Xcode、Eclipse 等 IDE 及 Copilot CLI、GitHub.com、GitHub Mobile 等… 来源:Hacker News 热门(buzzing.cc 中文翻译)

6. 阿里巴巴发布 Page Agent:开源 JavaScript 库实现网页 DOM 自然语言操控

阿里巴巴发布 Page Agent,一个开源的 JavaScript 客户端库,嵌入网页后可通过自然语言指令直接操作 DOM 元素。与 Playwright、Puppeteer 等外部浏览器自动化工具不同,Page Agent 不依赖截图或多模态模型,而是将实时 DOM 脱水压缩为 FlatDomTree 文本映射,让纯文本模型精准执行点击、表单填写等操作。它继承用户 cookies 和会话,无需独立后端,并支持任意 OpenAI 兼容端点的模型(示例使用 qwen3.5-plus)。项目采用 MIT 许可证,适合在自有应用内构建 AI 副驾、智能表单填充或无障碍控制等场景,但限于单页面范围,风险操作仍需服务端验证。 来源:MarkTechPost(RSS)

7. 昆仑万维天工 3.2 发布 Skywork Tags,AI 智能体加入工作群聊

昆仑万维天工 3.2 发布 Skywork Tags,将 AI 智能体以团队成员身份接入 Slack、飞书、钉钉、Discord、Telegram 等即时通讯工具。团队可在原有工作群中@Skywork 参与讨论,无需切换窗口或迁移数据。共享版 Agent 持续吸收多样上下文后表现反超精心调教的个人版,团队最终完全改用共享版。Skywork Tags 不要求改变工作方式,让 AI 积累团队上下文并越用越强。 来源:公众号:昆仑万维(天工)

8. Claude Enterprise 新增用量与成本分析及支出管控功能

Claude Enterprise 推出更丰富的管理分析工具和成本控制功能。仪表板现可按群组和用户分析用量与成本,支持按 SCIM 群组筛选,展示制品创建、文件编辑、技能和连接器对应的成本。Claude Code 管理控制台新增“使用量”和“价值”选项卡,分别显示活跃开发者、会话次数、常用命令,以及生产力提升估算、每次提交成本和年度价值估算。分析聊天支持自然语言查询并返回可导出图表。Analytics API 可将数据接入 Datadog Cloud Cost Management 和 CloudZero。管理员可设置模型默认和权限控制,并配置组织级支出限额的 75%、90% 告警通知;用户在 75% 和 95% 时收到应用内提醒。… 来源:Claude:Blog(网页)

前沿研究

1. 半导体先进封装取得突破

半导体先进封装取得突破。 英特尔在大会展示 EMIB-T 全新架构。三星也发布了 混合键合 芯片温控数据。台积电与微软 ✨ 联合推出液冷方案。大家可通过 硬件报告 掌握详情。先进半导体技术 (๑•̀ㅂ•́) 助推算力升级。 来源:硬件报告

AI资讯:台积电与微软联合研发的芯片液体冷却管道结构图

2. 大模型自适应思考新框架

大模型自适应思考新框架。 研究团队提出 CAT 推理控制新方法。系统可依据问题难度 💡 调整生成长度。新方案能够 (•̀ᴗ•́) 平衡推理的延迟时间。开发者可 阅读思考控制论文 了解具体推导。优化策略将降低大模型推理的资源损耗。 来源:阅读思考控制论文

3. 前沿大模型 Seed2.0 论文发布

前沿大模型 Seed2.0 论文发布。 字节跳动正式发布 Seed2.0 最新报告。团队通过前瞻性指标 ⚡ 深度优化模型。该作重点提升了 指令遵循 的准确度。大家能 在线阅读技术报告 体验强悍推理。强大学习能力 (o_O) 帮助解决复杂现实任务。 来源:在线阅读技术报告

4. 科学智能自我进化框架

科学智能自我进化框架。 框架支持智能体持续自我进化。开发者只需 💡 百行代码 即可完成部署。框架在多项基准测试中 (^_^) 表现极佳。读者能 访问科学智能论文 获取开源代码。自动化科学研究未来将迎来快速发展。 来源:访问科学智能论文

5. 具身智能自主控制成果

具身智能自主控制成果。 智能系统 ASPIRE 具备动作探索能力。机器人 🤖 在家务操作中成功率提升三成。新算法实现了 零样本迁移 至真实世界。详情可 阅读具身智能论文 获得第一手资料。机器人编程门槛 (✿◡‿◡) 将会大幅降低。 来源:阅读具身智能论文

6. 多智能体团队阻碍专家发挥

在自我组织的多智能体 LLM 系统中,团队无法有效利用专家成员的专业知识。在多个基准测试中,即使明确告知专家身份,团队表现仍落后于最佳成员(专家智能体)的独立能力,性能损失最高达 41.1%。失败主因是未能有效利用专家意见,而非识别专家。对话分析显示,团队倾向于“整合性妥协”——平均化专家与非专家观点,随团队规模增大而加剧,且与表现负相关。这种寻求共识的行为同时提升了对抗恶意智能体的鲁棒性,揭示了协同对齐与专业利用之间的根本性权衡。 来源:Apple Machine Learning Research(RSS)

7. RL 微调 VLM 的鲁棒性与思维链一致性研究

强化学习(RL)微调被扩展至视觉语言模型(VLM)。研究发现,简单的文本扰动——误导性标题或错误思维链(CoT)——会显著降低模型鲁棒性和置信度,且开源模型衰退更明显。闭源模型呈现类似失败模式,但鲁棒性和推理一致性更强。进一步分析揭示准确性与忠实性的权衡:微调提升基准准确率,但同时侵蚀 CoT 的可靠性及对上下文变化的鲁棒性;对抗性增强可改善鲁棒性,却无法阻止忠实性漂移。引入忠实性感知奖励能恢复答案与推理的对齐,但与增强结合时训练易崩溃到捷径策略。这些发现强调需联合关注正确性、鲁棒性与视觉推理的忠实性。 来源:Apple Machine Learning Research(RSS)

8. VideoFlexTok:可变长度粗到细视频分词

VideoFlexTok 提出一种可变长度 token 序列的视频表示方法,采用粗到细结构——首个 token 捕捉语义和运动等抽象信息,后续 token 添加精细细节,生成流解码器支持任意 token 数量的视频重建。相比传统 3D 网格分词,该结构允许根据下游需求调整 token 数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok 以 1.1B 参数(5.2B 的 1/5)达到可比生成质量(gFVD 和 ViCLIP Score)。训练一个处理 10 秒 81 帧视频的文本到视频模型仅需 672 个 token,比同等 3D 网格分词器少 8 倍。 来源:Apple Machine Learning Research(RSS)

行业、政策与安全

1. OpenAI 计划向美政府赠股

OpenAI 计划向美政府赠股。 OpenAI 提议向美国政府转让 股份。新政府 😲 可能获得 5%股权 引人关注。团队积极 深化政企合作 以缓解监管压力。此番举措或将 (⊙_⊙) 重塑未来技术监管版图。业内人士正在紧密跟踪此事件的进展。 来源:深化政企合作

2. 中国低价模型赶超西方巨头

中国低价模型赶超西方巨头。 国内研究团队研发出全新 低成本模型。该产品的综合性能正在 😮 逼近行业前列。文章在 分析观察 阐述了其开发成本。未来全球竞争格局 (─.─||) 将迎来重大改变。高性价比模型将为众多企业提供新选择。 来源:分析观察

3. 竞品红队安全评估陷入争议

竞品红队安全评估陷入争议。 团队假扮青少年 🤐 开展竞品安全测试。他们专门针对 极端话题 开展红队测试。这种极端手段 (⊙_⊙) 让安全评估陷入争议。 查看安全评估讨论 了解红队安全基准。业界呼吁尽快建立公正规范的评估机制。 来源:查看安全评估讨论

4. 花旗、Adobe 等企业限制员工使用 AI 旗舰模型以控制成本

据 404 Media 获取的内部资料,Atlassian、Adobe、亚马逊等六家企业正限制员工使用 AI 工具,要求改用能力较低的大模型避免成本失控。至少一家企业月度 AI 开销增至三倍,超 1500 万美元。花旗银行因 GitHub 改为按量计费,于 6 月 24 日禁用 Claude Opus 4.6、4.7 及 GPT-5.5 等旗舰模型。Adobe 于 6 月 30 日终止 Claude 无限制使用协议。Atlassian 数据显示其 AI 月支出从 500 万美元飙升至 1500 万美元,本财年预计超 1.2 亿美元。GitHub 计划改用开源模型并测试单人按量计费模式。 来源:IT 之家(RSS)

5. 快手可灵 AI 获初始投资者 20.28 亿美元注资,投后估值 180 亿美元

快手在港交所公告,21 名初始投资者同意以 138.24 亿元人民币(20.28 亿美元)现金注资北京可灵,后者将持有可灵 AI 相关资产。同日 15 名额外投资者追加出资 52.235 亿元人民币(7.6639 亿美元),认购总上限为 204.471 亿元(30 亿美元),对应北京可灵扩大后注册资本的 16.67%。投后估值 180 亿美元。快手预计未来 12 个月内启动可灵 AI 赴港上市,募资用于扩充算力、建设数据中心及人才引进。 来源:IT 之家(RSS)

6. 谷歌 AI 建设导致 2025 年用电量增长 37%

2025 年,谷歌年度用电量同比上涨 37%,创历史最大增幅。数据中心全年消耗超 4200 万兆瓦时,超过新西兰、丹麦、尼日利亚等国总用电量。自 2019 年以来,谷歌总用电量已增长超 250%。用电激增主要来自 Google Cloud、YouTube 视频流及支撑 AI 产品和服务的数据中心建设与运营。公司表示,AI 基础设施建设速度超过电网脱碳速度,但仍致力于扩大全球清洁电力规模,并通过技术创新降低运营排放。2024 年谷歌用电量增幅为 27%。 来源:Ars Technica:AI(RSS)

开源与开发者工具

1. 多模态检索工具开源发布

多模态检索工具开源发布。 团队发布了 RAG 多模态检索流水线。用户可通过 工具包 跑通流程。该项目 ✨ 能够高效处理文本和图像数据。系统凭借 ⭐21.9k 标星引起广泛关注。这种混合检索方案 💡 明显提升了检索精度。 来源:工具包

AI资讯:Colab多模态数据检索系统的架构流程示意图

2. 阿里开源网页端智能体助手

阿里开源网页端智能体助手。 团队发布了 Page Agent 网页代理。它能摆脱 (︶^︶) 无头浏览器 独立运行。开发者可 下载阿里网页代理 进行网页开发。项目通过 DOM 脱水 ✨ 处理技术读取数据。阿里新工具已在社区斩获了 ⭐21k 好评。 来源:下载阿里网页代理

3. 智能体交互系统开源发布

智能体交互系统开源发布。 多数智能体由于缺少 直观界面 饱受诟病。Row-Bot 开源项目 ⊙﹏⊙ 旨在解决此痛点。 查看智能体交互项目 可以直观掌握系统原理。项目目前已获得 ⭐1.3k 社区开发者标星。无感交互设计能 ✨ 有效重建人机信任机制。 来源:查看智能体交互项目

AI资讯:用户对Row-Bot智能体人机交互界面痛点分析流程图

社媒与观点

1. 少年开发多模型辩论平台

少年开发多模型辩论平台。 单一模型在交流中 🧐 经常盲目迎合人类观点。十六岁少年为此开发了 Wartable 辩论平台。主流模型在平台中 (•̀ᴗ•́) 将展开激烈辩论。大家可以通过 访问辩论平台 感受思维碰撞。该项目目前支持五款最先进的模型。 来源:访问辩论平台

2. 千问团队朱达:C 端 Agent Harness 的“多快好省”工程哲学与主动服务探索

千问团队 2026 年 1 月上线通用复杂任务 Agent(千问 App 胶囊入口),总结“多快好省”方法论:支持信息搜集、研究分析等任务;执行时间降至初始 1/3;通过搜索范式与上下文管理优化交付质量;Token 消耗仅为海外产品 1/10。团队探索从被动响应转向主动服务,构建 User Memory、Environment、Task System、Assistant 四大组件,指出“情商”是主动服务最难环节。朱达提出 Agent 工程从 Prompt Engineering 演进至 Harness Engineering,下一站是 A IWare Engineering,强调“低功耗,够用就行”。 来源:公众号:千问 APP(阿里)

3. Agent 辅助的 SGLang 开发:初步探索

SGLang 团队将 LLM 服务、分布式运行时、GPU 内核、扩散管道等工作流编码为可执行的 SKILL.md 文件、脚本、基准合约和审查循环。现有技能包括:SGLang .claude/skills(CUDA 调试、内核集成、性能分析等)、SGLang diffusion .claude/skills(扩散模型添加与调优)、BBuf/AI-Infra-Auto-Driven-SKILLS(跨框架 SOTA 循环)、KDA(MLSys 2026 FlashInfer 内核竞赛获胜方案)以及 BBuf/KDA-Pilot(已合并三个 SGLang 集成 PR)。Profile 证据是性能工作的核心,长期优化转向 Loop Engineering——SGLang S… 来源:LMSYS:Blog(Chatbot Arena 团队)

快讯

  • 克劳德模型修复受损存档:克劳德模型修复受损存档。 玩家的 艾尔登法环 存档由于断电损坏。他尝试 🛠️ 使用多种修复软件都没能成功解决。玩家通过 智能模型工具 重构了二进制数据。新一代克劳德 (๑•̀ 量•́) 完美补全了文件结构。修复后的游戏存档得以重新顺利载入。 来源:智能模型工具
  • 克劳德模型推理成本热议:克劳德模型推理成本热议。 评测平台发现 Opus 的性价比再次显现。它在长任务中 🧐 性能和使用价格双优。新模型 Sonnet 5 步骤繁多导致成本飙升。用户可 访问讨论专区 获取对比详情。专家 (:з 选) 更加推荐开发者选用经典版本。 来源:访问讨论专区
  • 克劳德代码使用提效指南:克劳德代码使用提效指南。 网友在社区分享了 Fable 模型使用秘籍。该服务将在 七月七日 截止体验期限。合理使用子代理 (๑•̀ㅂ•́) 可节省 token 消耗。离线时可通过 提效指南 生成文档。新策略能有效防止重复缓存产生的 Token 损耗。 来源:提效指南
  • Fable 5 在 RLI 基准中达成 16.1% 自动化率,较八个月前提升六倍:Remote Labor Index(RLI)衡量 AI 智能体完成 240 个付费自由职业项目(总值 14.4 万美元)的专业质量比例。最新结果显示,Fable 5 自动化率达 16.1%,是八个月前最佳系统 2.5% 的六倍多,也超过 Opus 4.8(8.3%)和 GPT-5.5(6.3%)。因美国政府限制访问,Fable 5 仅完成 218/240 个项目评估,最坏情况仍达 14.6%。Gemini 3 Pro 仅 1.25%,落后于更老模型。AI 裁判会高估模型表现(GPT-5.5 评分偏高近三倍),仍需人类评估员打开专业软件(如 Blender)检验几何模型等细节。测试环境为虚拟 Linux 机,配备 30 余款专业应用… 来源:The Decoder:AI News(RSS)
  • 借用夜晚:将闲置推理 GPU 回收用于研究:Runway 开发了名为 deckard 的容量控制器,在生产推理集群与研究集群间动态重分配 GPU。生产流量在北美工作日上午 9 点 ET 达峰,晚 8 点 ET 跌至不足一半。控制器基于预计算的时间窗口(如工作日 8:30–12:30 ET 高峰子窗口)提前扩容和回收,每次集群间转移耗时 20–60 分钟。利用排队论(Erlang‑C、Little's Law)确定目标利用率,避免接近 85% 后的队列发散(90% 利用率下等待时间约为服务时间的 10 倍)。此方案使夜间闲置 GPU 回归研究、白天排队等待缩短。 来源:Runway:News(网页)

今日总结与启示

  • 模型与产品更新继续升温。 Meta 推出 AI 社交应用 Pocket 是今天最值得跟进的信号之一,后续要看能力是否能稳定进入真实工作流 🚀。
  • 前沿研究继续升温。 半导体先进封装取得突破 是今天最值得跟进的信号之一,后续要看能力是否能稳定进入真实工作流 🧠。
  • 行业、政策与安全继续升温。 OpenAI 计划向美政府赠股 是今天最值得跟进的信号之一,后续要看能力是否能稳定进入真实工作流 🔒。
  • 开源与开发者工具继续升温。 多模态检索工具开源发布 是今天最值得跟进的信号之一,后续要看能力是否能稳定进入真实工作流 🛠️。
  • 社媒与观点继续升温。 少年开发多模型辩论平台 是今天最值得跟进的信号之一,后续要看能力是否能稳定进入真实工作流 ( •̀ ω •́ )。