今日主题:OpenAI 双 API 齐发、DeepSeek 新模型上线,AI 语音与 Agent 竞争白热化

本期概览:今日 AI 领域迎来多款重磅发布:OpenAI 将 GPT-Live-1 语音模型引入 API、推出 Agents API,并在 ChatGPT Work 上线 Data Agent,同时因 Astra 需求暂停 Pro 订阅;DeepSeek 正式发布 V4.1-Flash,以全新架构将 KV 缓存成本大幅压缩。学界围绕 OpenAI 的 Navier-Stokes 解法爆发信任争议,Anthropic 则披露中国公司蒸馏攻击。国内方面,工信部印发“AI+软件”专项行动方案,微信测试 AI 社交,高德发布 3D 城市世界模型。产业侧,Shopify 因 AI Agent 的能力而回归原生开发,环球音乐与 ElevenLabs 合作开放曲库生成 AI 音乐。安全与研究层面,WeWorm 展示 AI 驱动的零点击蠕虫,多项 arXiv 工作聚焦世界模型与跨设备 GUI 智能体。

本期精选 27 条 · 国内 12 / 国际 14

模型发布

1. DeepSeek 正式发布 V4.1-Flash,KV 缓存成本大幅压缩

DeepSeek 正式发布 V4.1-Flash,一款 552B 参数的 MoE 多模态模型,采用全新 Causal-Encoder-Decoder 架构与 CSA2 压缩稀疏注意力,将 KV 缓存内存需求降至上一代的 1/4、SSD 需求降至 1/8。模型在 Agentic Benchmark 等测试中超越 V4 Pro 等旗舰,输入激活仅 8B、输出激活 16B,并以 MIT 许可开源。新定价闲时输入(缓存命中)0.02 元/百万 token,输出 4 元。

算力硬件

1. 高通预告新一代骁龙旗舰芯片:NPU 与 MoE 架构全面面向智能体

高通预告新一代骁龙旗舰移动平台将采用多项面向 AI 智能体的硬核升级:新 Hexagon NPU 引入 Element Accelerator 和更大共享内存,专为 Transformer 工作负载打造;与头部内存和模型厂商合作引入 MoE 架构,300 亿参数模型每次仅激活约 30 亿参数,以低功耗实现更大模型级 AI 体验。

2. d-Matrix 采用 NVIDIA NVLink Fusion 部署机架级 XPU

AI 推理芯片公司 d-Matrix 宣布将采用 NVIDIA NVLink Fusion 连接其下一代 Raptor XPU 到 NVIDIA AI 基础设施平台,加入 NVIDIA MGX 机架架构生态。此举表明更多推理芯片厂商正围绕 NVIDIA 互联生态构建系统。

产品应用

1. OpenAI 将 GPT-Live-1 全双工语音模型引入 API

OpenAI 正式将 GPT-Live-1 引入 API,开发者可构建支持全双工实时语音交互的应用,模型能同时听和说,并处理打断、停顿与背景噪声,还支持电话场景与工具调用。前端语音层定价每分钟 0.05 美元,评测显示其在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 个百分点。语言学习平台 Speak 使用后误打断次数减少近 80%。

2. OpenAI 推出 Agents API,托管式云端智能体开发

OpenAI 推出 Agents API,让开发者用 Codex harness 构建并运行云端智能体,由 OpenAI 全托管。该 API 管理上下文、高效使用工具并协调子智能体,基础设施支持数天稳定运行,可处理文件、运行代码并保存中间结果。

3. 微信小范围测试“小微 AI 社交”,AI 代理开始代表用户沟通

微信开始小范围测试“小微 AI 社交”功能:用户把诉求告诉自己的小微,小微找到对方的小微说明话题并请求授权,两个 AI 先行交流,遇到需确认处再回来提醒主人。该功能让社交平台连接对象从“人和人”扩展为“人的代理与人的代理”,被视为微信基于 14.39 亿月活熟人关系链布局 Agent 的早期实验。

4. OpenAI 推出 Data Agent:对话即可让公司数据变成答案与仪表盘

OpenAI 在 ChatGPT Work 推出新的 Data Agent,用户用自然语言提问,即可将公司数据转化为答案、交互式仪表盘与可行动建议。面向销售下滑归因、支出增长定位、客户续约风险等常见业务问题,把原本需要等待报告或人工分析的流程变成即时对话式结果。

5. AWS SageMaker 推出前缀感知路由,LLM 首 token 延迟降低 77%

Amazon SageMaker Inference 推出前缀感知路由,将共享相同提示前缀的请求发送到同一实例以保持 KV 缓存热度。在 Llama 3.1 70B 基准测试中,P50 首 token 延迟降低最多 77%,KV 缓存命中率从约 25% 提升至 80% 以上。

6. 高德发布 3D 原生城市世界模型 ABot-Earth 0.7

高德发布新一代 3D 原生城市世界模型 ABot-Earth 0.7,可从一张卫星图或文字出发,在单块消费级 GPU 上约 10 分钟生成公里级 3D 城市场景,效率提升 1000 倍,覆盖 196 个国家和地区。模型已用于飞行街景 2.0、导航 Live、避雷指南等 AI 服务。

7. 蚂蚁数科推出 Agentar 金融版,预置十大金融智能体专家团

蚂蚁数科在外滩大会推出 Agentar 金融版,预置十大金融智能体专家团,覆盖智能投顾、财富管理、客户经营等场景,提供 2000 余项金融专属评测工具。实际应用中,数字客户经理帮助试点客群客户总资产提升 10%、活跃度提升 15%、服务客户数提升 5 倍以上。

研究论文

1. Calif Research 演示首个微信零点击蠕虫 WeWorm,AI 大幅降低攻击门槛

安全研究团队 Calif Research 发布 WeWorm 演示,称这是首个通过微信通话在 iOS 和 Android 间传播的零点击蠕虫,受害者无需接听或操作手机即可中招。团队借助 AI 约两天找到漏洞并写出首个 RCE 利用,再用一周构建蠕虫,展示 AI 大幅降低高级攻击门槛。

2. HSImul3R:首个可仿真的人-场景交互重建框架被 ECCV 2026 接收

大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布 HSImul3R,首个面向非标定稀疏视角输入、实现稳定可仿真人-场景交互重建的框架,已被 ECCV 2026 接收。在 Easy/Medium/Hard 三档任务中交互稳定率分别达 53.68%、30.56%、13.92%,显著高于基线,并将三维穿模率从 69.51% 降至 22.90%。

3. arXiv 论文提出 JarvisGUI:跨设备 GUI 智能体动态基准

arXiv 论文提出 JarvisGUI,一个跨设备 GUI 智能体动态基准,评估在 Android、Windows、Ubuntu 间协调交互的工作流。结果显示 SOTA 开源 GUI 智能体在状态迁移感知、跨平台上下文推理和长程依赖管理上存在明显短板,暴露了现有单设备基准无法覆盖的能力缺口。

4. arXiv 论文提出 Programmable World Model,可编程世界状态与视觉生成解耦

arXiv 论文提出 Programmable World Model 框架,将世界状态演化与视觉生成解耦:智能体把自然语言指令翻译成可执行程序,指定实体状态与转换规则,由轻量引擎维护显式持久全局状态。在 CombatStateBench 上实现 94% 计数准确率和 98% 状态准确率,显著优于现有交互式视频世界模型。

开源工具

1. vLLM 引入分层 KV 缓存卸载,提升长上下文服务容量

vLLM 博客介绍分层 KV 缓存卸载(Tiered KV Cache Offloading):当加速器内存填满时,被驱逐的 KV 数据保留在主机内存、存储和远程节点中,下次请求时从低层重载而非重新计算,节省算力、降低延迟并提升集群有效服务容量。

行业动态

1. OpenAI 因 Astra 需求旺盛暂停 Pro 订阅

由于 GPT-6 Astra 需求旺盛,OpenAI 暂时暂停其每月 200 美元的 Pro 计划订阅,理由是基础设施承压。这反映出 Astra 发布后用户涌入对 OpenAI 算力供给造成的压力。

2. Anthropic 报告指控阿里、月之暗面、DeepSeek 持续蒸馏其模型

Anthropic 发布新报告,指控阿里巴巴、月之暗面、DeepSeek 等中国 AI 公司持续进行模型蒸馏攻击,且近几个月随着竞争加剧而升级。该报告是 Anthropic 首次系统披露此类攻击细节,凸显中美 AI 竞争在模型安全层面的紧张态势。

3. Meta 的 AI 智能体 Muse 上线数日成为美国 App 第二

Meta 周二推出的 AI 智能体应用 Muse 已成为美国 App Store 第二,早期数据显示其在目标市场受欢迎。Muse 可通过 WhatsApp 订旅行、购物、发邮件,支付功能走 Stripe Link,另有 Sentinel 安全代理监控每次操作。

4. 环球音乐与 ElevenLabs 合作推出 AI 音乐平台

环球音乐集团(UMG)宣布与 ElevenLabs 达成多年期授权协议,推出 AI 音乐平台,用户可基于其授权曲库对歌曲进行混音、拼接与再创作。这是主流唱片公司首次大规模向 AI 音乐工具开放曲库,显示音乐行业开始从对抗转向以授权方式拥抱 AI 生成内容。

5. Nvidia 与 Palantir 合作以 AI 管理供应链,首个目标为 Nvidia 自身

Nvidia 与 Palantir 合作用 AI 管理供应链,首个部署目标是 Nvidia 自己的供应链——涵盖数百万零部件、数千供应商。据 Nvidia 称,单个 Vera Rubin 机架包含 130 万个组件,凸显超大规模 AI 硬件供应链的复杂度。

6. Shopify 从 React Native 回归原生:AI Agent 改变跨平台技术决策

Shopify 宣布将移动应用从 React Native 迁移回独立的 Swift 与 Kotlin 原生代码库。核心原因在于 AI Agent 已能承担足够的实现、翻译、测试与审查工作,使跨平台框架省去双份开发成本的优势不再是决定性因素。这被视为 AI 开始实质性影响大型公司技术架构取舍的标志性案例。

7. 京东物流推出“超脑 3.0”大模型群与“狼族”机器人集群

京东物流推出软硬协同的工业级 AI 系统,以“超脑 3.0”大模型群驱动“狼族”机器人集群,覆盖全链路物流场景,突破非标件处理瓶颈。“狼族”机器人在拣选、理货等柔性环节成本低于人工,异狼等产品已越过单位经济模型转正门槛,3 年回本可商业化验证。

8. Clearview AI 测试新工具,可帮警方挖掘目标人物网络足迹

面部识别公司 Clearview AI 正在测试一款 AI 工具,可帮助执法部门挖掘目标人物的网络足迹——他们是谁、认识谁、住在哪里、在网上留下什么。该公司 2020 年曾因抓取 30 亿张照片而声名狼藉,此举再度引发隐私担忧。

政策观点

1. 工信部印发《“人工智能+软件”专项行动实施方案》

工信部印发《“人工智能+软件”专项行动实施方案》,提出到 2028 年培育一批高水平智能编程工具和智能开发平台,推广应用覆盖 2 万家规模以上软件企业,打造 100 个智能体软件标杆应用,孵化 5 个以上优质开源项目;到 2030 年关键软件全面实现智能化升级。

2. OpenAI 宣称解决 Navier-Stokes 难题,学界质疑其利用未发表成果

OpenAI 宣称动用约 1 万个 AI 智能体攻坚 88 小时,于 9 月 5 日发现 Navier-Stokes 方程失效特例,若获确认将是 AI 首次解决重大数学难题。但纽约大学数学家 Tristan Buckmaster 公开质疑 OpenAI 利用了其未发表成果,第二位数学家也指控 OpenAI 行为不诚实、缺乏透明度,引发学界对 AI 公司使用未公开研究的信任危机。

3. OpenAI 与美国 GSA 达成协议,为各级政府提供免费 AI 访问

OpenAI for Government 与美国总务管理局(GSA)达成多年期协议,为联邦、州、地方和部落政府提供免费访问(正常每月 15 美元/用户)及 50% 使用费折扣,并扩大对公共部门网络防御者的支持。

4. 王坚外滩大会演讲:AI 应帮助人类用更少资源活得更好

之江实验室主任、阿里云创始人王坚在外滩大会演讲中提出,AI 应帮助人类用更少资源生活得更好,重提“城市大脑之问”:能否只用 10% 的资源就活得很好。他认为数据是数字时代的自然资源,AI 是善用数据的关键工具,呼吁年轻人去做“并非理所当然的 AI”。


本文由 AI225 AI 日报 自动聚合整理,共收录 27 条 AI 领域动态。内容基于公开信息进行 AI 摘要与归纳,可能存在疏漏或偏差,仅供参考。完整内容及相关来源请访问:
https://daily.ai225.com/daily/2026-09-11

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐