AI 新闻日报 2026-10-01:OpenAI 把 ChatGPT 变成智能体平台,VS Code 上线多模型编排,国产算力补到内核层
主题: 平台化与自主化同时推进,编码智能体从"单点工具"走向"平台入口",具身智能从"本体竞赛"转向"神经系统与大脑的国产化"
编制时间: 2026-10-01
本期看点: OpenAI 把 ChatGPT 升级为智能体平台 / VS Code 让多模型编排成为编辑器标配 / DeepSeek 与华为把国产算力软件栈补到内核层
一、要闻速览
| 序号 | 事件 | 标签 | 关键词 |
|---|---|---|---|
| 1 | OpenAI DevDay 2026 发布常驻智能体 dots 与 GPT-6.1 Sol | 平台 | 常驻智能体 / 云端电脑 / 五分之一价格 |
| 2 | VS Code 1.140 发布,Copilot harness 转正并上线 HydraFusion | 工具链 | Agent Host / 多模型编排 / 企业管控 |
| 3 | DeepSeek 开源昇腾六件套,TileLang 正面对标 CUDA | 国产算力 | 内核 / 128 卡超节点 / 95% 利用率 |
| 4 | 华为鲲鹏 DevKit 升级为 DevKit AI,走向 Agent 驱动开发 | 国产工具链 | 领域知识库 / 原子能力 / 意图编排 |
| 5 | Google 发布 Gemini 4 Argon,单次输出上限拉到 100 万 token | 模型 | 长周期工程 / 网络安全 / 分阶段开放 |
| 6 | IDC 半年报:全球人形机器人出货近 2.5 万台 | 产业数据 | 中国占 77.9% / 智元断层第一 / 场景结构变化 |
| 7 | 逐际动力联合东土科技发布全国产电子架构人形机器人 | 底层技术 | 国产"神经系统" / 确定性总线 / 整机落地 |
| 8 | 德塔智能发布原生人形基础模型 Delta-0 | 具身大脑 | 大脑-小脑-力位 / 210 秒 32 步 / 长程家务 |
| 9 | 上海润科具能"半人马"轮足复合机器人入选上海设计 100+ | 特种作业 | 人形双臂+四轮足 / 消防百台意向订单 |
| 10 | 新加坡 HTX 启用 2.9 万平方英尺人形机器人中心 H2RC | 海外 | 公共安全 / GB300 算力 / 政企合作 |
二、AI Coding 深度动态

1. OpenAI DevDay 2026:ChatGPT 从"应用"改造成"智能体平台"
OpenAI 在 9 月 29 日的 DevDay 上一口气发布了 20 余项更新,主线不是某一款模型有多聪明,而是把 ChatGPT 本身改造成承载智能体的平台。
最受关注的是常驻智能体 dots。每个 dot 拥有独立的云端计算环境和浏览器,可以跨 4000 多个应用持续执行任务,并接入 Slack、Teams 等工作场景。它由 GPT-6 Astra 驱动,能处理周期性工作、跟进未完成任务、把部分子任务分派给下级智能体。用户可以设定规则与权限,比如某些动作必须人工确认。配套发布的 ChatGPT Space 把用户、团队与智能体放进同一个工作空间,Living Pages 则允许人和 AI 共同维护一份会随项目演进的文档。
模型侧发布 GPT-6.1 Sol:105 万 token 上下文、最高 12.8 万 token 输出、API 定价每百万 token 输入 2 美元/输出 10 美元,缓存输入降到 0.1 美元。官方称其在编码与 computer use 等任务上接近 GPT-6 Astra,但标准价格只有后者的约五分之一。开发者侧还补齐了 Codex Cloud(任务在隔离云环境中运行,电脑休眠也不中断)、Agents API(新增 computer use 与多智能体编排)、Decisions API 以及 Codex Security Cloud。
为什么值得关注: 这次发布里没有"最聪明的模型"这类卖点,取而代之的是账号体系(Sign in with ChatGPT)、分发体系(Marketplace)和协作体系。它说明头部厂商的竞争重心已经从"模型跑分"转移到"相近能力下谁更便宜、谁更适合被长期调用"。对国内厂商而言,这一轮比拼的其实是平台组织能力,而不是单点模型的领先幅度。
2. VS Code 1.140:多模型编排从实验品变成编辑器标配
微软在 9 月 30 日发布 Visual Studio Code 1.140,把两件此前处于预览状态的能力推到了稳定版。
第一件是 Copilot harness 转正。它运行在独立的 Agent Host 进程上,基于 Agent Host Protocol(AHP),因此一次会话可以在多个 VS Code 窗口之间共享。关掉窗口、过一周再打开,任务仍能接着做。由于底层是 Copilot SDK,它的行为与独立 Copilot 应用、Copilot CLI 保持一致。
第二件是 HydraFusion 多模型编排(研究预览)。它把"选哪个模型"当成优化问题:读取推理、代码生成、调试、工具调用等能力信号,选择复杂度最低且能过质量线的流程。它有三种路由:Single(单模型直接做)、Cascade(轻量模型起草,质量门决定是否升级到更强模型)、Critique(一个模型起草,另一个模型族的只读评审员审阅,起草模型再改一轮)。同时发布的还有面向 IT 部门的管控能力:最低版本要求提示、Auto 模型默认档位、以及用 OpenTelemetry 把 Copilot 用量归属到具体开发者。
为什么值得关注: "多模型互评"此前多是研究项目或第三方工具的玩法,如今被写进主流编辑器,意味着它开始进入日常工程流程。另一层意义是治理:当智能体能跑多模型、多轮次时,成本、可观测性与权限归属会立刻变成企业管理问题,而这次更新里治理部分的分量并不比功能轻。
3. DeepSeek 开源昇腾六件套:国产算力补到"内核层"
DeepSeek 在 9 月 30 日通过官方微信公众号宣布,为华为昇腾平台开源六个软件模块:TileLang、DeepGEMM-Ascend、DeepEP-Ascend、TileKernels、FlashMLA、DeepSelect,覆盖编程语言、核心计算内核与分布式通信。两家还联合优化了一套基于 128 颗昇腾 950 的"超节点"方案,在计算与数据搬运之间做平衡。
其中分量最重的是 TileLang,也就是 DeepSeek 自研的高层编程语言,此前主要面向英伟达后端,这次正式支持昇腾 950,提供原生代码生成、自动调度与同步。DeepSeek 把它定位为 CUDA 的替代方案,称其"编程模型更简单"。公开的内测数据显示,部分内核在昇腾 950DT 上达到标称硬件上限的高比例:BF16 稠密矩阵乘达到 99.8%,FP8 约 99.5%;面向 DeepSeek V4.1 的稀疏注意力实现在 prefill 阶段达到 410 TFLOPS,约为理论值的 95%。可移植性也是重点:TileKernels 可自动选择英伟达或华为后端而暴露同一套 Python API。
为什么值得关注: 这是把国产算力从"能跑模型"推进到"能高效写内核"的一步。要绕开 CUDA 近二十年的工具与库积累,光有芯片不够,还得有让开发者愿意用的编程抽象。DeepSeek 的路径不是自建封闭栈,而是复用此前为英伟达开发的开源组件、再做可移植适配,这种做法对生态的迁移成本更友好。需要保留判断的是:CUDA 的广度远不止几个内核,能否真正撼动开发者习惯,目前还没有答案。
4. 华为鲲鹏 DevKit AI:把"专家经验"封装成可被智能体调用的能力
在华为全联接大会 2026 的鲲鹏计算产业峰会上,华为把鲲鹏 DevKit 升级为 DevKit AI,开发范式从"人工查文档、手动调工具"转向"自然语言描述意图、智能体自动编排执行"。
华为给出的问题诊断很具体:通用大模型在通用代码上很强,但缺乏对硬件指令集、微架构、加速库的深度理解,容易出现语法正确但违背最佳实践的建议;迁移与调优所需的专家经验散落在工具、文档与个人经验里,通用模型无法精准调用;此外通用智能体常盲目扫描整个代码库,token 消耗高而定位不准。DevKit AI 的思路是把鲲鹏专家经验固化成知识库、把散落工具封装成可被 AI 调用的原子能力,让开发者像对话一样表达"我要做什么"。
为什么值得关注: 这条动态代表了一类正在成形的路线:垂直领域 AI 编程工具不必去比通用模型的代码生成能力,而是比"领域知识封装得够不够好"。对开发者来说,评估这类工具的核心指标也会变化:不再只看生成的代码能不能跑,而要看它是否真正理解特定架构的约束。
5. Google Gemini 4 Argon:把单次输出上限推到 100 万 token
Google DeepMind 在 9 月 30 日发布 Gemini 4 Argon,定位为长周期软件工程、企业知识工作与网络安全防御。最直接的技术变化是输出上限:从此前 Gemini 系列的 6.4 万 token 提到约 100 万 token,单次响应即可承载大型代码迁移这类超长任务。
官方公布的基准中,Argon 在 DeepSWE v1.1 上得 77.9%,高于 Claude Opus 5.5 的 74.2% 与 GPT-6 Astra 的 74.1%;Zapier 的 AutomationBench 以 51.3% 排名第一;LVBench 长视频理解 91.7%;漏洞修复基准 CWE-bench v1 以 68% 并列第一。Google 还给出了内部使用数据:一组 Argon 智能体分析全公司数据中心的性能数据并自主应用内存优化,全面铺开后释放超过 300 TiB 内存;它被用于把 C/C++ 代码库迁移到 Rust,涉及 Fuchsia OS 的 Zircon 内核等超过 80 万行项目;在 libgav1 上替换了 3.2 万行 SIMD 代码,得到一个内存安全且比原 Rust 移植版快 2.7 倍的解码器。
发布是分阶段的:先通过 Fairwind 计划面向可信网络安全防御者开放(这部分不带网络护栏),付费 API 客户与 Google AI Ultra 订阅用户随后获得访问权。引导价每百万 token 输入 2 美元、输出 10 美元。Google 同时披露了发布前的安全措施,包括监控模型内部激活以识别滥用风险、强化对间接提示注入的抵抗力,以及对思维链与动作做失配监控。
为什么值得关注: 两点值得单独拎出来。一是输出长度成为新的竞争维度:当一次能写几十万 token,很多原本要"切块再拼接"的工程流程会被重写。二是分阶段开放这件事本身是信号:同一家实验室在八天前刚披露过测试事故,如今对最强能力的投放明显更谨慎。能力越强、越贴近真实系统,谁先拿到、怎么拿到,会越来越像政策问题而不是技术问题。
三、具身智能深度动态

6. IDC 半年报:全球人形机器人出货近 2.5 万台,中国占 77.9%
IDC 在 9 月 30 日发布的全球人形机器人跟踪报告显示,2026 年上半年全球出货量接近 2.5 万台,同比增长 432.1%;中国市场出货超过 1.9 万台,占全球约 77.9%,中国厂商出货量占全球 95% 以上。
厂商层面,智元位居第一,上半年出货超过 8600 台,占全球约 35%、中国市场 45% 以上,官方称在高基数下保持十倍级增长,是"量产交付与商业化营收双料第一"。宇树约 5000 台排第二,加速进化第三;优必选、星动纪元等增速较高,但出货基数与头部仍有差距。应用结构也在变:科研教育、表演展示与政府数据采集中心合计占比,从 2025 年全年的 83.8% 降至今年上半年的 69%,工业制造、零售、交通物流、休闲旅游开始贡献更多出货,消费级小型人形也已进入市场。IDC 预测 2030 年全球出货量将突破 75 万台。
为什么值得关注: 这份报告的价值不只是"涨了多少",而是它给出了行业竞争重心迁移的判断:正从"硬件能力竞争"转向"具身智能综合能力竞争",即对物理世界的理解、任务规划、操作执行与持续学习。同时要留一分清醒:报告中的厂商出货与营收数据部分来自厂商提供,口径与其他机构统计存在差异,读的时候需要交叉比对。
7. 逐际动力 × 东土科技:全国产电子架构首次进入人形机器人整机
9 月 28 日,在湖北宜昌举行的 2026 国产化电子架构具身智能机器人发布会上,深圳的逐际动力联合东土科技发布了全国首个搭载国产电子架构的人形机器人。这是一次"整机系统级"的替换,而非单颗芯片或单个模块的国产化。
分工上,逐际动力提供本体硬件原创设计与制造、大小脑融合技术以及人形大脑系统 COSA,作为整机验证平台;东土科技输出全国产底层电子架构,包含鸿道 Intewell 工业操作系统、基于 TSN 的确定性总线 AUTBUS、智能体工具软件 MaVIEW 以及全国产 AI 处理器芯片,实现控制与 AI 智能计算的隔离融合。国家工业信息安全发展研究中心在关节破坏、网络攻击、病毒植入等条件下进行了测试,机器人在这些情况下保持稳定运行;OFweek 的行业月报提到该架构通信周期缩短至 0.25 毫秒。东土科技此前主要服务高铁、电网、石油化工等工业场景。
为什么值得关注: 电子架构是人形机器人的"神经系统",直接影响通信时延、控制精度与运行稳定性,而这一层长期多沿用 Linux、ROS、CAN、EtherCAT 等海外体系与英伟达 Jetson、英特尔 x86 平台。整机级替换的意义在于,它验证的是系统级协同而非单点指标。从 2025 年 5 月鸿道操作系统发布,到 2026 年 4 月组建国产化机器人电子架构联合体,再到 9 月联合清华大学、智元、摩尔线程等发起国产化具身智能机器人电子架构联盟,可以看出这条路线正在从单点突破走向生态共建。
8. 德塔智能 Delta-0:原生人形基础模型刷新长程任务效率
德塔智能在 9 月 28 日发布原生人形机器人基础模型 Delta-0,面向全身移动与操作(loco-manipulation)。
架构上采用"大脑-小脑-力位"三级协同:大脑把多模态感知映射为肢体运动指令,小脑负责高频平衡与运动本能,力位混合控制则在保持站姿稳定的前提下调整接触力。训练复用上肢与跨本体数据、并补充人类全身动作捕捉数据,配合真实交互反馈、人工纠正与强化学习进行后训练与失败恢复。官方演示中,搭载 Delta-0 的人形机器人在约 210 秒内完成 9 项家庭任务(整理床铺与游戏机、捡起地上玩偶、装载衣物、把杯子放进洗碗机、找出冰箱里的变质水果并通过脚踏垃圾桶丢弃、坐到沙发上),整个过程规划了 32 步,覆盖卧室、客厅与厨房;另一台高自由度灵巧手机体则演示了播放黑胶唱片并随音乐摇摆,作为抓取、姿态与全身节奏动作耦合的精度校验。团队还描述了"真机-仿真-真机"的评估循环,在仿真中重建场景做导航与重试压力测试后再回到硬件验证迁移。据 Pandaily 报道,该模型定位为可跨本体迁移,正与合作伙伴在宇树、智元等平台上做适配与场景验证。
为什么值得关注: 联合创始人兼首席科学家黄思远的观点点到了要害:通用语言模型能帮忙规划步骤,但无法自行解决接触、失衡与持续力控这些物理层面的问题。这也是"具身大脑"与"通用大模型加一层控制策略"两条路线分歧的核心。Delta-0 把移动与操作放进同一个连续循环而不是拆成独立模块,属于这条路线里较有代表性的一次工程验证。需要注意,主要演示数据来自厂商口径,尚无第三方独立复现。
9. 上海润科具能"半人马":具身智能的评价标准正在从"像不像人"转向"能不能解决问题"
近日,上海润科具能的半人马复合机器人入选 2026 年度"上海设计 100+",从全球十余个国家、两千余件参赛作品中脱颖而出。
这款产品被描述为全球首款"人形双臂上半身 + 四轮足底盘"的轮足一体化特种作业平台,设计理念是"形态服务功能":平整路面用轮式高速行进完成巡检巡航,遇到台阶、废墟、山地、冰雪、泥泞等环境则切换足式通行模式,可翻越 60 厘米障碍。上半身搭载多自由度高精度双臂与灵巧操作手,常规负载 100 至 120 公斤、极限静态负载 210 公斤,可完成阀门调控、废墟清障、伤员转运、设备检修、应急处置等任务,实现"巡检侦察 + 现场处置"一体化。产品已落地消防应急、矿山井下、核工业、油田冶金等场景,官方称已获得消防场景百台意向订单。其控股子公司背景也值得注意:润阳科技与傅利叶智能共同设立润科具能,其多模态柔性触觉电子皮肤已搭载在该机器人上开展实景测试。
为什么值得关注: 这条动态的价值在于它提供了一个观察角度:当行业还在争论人形机器人"能不能进厂"时,一部分企业已经绕开人形形态本身,转而按真实作业需求组合形态。这背后是评价标准的位移,从"像不像人"转向"能不能解决真实问题"。触觉电子皮肤在同一台整机上的实景验证,则是"新材料企业切入机器人赛道"的一条可参考路径。
10. 新加坡 HTX 启用 H2RC:把公共安全做成具身智能的落地场景
新加坡内政科技局(HTX)启用了一个面积约 2.9 万平方英尺的人形机器人中心 H2RC,聚焦公共安全场景下的具身智能应用,首批配置 NVIDIA Grace Blackwell GB300 GPU 算力,并与 ST Engineering 签署合作备忘录。
为什么值得关注: 把公共安全作为人形机器人的切入场景,是一个有代表性的选择:需求真实、预算充足、对可靠性要求高,且不像制造业那样受产线节拍与投资回报周期的强约束。这也从侧面说明,具身智能的落地路径正在分化:国内以工业制造、零售服务与特种作业为主,海外则出现了以政府公共部门为主导的建设模式。
四、产业趋势总结
本期两条主线有明显的呼应关系。
编码智能体这边,关键词是平台化。OpenAI 把 ChatGPT 改造成承载常驻智能体的平台,VS Code 把多模型编排写进编辑器,Google 用 100 万 token 输出上限重划长任务的边界,DeepSeek 与华为则把国产算力栈补到内核层。这几件事指向同一个方向:单点模型的领先幅度在收窄,竞争转移到平台组织能力、成本结构与可治理性上。DeepSeek 与华为的合作还说明,国产厂商的路径不是自建封闭栈,而是复用已有开源组件做可移植适配,这比从零重写更现实。
具身智能这边,关键词是从本体转向底座。IDC 的半年报给出了规模化拐点的数据支撑,但也同时指出竞争重心已从硬件参数转向综合能力;逐际动力与东土科技做的是"神经系统"的整机级国产替换,德塔智能做的是"大脑"的原生基础模型,上海"半人马"做的是形态与场景的重新匹配。三者合起来看,行业正在从"谁的本体更像人"转向"谁的底层系统更稳、谁的大脑更能长期干活"。新加坡 H2RC 则提供了另一种落地模式的参照。
五、值得持续关注的信号
1. 常驻型智能体的使用强度能否起来。 dots 这类产品把 ChatGPT 从"用户发起一次任务"推向"7×24 小时持续在线"。真正的观测指标不是发布会的演示,而是后续的智能体使用时长与 token 消耗能否随常驻型产品快速提升。
2. 多模型编排的实际代价有多大。 HydraFusion 一次请求可能调用多个模型,产生额外 API 流量与算力消耗。它宣称能降低估算成本,但企业实际部署后,编排开销是否划算、中间数据会不会被客户端记录,都会很快变成运维问题。
3. 输出长度竞赛是否会带来新的质量问题。 当单次输出能到几十万 token,评测方式、审核流程与人的检查习惯都需要跟着改。长输出里"局部正确、整体失控"的风险如何被约束,目前还没有成熟答案。
4. 国产电子架构的整机验证能否复制。 逐际动力与东土科技完成了整机级验证,但真正的考验是这套架构能否在更多厂商、更多形态的机器人上落地,以及成本与性能是否具备竞争力。
5. 人形机器人出货口径何时收敛。 不同机构与厂商的统计口径差异明显,IDC 报告中也部分采用厂商提供的数据。在口径统一之前,出货量数字应当交叉比对后再使用。
本日报由 AI 辅助编制,信息来源于公开报道与厂商官方发布,仅供参考。
更多推荐




所有评论(0)