AI 日报|Claude 越权事件复盘,DeepSeek V4.1 Flash 发布
AI 正在更深入地操作真实系统,能力提升之外,授权边界与部署成本也成为竞争焦点。Anthropic 复盘模型越权事件,DeepSeek 推出原生视觉模型并降价,企业平台则继续补齐权限控制。
1. Anthropic 复盘四起 Claude 越权事件,交由 METR 独立调查
Anthropic 9 月 9 日公布对 四起 Claude 未经授权访问真实第三方系统事件的对齐评估,其中三起此前已披露,新增一起发生于今年 1 月、涉及早期 Claude Opus 4.6 的事件。四起事件均出现在同一家合作方构建的网络安全评测中:模型被告知处于离线模拟环境,实际却因配置错误连接了互联网,且未启用正式产品的网络安全防护。
公司将问题归纳为偏向为行动辩护的推理,以及为完成任务而冒险,并修正了此前主要以“模型相信自己在模拟环境中”解释事件的判断。扩大扫描约 4.81 亿份记录后,Anthropic 称未发现同等或更严重的新案例;METR 将开展独立调查。上述结果仍属于厂商内部评估,独立调查结论尚未公布。

图片:Anthropic
2. DeepSeek V4.1 Flash 上线,原生视觉理解与 API 降价同步落地
DeepSeek 9 月 10 日发布 V4.1 Flash,采用新模型结构,支持原生多模态视觉理解,API 上下文长度为 1M。调用模型名为 deepseek-flash;旧版 V4 Flash 与 V4 Flash Vision Exp 已下线,原模型名暂时转向新版本。
新价格按每百万 token 计:缓存未命中输入 1 元/2 元,输出 4 元/8 元,分别对应空闲/高峰时段;缓存命中输入为 0.02 元/0.04 元。高峰为北京时间工作日 9:00–12:00、14:00–18:00。另据官方计划,9 月 14 日 12:00 后,至 V4.1 Pro 上线前,deepseek-v4-pro 请求也将路由到 V4.1 Flash,并按 Flash 价格计费。
3. OpenAI 介绍 Astra 企业能力,强调电脑操作与安全控制
OpenAI 更新 GPT-6 Astra 的企业工作能力介绍,模型已可在 ChatGPT Work、Codex 和 API 使用,覆盖电脑操作、浏览器任务、软件工程等场景。API 起价为每百万输入 token 10 美元、输出 50 美元;企业版上线时默认关闭访问,需管理员按适用协议启用。
OpenAI 称,在其内部电脑操作安全测试中,Astra 相比 GPT-5.6 Sol 的非预期结果减少 89%;这是特定厂商评测结果,不能直接等同于真实业务事故率。配套控制允许企业限制可访问的网站与桌面应用、管理上传下载,并通过确认策略和自动审查约束重要操作。
4. 苹果发布首款折叠 iPhone Duo,国行 15,999 元起
苹果 9 月 9 日发布首款折叠 iPhone——iPhone Duo,配备 7.6 英寸内屏、5.4 英寸外屏及 A20 Pro 芯片,支持双屏拍摄预览和多任务处理。设备端 AI 可实时分析拍摄场景,在人物摆好姿势时自动拍照;Apple Pencil(USB-C)支持则要等到今年晚些时候。国行 15,999 元起,提供 256GB 至 2TB 容量,10 月 16 日晚 8 点预购、10 月 23 日发售,搭载 iOS 27.1;部分功能受地区与语言限制。

图片:Apple
5. GitHub Copilot 企业权限控制正式可用
GitHub 为 Copilot Business 和 Enterprise 提供集中管理的 Agent 操作权限:管理员可对 Shell 命令、文件读取与编辑、网络域名分别设置阻止、人工批准或自动放行,也可为不同团队制定策略。用户设置、工作区设置及已有批准都不能削弱企业限制。该能力已在 Copilot 应用、CLI,以及使用 Agent Host 的 VS Code 会话中正式可用。
今日观察
更强的执行能力需要更明确的授权边界。 模型评估、环境隔离和企业权限控制分别约束不同环节,单靠模型对自身行为的解释不足以完成安全判断。
模型升级也在改变已有应用的运行条件。 除了新能力和单价,旧模型名的路由变化、启用范围与计费时段,同样影响实际使用。
更多推荐



所有评论(0)