AI 前沿日报:2026年8月15日

Qwen3.8-27B正式发布——架构与3.6完全相同,纯训练提升;150M参数循环模型在ARC-AGI-1得分29.5%,每任务仅$0.0007;OpenAI和Anthropic价格战——中国AI竞争者逼近;Anthropic内部使用比Mythos 5更强的模型但不发布;Manus回归为独立公司——中国迫使Meta解除20亿美元收购;NInfer Day-0支持Qwen3.8-27B单卡200 tok/s;Qwen3.8-27B heretic去审查版发布;OpenAI向FBI报告Goldman Sachs分析师;GPT Image 2.0隐蔽测试改进版;GPT-5.6 Sol在Codex中突然不可用;数字分身系统让AI克隆你自己干活。
🔥 今日头条
1. Qwen3.8-27B 正式发布——架构与3.6完全相同,纯训练提升
Qwen团队正式发布 Qwen3.8-27B。令人惊讶的是,3.8版本与3.6版本的模型架构完全一致——所有能力提升均来自训练改进:
- 对比工具显示架构配置文件零差异
- 所有能力提升均来自训练改进,而非架构调整
- 发布后开发者立即展开多方面探索(见下方各条)

2. 150M参数循环模型在ARC-AGI-1得分29.5%——每个任务仅$0.0007
一篇来自Pathway团队的论文(arXiv:2608.09888,约4天前发布)引发关注:一个仅1.5亿参数的循环模型在ARC-AGI-1上得分29.5%:
- 不是Transformer——采用循环潜在推理架构,在潜在空间中持续"思考"
- 每个任务成本仅**$0.0007**,完全跳出现有成本/精度前沿
- 如此小的模型几乎可以在任何设备上运行
- 论文作者表示想看到它扩展到1-3B参数后再下结论,但当前结果的形态已经令人震惊

3. OpenAI 和 Anthropic 价格战——中国AI竞争者逼近
据Ars Technica报道,OpenAI和Anthropic正在进行价格战,背景是中国AI公司(DeepSeek、Z.ai等)的竞争压力持续增大:
- 双方不断调整API定价以保持竞争力
- 中国AI模型以低价策略持续抢占市场份额
- 这标志着AI市场从性能竞赛进入价格+性能双维度竞争

4. Anthropic 内部使用比 Mythos 5 更强的模型——但不打算发布
据X上的消息人士透露,Anthropic内部使用的模型比已发布的Mythos 5显著更强:
- Anthropic目前没有计划发布这个更强的内部模型
- 这印证了此前的猜测:前沿AI公司可能在保留最强大的模型
- 引发对AI公司"发布滞后"策略的讨论
5. Manus 将回归为独立公司——中国迫使Meta解除收购
据CNBC报道,Manus将作为独立公司回归,此前中国监管部门迫使Meta放弃了20亿美元的收购:
- 这标志着中国对AI领域跨国并购的严格监管态度
- Manus作为知名AI Agent创业公司将继续独立运营
- Meta的AI版图扩张计划因此受阻

🧠 开源模型前沿
6. NInfer Day-0支持Qwen3.8-27B——单卡RTX 5090达200 tok/s
NInfer引擎发布Qwen3.8-27B的Day-0支持:
- 单卡RTX 5090上通过推测解码达到约200 tok/s
- 支持最多8个并发请求,共享分页KV缓存池
- 实现了ReplaySSM用于GDN+推测解码,大幅降低并发时recurrent-state内存开销
- 使用PDL进一步降低延迟
- 在HuggingFace开放权重下载
7. Qwen3.8-27B heretic 发布——本地无限制Opus 4.6级体验
开发者发布了 Qwen3.8-27B-heretic-ara——去除安全审查的heretic版本:
- 在HuggingFace开放下载
- 提供本地Opus 4.6级模型体验,但无任何拒绝或安全护栏
- 引发热议,反映出对AI审查的不满情绪

8. Qwen3.8-27B 基准测试图表化——多维度可视化对比
开发者将Qwen3.8-27B的HuggingFace基准数据转换为可视化图表:
- 多维度对比展示Qwen3.8与前代及竞品的性能差异
- 包含编码、推理、数学等多个维度的对比
- 清晰展示了27B密集模型已达到的能力边界

9. Qwen3.8-27B 推理强度差异巨大——medium到xhigh从2K到40K tokens
开发者测试Qwen3.8-27B的不同推理强度设置:
medium模式几乎不思考,仅几千tokenxhigh模式可产生15K-20K思考token,Pac-Man示例甚至达到4万- 差异之大令人惊讶,远超Qwen3.6-27B
- 可在llama.cpp中限制推理预算,但这是否为预期行为存疑

10. 循环潜在推理模型——3B参数在HuggingFace发布
研究者发布了 hyper-3b-latent——基于Qwen2.5-3B微调的循环潜在推理模型:
- 使用Coconut风格的潜在推理目标函数
- 隐藏状态在输出任何token前反馈到输入嵌入K步
- PonderNet halt head学习何时停止
- 在HuggingFace开放下载
11. Muse Glimmer 曾达到30B模型前沿水平
回顾Muse Glimmer在30B参数级别模型中的短暂前沿地位:
- 在30B模型级别中曾占据前沿位置约四天
- 随着Qwen3.8-27B等新模型发布,前沿不断被刷新
- 反映了开源模型竞争的白热化程度

🏢 行业动态
12. OpenAI 向FBI报告Goldman Sachs分析师——ChatGPT发出恐怖内容
据Futurism报道,OpenAI向FBI报告了一起Goldman Sachs分析师通过ChatGPT发出的恐怖内容:
- 该分析师使用ChatGPT进行了"令人恐惧的"对话
- OpenAI将此事件报告给FBI
- 这标志着AI平台在安全合规方面的新角色

13. GPT Image 2.0 隐蔽测试改进版——画质提升已被用户发现
据消息人士透露,GPT Image 2.0的改进版正在隐蔽测试中:
- 部分ChatGPT账户已获得访问权限
- 8月12日已有用户注意到画质提升
- 改进在"真正的绝对照片级真实感"方面最为明显

14. GPT-5.6 Sol 在 Codex 中突然不可用——疑似下线
多个用户报告 GPT-5.6 Sol 在 Codex 中突然不可用:
- 每次运行都报错"gpt-5.6-sol is not supported"
- 其他模型在同一账户上仍正常工作
- 尚不清楚是临时故障还是ChatGPT计划用户在Codex中的Sol已被移除

15. Anthropic 计费模式切换困难——没有简单开关
开发者抱怨Anthropic的计费模式切换极其繁琐:
- 从API Key计费切回Pro订阅需要SSH→tmux→登录→复制OAuth URL→浏览器→授权→粘贴
- 一个前沿AI公司连一个简单的计费切换开关都做不好
- 这反映了AI工具在用户体验上的短板

💡 开发者实战
16. Qwen3.8-27B 水族箱爆破测试——54轮自主迭代完成物理模拟
开发者用Qwen3.8-27B(BF16全量版)进行水族箱爆破物理模拟测试:
- 使用VSCode GitHub Copilot扩展的Agent模式
- 单条提示词触发54轮模型自主迭代
- 包含水体流动、碎片碰撞、鱼浮力物理、水位下降等完整物理模拟
- Copilot自动使用Playwright进行功能验证,无需人工介入

17. 数字分身——让AI克隆你自己干活
开发者用周末时间构建了一个名为Munder Difflin的开源数字分身系统(MIT协议):
- 包装已有的AI编码Agent(支持Claude Code/Cursor等),让它学习你实际的工作方式
- 为队友也制作了分身,分身之间通过共享知识库自主协作,无需人工路由信息
- 解决了反复盯管AI Agent的问题——无需逐步审批、每次重新解释上下文
- 作者指出:奇点可能不是单个模型觉醒,而是大量窄Agent组成的网格停止需要人类协调

18. Qwen3.8-27B SVG动画绘制能力——单提示词生成完整动画
多位开发者展示Qwen3.8-27B的SVG动画生成能力:
- 一条提示词即可生成完整的SVG动画(如鹈鹕飞行动画、海贼王船只海洋场景)
- 动画包含多帧、路径变换、色彩渐变等复杂元素
- 展示了27B密集模型在代码生成和创意表达方面的能力

19. Qwen3.8-27B 发布后改进方向探讨——开发者驱动优化
Qwen3.8-27B发布后,开发者立即展开改进方向探讨:
- 聊天模板是否正确
- 是否存在循环输出问题
- 推理token消耗是否过高
- MTP(多token预测)配合情况
- 对比了Qwen3.5-27B和3.6-27B发布时的问题,推动快速修复
- 开发者分享了256K上下文+非量化KVCache+MTP的内存占用数据,推动32GB VRAM可行性评估
更多推荐




所有评论(0)