梅西投了李飞飞
最近一周AI科技圈又发生了啥新鲜事?
Anthropic为Claude 5系列大砍Claude Code系统提示词
随着新一代强推理模型的发布,Anthropic团队发现旧的提示词工程范式已不再适用,冗长的规则反而会限制模型表现,因此删除了Claude Code系统提示词中超过80%的内容,且在编码评估中未观察到性能损失。团队总结出的新上下文工程原则包括:让模型自行判断而非给出硬性规则、设计清晰接口而非堆砌示例、采用渐进式披露加载信息、保持CLAUDE.md轻量化、利用自动记忆功能,以及将特定任务上下文交由按需调用的Skills处理

https://x.com/trq212/status/2080710971228918066
Anthropic发布Claude Opus 5模型
Claude Opus 5在多项评测中展现出接近旗舰模型Fable 5的性能水平,而价格仅为后者的一半。其在Frontier-Bench编程基准和GDPval-AA知识工作评测中刷新了最高纪录,ARC-AGI-3新问题解决得分是第二名的三倍,并在OSWorld 2.0计算机操作基准上以约三分之一成本超越Fable 5的最佳成绩。Opus 5在生命科学领域评测中均优于前代Opus 4.8,有机化学和蛋白功能预测等子项提升显著。Anthropic声称该模型是迄今对齐程度最高、欺骗行为最低的版本,并在生物和网络安全等高危领域未突破既有安全边界

https://www.anthropic.com/news/claude-opus-5
微软发布自研图像与语音模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash
微软推出了两款新的自研AI模型,MAI-Image-2.5-Pro是其目前精度最高的图像模型,优化了图像内文字生成准确性并支持自然语言编辑指令;MAI-Voice-2-Flash则针对高频语音应用,速度相比前代提升约2倍,成本降低32%。两款模型已应用于Bing Image Creator、PowerPoint和OneDrive等产品,其中在PowerPoint中相比GPT-Image-2可降低最高84%的GPU成本,在OneDrive中部署后保存成功率提升26%。语音模型也已接入Dynamics 365 Contact Center,可降低最高89%的GPU成本
https://microsoft.ai/news/introducing-mai-image-2-5-pro-and-mai-voice-2-flash/
小红书开源BigMac
小红书dots infra团队开源了名为BigMac的流水并行训练新范式,解决多模态大模型训练中计算效率与显存占用难以两全的难题。其核心思路是保留成熟的LLM流水线作为稳定主干,在不打乱其执行顺序的前提下,将编码器和生成器的计算有序嵌入,从而在不增加LLM流水线空泡并保持激活显存有界的同时,高效实现多模态流水训练。实验表明,BigMac的训练速度较基线提升1.08至1.9倍,并在增大全局批次大小时保持显存占用稳定。该项目已作为dots多模态模型训练的核心组件投入生产应用,并提供了完整的开源代码与配套工具链

https://github.com/Dots-Infra/BigMac/
梅西旗下投资平台Play Time将World Labs纳入投资组合
梅西旗下的体育科技投资平台Play Time已将李飞飞创办的空间智能企业World Labs纳入其投资版图,这是体育资本进入具身智能领域的标志性动作。与此同时,World Labs宣布收购机器人仿真公司SceniX,该公司由斯坦福时期与李飞飞共事的李昀烛等人联合创办,专注于为机器人搭建虚拟训练环境。SceniX采用混合仿真技术,结合物理模型与神经网络来处理柔性物体和复杂接触,其技术已在真实机器人部署中得到验证
https://mp.weixin.qq.com/s/8v8l_YOMmydNNBbjVdNhYg
阿里开源0.8B文档解析模型OvisOCR2
OvisOCR2基于Qwen3.5-0.8B后训练打造,在OmniDocBench v1.6基准测试中以96.58的综合得分登顶,首次证明端到端模型能够超越传统的流水线方法。该模型能够将文档图像直接一次生成为符合阅读顺序的Markdown格式,覆盖文本、表格与公式。其训练融合了监督微调、强化学习、在线策略蒸馏和模型融合等多阶段流程,并已开源发布,可无缝融入千问生态

https://arxiv.org/abs/2607.13639
商汤发布日日新U1 Pro交付级图像模型
商汤科技在WAIC 2026上推出的日日新SenseNova U1 Pro,是一个面向复杂多模态任务的交付系统,其核心能力在于实现理解、生成与行动的原生统一。该模型能原生输出8K分辨率图像,并维持超长画幅下的文字清晰度与构图稳定。更重要的是,U1 Pro具备“图文交错思维”,可围绕目标连续完成从草图、细化、着色到检查调整的闭环创作流程,旨在减少反复抽卡,直接输出可用于信息图、海报、学术海报等场景的交付级成品

https://mp.weixin.qq.com/s/NDNUFfwY7ETyI4QeOmyYyg
谷歌一口气发布三款 Gemini 新模型
谷歌 DeepMind 推出了三款专为大规模 AI 智能体打造的新模型,旨在全面优化开发者的运行效率、响应延迟与成本效益。作为此次发布的主力款,Gemini 3.6 Flash 在编码、知识工作和多模态表现上均有提升,且输出 Token 用量较上一代减少约 17%,API 定价也下调至输入每百万 Token 1.5 美元、输出 7.5 美元;面向高并发日常任务的 Gemini 3.5 Flash-Lite 主打极致吞吐与低成本,输入定价仅为 0.3 美元/百万 Token;而专门针对漏洞挖掘与修复的 Gemini 3.5 Flash Cyber 则作为网络安全特种兵,目前仅面向政府与受信任伙伴限量试点开放
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
面壁智能发布MiniCPM-Robot系列模型
面壁智能联合OpenBMB发布了其首个具身智能成果MiniCPM-Robot系列,包括通用VLA模型MiniCPM-RobotManip和跟踪模型MiniCPM-RobotTrack。其中,仅1.5B参数的RobotManip在性能上比肩3-4B模型,具备1分钟原生记忆能力,在RMBench测试中以53分远超π0.5的10分;0.9B的RobotTrack则实现了业内首个真实本地断网部署,在宇树Go2机器狗上稳定达到5+ Hz跟踪频率。两款模型均已开源,并获得自研推理框架PhyAI的加速支持
https://github.com/OpenBMB/MiniCPM-Robot
阿里发布Qwen-Audio-3.0-TTS
Qwen-Audio-3.0-TTS系列包含面向实时交互的Flash版和高质量生成的Plus版,在权威平台Artificial Analysis上斩获冠军。模型支持通过结构化标签精细控制语气情绪,并能用自然语言指令定义声音风格;在多语种能力上覆盖16种语言,在10种语言的字错误率评测中达到最优,说话人相似度在全部16种语言中包揽第一;同时还支持20种中文方言合成,并通过声学仿真训练提升了在噪声环境下的鲁棒性,音频输出品质提升至48kHz,单次合成时长可达3分钟

https://mp.weixin.qq.com/s/ZhDZfqf6IFKnv8qU2LW1DA
美团LongCat团队发布下一代搜索智能体评测基准LoHoSearch
该基准以涵盖762万维基百科实体的知识图谱为基础自动生成题目,通过控制搜索空间与结构复杂度双维度构建高难度问题,最终收录544道经人工核验的题目,覆盖11个领域。测试结果显示,最强模型GPT-5.5的准确率仅为34.74%,正确轨迹所需工具调用次数是此前BrowseComp基准的1.7倍;现有上下文管理策略在该基准上的提升幅度仅6.8%,远低于其在BrowseComp上的14.03%,表明LoHoSearch能有效区分模型能力,为长程搜索与上下文管理技术研究提供了更富挑战性的试验平台

https://mp.weixin.qq.com/s/NUzZonX_RIW-fhxBAIb6gw
字节跳动Seed团队发布音频创作模型Seed Audio 1.0
该模型在统一框架下联合建模人声、音效和环境声,实现影视级音频的端到端生成。它支持通过单条提示词对多类声音进行时间线编排,控制精度达到100毫秒,并支持基于参考音频进行音色与风格控制,在长音频生成中保持角色一致性。Seed Audio 1.0已覆盖20多种语言,在多数创作场景下的音频可用率达90%以上,在文本生成音色的主观评测中也展现出显著优势
https://research.doubao.com/zh/seedaudio1_0
更多推荐




所有评论(0)