英伟达收购Hugging Face!
最近一周AI科技圈又发生了啥新鲜事?
OpenAI宣布终止与Cursor的合作关系
OpenAI发布声明,宣布因Cursor被SpaceX收购后无法确信其能在服务条款范围内使用技术,将自11月12日起终止Cursor对OpenAI模型的直接访问权限。OpenAI提及SpaceX旗下xAI曾违反服务条款的历史,而Cursor创始人回应称OpenAI模型仅占其用户流量的约5%。此次断供的背景是OpenAI正为具备潜在关键级网络攻击能力的Astra模型部署做准备,需严格控制分发渠道。此前Anthropic也曾因类似原因切断过Windsurf等产品的模型访问权限

https://openai.com/index/our-decision-on-cursor-following-its-acquisition-by-spacex/
腾讯姚顺雨再交卷,开源Hy4 preview
腾讯混元发布并开源新一代大语言模型Hy4 preview,总参数达770B,单次推理激活49B,支持1M上下文,采用Apache 2.0许可。模型在软件工程与Agent任务上表现突出,Terminal-Bench 2.1得分从70.8升至85.4,DeepSWE从28.0升至64.3,在Arena Code Arena榜单以1633分位列开源模型第三。模型训练首次纳入CodeBuddy、WorkBuddy等产品使用反馈形成闭环,并借助自身优化将推理吞吐较基线提升31.8%。目前已开放权重与API服务,输入每百万tokens 6元、输出18元

https://hy.tencent.ai/research/hy4-preview
谷歌发布Gemini 3.5 Transcribe语音转文本模型
Gemini 3.5 Transcribe能够自动删除“嗯”“呃”等口头禅以及说错后自行纠正的内容,生成更通顺的文本。与上一代Chirp 3引擎相比,整体转录速度提升约70%,在实时语音场景下错误率降至5.5%(Chirp 3为7.32%)。该模型支持85种语言,可处理最多包含3名说话者的预录音频,并提供自定义词汇表功能以提升专业术语识别能力,目前已为Pixel 11上Gboard键盘的“Rambler”功能提供支持
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
腾讯混元推出极低比特翻译模型Hy-MT2-1.8B
腾讯混元将Hy-MT2-1.8B翻译模型通过2-bit与1.25-bit量化方案压缩至574MB和440MB,原始FP16精度下体积为3.3GB,翻译质量几乎无损。该模型原生支持33个语种互译,在FLORES-200评测中整体质量优于部分商业翻译API。1.25-bit方案基于自研Sherry技术,每4个参数中3个用±1存储、1个置0,平均仅需1.25-bit。英特尔针对x86平台优化算子后,量化格式的token rate分别提升约2.7倍和5倍。该模型已在哔哩哔哩直播弹幕实时翻译中落地,平均单条弹幕翻译耗时500至800毫秒,资源下载约600MB、内存占用500至700MB
https://mp.weixin.qq.com/s/wCoqiJ6HCS2YBWCegc1KEw
智谱开源GLM-5.3-Flash模型
GLM-5.3-Flash是一款320B总参数、18B激活参数的原生多模态模型,在Artificial Analysis Intelligence Index中取得57分,与Claude Opus 4.8持平,编程表现相当,定价仅为后者的四十分之一。该模型采用稀疏注意力和线性注意力的混合架构,大幅降低长上下文服务成本。此次发布还首次在大规模流量中用国产芯片集群提供服务,端到端性能提升了3倍。模型已开源并接入ZCode等平台

https://z.ai/blog/glm-5.3-flash
阿里发布Qwen3.8-Flash模型
Qwen3.8-Flash是一个多模态MoE模型,主模型参数量为125B,额外配备51B的N-gram Embedding,每token激活6B参数,原生支持262,144 token上下文并可扩展至1M。采用GDN与QSA混合的Attention架构,其中QSA通过micro-block粒度筛选重要上下文以实现长序列加速;引入Gated Residual机制将残差流扩展为4条分支以增强跨层信息传递;N-gram Embedding以少量计算扩展模型容量并可卸载至Host Memory。相比Qwen3.7-Plus,训练开销仅约为前者的1/9,但编码和办公任务能力更强,API服务定价为每百万Tokens输入1元、输出3元。同步开源的Qwen3.8-Flash-Next权重被视为Qwen4系列模型的雏形

https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
爱诗科技发布PixVerse R2实时世界模型
PixVerse R2技术报告呈现实时全模态世界模型的持续扩展路径。R2采用Omni Causal AR统一训练框架,支持文本、图像、视频、音频和动作等多模态信号输入,并能同步输出音视频。模型通过Dynamic Chunk统一不同控制信号的时间尺度、Hybrid Teacher/Diffusion Forcing缩小训练与推理分布差异、Multi-Timescale Memory协同保存长期身份与近期动态、Error Bank将长期漂移转化为可学习训练信号,从而构建可持续运行的世界状态。在实时加速方面,R2从完成长程预训练的Omni Causal AR直接蒸馏,结合DDMD对抗正则、Block-sparse Attention和Pyramid分层生成,将能力加速至低延迟实时运行区间

https://mp.weixin.qq.com/s/vjIPBLJXa_Plcbxidv_Qiw
谷歌推出多人实时协作Vibe Coding工具Play with Putty
谷歌Labs推出的Play with Putty是一款多人实时协作的Vibe Coding实验工具,支持多名用户在同一共享空间内用自然语言描述需求,由AI自动生成代码并实时同步渲染,无需编程基础即可共同搭建可直接使用的工具或网站。产品采用候补名单制分批开放,定位轻量社交化创作,适用于团队快速原型验证、编程教学、黑客马拉松及企业内部小工具搭建等场景
https://labs.google/playwithputty
英伟达同意129亿美元收购Hugging Face
英伟达同意以129亿美元收购AI模型社区Hugging Face,后者年化收入超过1.5亿美元,收购价约合其八十多倍年化收入。Hugging Face提供模型发现、下载、训练、部署和推理服务,已成为开放模型生态的重要基础设施。此次收购是英伟达近期一系列布局开放模型生态动作中的一环,此前已投入约990亿美元用于AI产业链股权投资,并组建Nemotron Coalition、收购Kumo AI和吸收Essential AI团队。该交易若完成,或将改变Hugging Face此前作为中立平台的角色定位

https://mp.weixin.qq.com/s/rLzd8hhMU9v0wf5uraD8MQ
小红书开源FireRedTTS3统一语音生成与编辑模型
FireRedTTS3模型基于RedAE语义增强连续表示与LLM-DiT架构,在单一模型中实现零样本音色克隆(支持24种语言与21种中文方言)、自然语言描述的声音设计以及指定区域的精准语音编辑(包括改词、调速、变调与调音量)。该模型在Seed-TTS-Eval、MiniMax-MLS-Test等四个公开评测集上均取得最优或次优成绩,其中零样本克隆说话人相似度达78.8%。模型已全面开源并支持本地部署

https://github.com/FireRedTeam/FireRedTTS3
字节推出 AI Agent 办公产品「豆包工作」
“豆包工作”专注于赋能生产力场景,定位为下一代智能办公助手。该产品具备强大的自主决策与执行能力,能够拆解复杂任务、联动多元工具并自动化推进工作流,全面覆盖文档撰写、PPT制作、网页搭建及系统开发等全栈需求。值得一提的是,豆包工作支持虚拟桌面操控,全程操作可视透明,并支持用户随时介入接管。此外,产品深度集成飞书生态,可基于企业真实上下文智能检索会议纪要、提炼群聊精华并自动生成周期性报告,大幅提升团队协作效率
https://mp.weixin.qq.com/s/SsXHiqKB8RV6bBWzRluGzw
更多推荐




所有评论(0)