登至第一,端到端论文生成系统来了!
AI科技圈最近一周又发生了啥新鲜事?
OpenAI开源Codex Agent运行框架
该框架核心为"Harness"执行系统,负责管理对话状态、流式执行、工具调用、沙箱与审批策略,并通过Codex app-server以客户端协议暴露能力。开发者可按场景选择集成方式:codex exec适合脚本和CI任务,Codex SDK支持程序化启停和流式任务,Codex app-server则面向需要持久对话、事件流和审批处理的产品级应用。实际落地案例中,Thrive Holdings与Crete将其用于税务准备流程,试点处理7000份申报,准备时间缩短约三分之一;Cisco在Cloud Control的App Builder中集成Codex SDK;GitHub和JetBrains则将Codex引入IDE工作流

https://developers.openai.com/blog/codex-as-a-platform
DeepSeek调整周末API计费为全天谷价
DeepSeek宣布自8月23日起调整峰谷计费规则,周末全天不再区分峰谷时段,统一按低谷时段价格收费。此前,V4-Flash和V4-Pro API已实行峰谷计费,高峰时段价格为低峰两倍。此举对开发者构成利好,可降低周末批量任务成本,但也引发对职场考勤可能随算力成本波动的讨论,已有短剧制作团队和程序员群体为节约Token成本而调整工作时段

https://mp.weixin.qq.com/s/OWvEG7c9N2l6kinMgyAk1A
小米新一代人形机器人亮相2026世界机器人博览会
小米新一代人形机器人身高约1.70米、体重约66公斤,全身拥有66个自由度且半数集中于手部。该机器人由大模型驱动,能够自主理解现场交互指令与实时场景并独立完成操作,在现场演示中完成了抓取香片、撒花、递送以及握手、碰拳、比心等流畅互动。该机器人目前仍处于样机阶段

https://www.ithome.com/0/991/747.htm
千问推出GUI智能体基座模型Qwen-UI-Agent
Qwen-UI-Agent是一个以真实世界为中心的GUI智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索环境。在移动端MobileWorld基准上达到82.1%的成绩,领先对比模型8.9至14.6个百分点,真机基准MobileWorld-Real得分92.2%;电脑端OSWorld-Verified为79.5%,WebArena达73.6%位列第一,ScreenSpot-Pro等5个GUI定位基准全部刷新SOTA。该模型支持GUI与CLI混合动作空间及批量操作,通过超100步长轨迹的在线强化学习与约10000个并发环境训练,并构建了覆盖100多台真实手机与150多个应用的真机环境。模型将安全判断贯穿执行全程,可拒绝高风险请求并在敏感操作前主动停手请求确认
https://mp.weixin.qq.com/s/xjKcjN2W82eNcb0lSrP6yQ
MiniMax推出多模态内容创作产品MiniMax Design
MiniMax Design是一款将多模态模型能力转化为生产力的产品,基于原生多模态视频模型H3构建,能够理解用户创作目标、拆解任务并调用相应模型与技能,完成从素材处理到最终交付的完整流程。该产品将创作与修改从像素级操作提升至语义层面,用户通过自然语言表达意图即可驱动系统完成生成与编辑,并支持理解项目级别的复杂上下文。MiniMax Design擅长处理商业内容任务,如广告创意批量迭代、知识视频制作及PV/MV创作等,同时提供3D导演台用于分镜预览,并支持接入ComfyUI等开源工作流
https://mp.weixin.qq.com/s/vMmhr2rCeBC_dM_tBdks1A
DeepSeek发布Harness框架RC.8版本
RC.8版本重点增强了多模态能力,使模型适配器支持原生图片请求,核心命令支持图文混合输入,并允许通过@菜单引用本地文件与历史会话。该版本将Claude Code和Codex作为可安装的Profile Bundle纳入子代理调用体系,使其成为Agent工作流中可调用的组件。工具调用方面支持web_search并发查询与子代理结果主动反馈,Windows终端获得持久化PowerShell会话支持,同时修复了图片载荷、流式生成及API兼容性等多处问题

https://github.com/deepseek-ai/deepseek-harness/releases#en-v0.1.0-rc.8
扣子推出桌面端
扣子桌面端让智能体从网页走进本地电脑,在用户授权后可读写本地文件、执行Python或Node.js脚本及Git操作,并能处理视频压缩与格式转换等任务。桌面端支持深度截图功能,可将画面及界面信息自动传入对话框。扣子云盘作为统一文件空间,让资料在多个智能体、人与智能体以及多台电脑之间实现同步与协作。用户通过手机App还可远程调用桌面端已授权的本地文件执行任务

https://mp.weixin.qq.com/s/9Kods-auxnMj__emtsZSCQ
Cursor推出Origin代码托管服务
Cursor推出的Origin代码托管服务已向所有付费方案用户开放早期Beta版,提供代码仓库管理、PR协作、代码浏览及GitHub双向同步等核心功能。已同步的GitHub仓库支持实时更新,PR评论可在Cursor与GitHub之间双向同步。该服务将代码、PR与智能体功能整合于同一平台,并已集成Vercel、Depot和Buildkite等应用,支持预览部署与CI/CD工作流
https://cursor.com/cn/changelog/origin-code-hosting
研究人员推出端到端论文生成系统Spark-to-Paper
研究人员推出的Spark-to-Paper系统以13个可组合技能的形式运行在现有编程助手内部,能够从研究想法出发自动完成文献检索、实验设计、实验执行、论文写作、证据驱动的结论修订及可编辑论文图生成,最终输出完整LaTeX项目。在8个受控研究课题上,该系统引文有效率达99.5%,图形元素可编辑率达96.4%;对36条人为注入的假结论,检出率从单遍生成的14%提升至92%,对抗式评审精确率达74%。系统平均每篇论文使用11.9M token,成本8.1美元,耗时3.2小时

https://github.com/Spark-To-Paper-Skills/spark-to-paper-skills
昆仑万维发布AI音乐生成模型Mureka V9.5
Mureka V9.5基于MusiCoT音乐思维链框架构建,在编配、人声与情绪表达上追求克制与自然。该模型的人声表现良品率达61.0%,控制良品率与曲风完全体现比例分别为97.0%和95.7%,在国风演绎上实现了更精准的咬字发音与更具层次的和声编排。此次升级源自对超过2.5万份用户反馈的收集与响应,使AI音乐从“能生成”跨越至“值得反复聆听”的阶段

https://mp.weixin.qq.com/s/YSm_YXYMXvQ6gbDwwHePww
阿里巴巴上线Qwen-Audio-3.0系列语音模型
阿里巴巴正式推出自研Qwen-Audio-3.0系列语音模型,并通过千问AI平台提供API服务。该系列包含语音识别模型Qwen-Audio-3.0-ASR、语音合成模型Qwen-Audio-3.0-TTS以及实时语音交互对话模型Qwen-Audio-3.0-Realtime,在Artificial Analysis今年7月的语音评测中包揽三个赛道全球第一

https://mp.weixin.qq.com/s/yb4-PDno5NaacES9RfxIEA
更多推荐



所有评论(0)