在9 月 15 日,Jev 正式发布。 TypeSafe 把它定义成首个公开的 “System One Model”,核心不是聊天,而是给软件做快速结构化决策。官方声称它在这类任务上比传统大模型快、便宜两个数量级。

Jev 上线 Vercel AI Gateway 后 24 小时内,使用它的付费团队比例接近 13%,Vercel 称它是其 AI Gateway 历史上采用速度最快的模型发布。

先说我的困惑:都说它是操纵电脑的神器,可我一个技术小白是真看不懂——ChatGPT 能点东西,Claude 也能点东西,凭啥就它神?

这篇文章我保证不讲一个术语,你也能看懂 👇


结论先摆在这儿

Jev 根本不会用电脑。

它只是一个反射神经只有几十毫秒的单选题战神


先纠正一个最容易产生的误会:Jev 到底是什么?

Jev 不是 Computer Use 模型,也不是浏览器 Agent。

它本质上是一个决策模型

你把当前情况告诉它,再给它几个合法选项:

  • A. 点搜索框

  • B. 点下一页

  • C. 返回

  • D. 任务完成

它不跟你解释为什么,也不给你写一篇分析报告,而是直接给程序回一个干净利落的结果:

选 B,置信度 97%。

官方对它的描述更拗口一点:输入是没整理过的原始状态,输出是结构化的决策——选项、分数、概率,而不是一段文字。说白了就是:

一堆乱七八糟的情况进去,一个干净利落的答案出来。

所以 Computer Use(让它操作电脑)只是它的一个应用场景,不是它的本体。

真正擅长的是这几件事:

分类、路由、挑工具、决定下一步、判断该继续还是该停。

记住这一点,后面就全看懂了。


一、为什么以前让 AI 操纵电脑,卡得像 PPT?

以前让大模型帮你订机票、点外卖,相当于请了位老教授来用电脑:

截一张图 → 盯着琢磨半天 → 慢悠悠写出一整篇操作说明——我准备点击左上角那个蓝色按钮…… → 电脑这才挪过去点一下 → 再截图、再琢磨、再写……

点个外卖要重复几十轮这个流程。每一次点击都在等大模型写作文,画面当然一卡一卡。

不过这里得说得更准确一点。老教授每一轮其实同时干了很多活:

看懂页面 → 理解目标 → 推理下一步 → 生成动作 → 有时还要写一段文字或代码 → 最后才轮到执行。

而 Jev 只回答一句话:

已知这些候选项,现在选哪个?

也就是说,它把一个开放式的作文题,压成了一道有选项的选择题

Jev 真正省掉的不是作文,而是把开放题改成了选择题。

这个是重点。少写几个 token 根本不算什么。关键在于——它不是不用脑子,而是不用写草稿纸。


二、Jev 是怎么把速度拉满的?

它干脆换了套路:不写作文,只做单选题。

这里得把三层分工拆清楚,因为很多人会误以为 Jev 自己会看屏幕、自己会点鼠标,其实不是:

眼睛(环境)— 大脑(Jev)— 手(执行器)

  • 浏览器/桌面程序先负责看环境,把当前能做的动作整理成有限的候选项,再交给 Jev 选

  • Jev 往往不到一秒,甚至几十毫秒就能敲定一个

  • 移动鼠标、点击、输入文字,由后面的 Computer Use/浏览器驱动真正执行

  • 只有遇到要写长文的复杂活,才回头叫大模型处理

Jev 不负责看屏幕,也不负责真的点鼠标。它只负责回答一句:现在该选哪个。

所以整个循环长这样:

页面/桌面 → 提取候选动作 → Jev 选下一步 → 执行器动手点 → 页面变成新状态 → Jev 再选一次

一圈一圈转到任务完成为止。

打个比方:

  • 传统做法——教授每点一下鼠标,都得先写一篇小论文

  • Jev 做法——教授只负责定大方向,门口保安 0.1 秒伸手一指:点这儿!


三、为什么它搭上 WebMCP 才是真正绝杀?

WebMCP 这词听着唬人,其实特简单。

大白话真相:Jev 最大的优势,并不是在复杂网页里到处找按钮。它本质上像个分流器——页面元素一多,它面对的候选空间就迅速变复杂,很容易挑花眼。

而 WebMCP 恰好反过来:网站主动把自己的能力,暴露成一套结构化的工具。

注意关键词是主动:不是浏览器自动就有了,也不是每个网站天生都支持,而是网站愿意把自己的功能打包好、直接递到 AI 面前。

举个例子。原本是:

看看这个页面,猜猜哪个按钮能完成任务。

有了 WebMCP 就变成:

这里有搜索商品、加入购物车、结账三个工具,你选一个。

对 Jev 来说,这简直是把阅读理解题直接换成了标准选择题。选项这么直白,它秒选秒中,胜率直接拉满。

最硬的一组数字来自 idan 在 WebMCP 基准上的测试:

  • 只用 Jev 点网页按钮(DOM/Ultrafast 方案):25/49

  • Jev + 便宜小模型 Mercury + WebMCP:49/49

  • 中位模型成本约 0.0011/任务,而顶级的大模型走代码执行方案约 0.1187/任务,作者按完整数据计算大约低了 112 倍

他本人也写得很清楚:Jev 不会写字,所以选工具归 Jev,填参数交给便宜的小模型 Mercury。难的其实一直是下一步该干嘛,而不是搜索框里该打哪几个字。

所以——Jev 最猛的用法,往往不是自己刷网页,而是在已经整理好的工具菜单里秒选。

Computer use 只是它比较脏的一种用法;MCP/工具接口,才是它最顺的那张考卷。


四、那 Jev 有什么缺点?

这一节很重要,因为 Jev 之所以这么快,是因为它主动放弃了很多能力

它不会:

  • 给你写文章

  • 长篇解释

  • 自己完成复杂的开放式推理

  • 单看一张截图就自由操作电脑

它最舒服的场景是:答案空间已经被限制住,但需要非常频繁地做判断。

  • 选哪个工具?

  • 点哪个按钮?

  • 继续还是停止?

  • 这个任务交给谁?

  • 风险高不高?

反过来,一旦问题变成请你从零设计一个完整方案,那还是得把大模型请回来。

官方自己也就是这么定义它的:做结构化的决策,不生成文字。它是个专家,只不过只会做一件事的那种。


五、那为什么 ChatGPT、Claude 不直接也这么干?

看到这里你可能会问:那 ChatGPT、Claude 难道不能也做选择题吗?

当然能。

区别不是大模型不会选,而是它们本来就是为了更通用的任务设计的:聊天、写代码、分析、规划、生成文字,全都得干。

Jev 则把这些能力几乎全砍掉,只留下快速做结构化判断这一件事,然后围着这一件事专门优化。

所以它不是比 ChatGPT 更强,而是:

在某一类非常窄的问题上,用一把专门磨出来的刀,替掉一把瑞士军刀。

再补一句这背后的差别:传统大模型是一边想一边一个字一个字往外蹦,而 Jev 是按结构化的概率去做决策、把输出直接给到程序,采样方式、训练目标和成本延迟,都是重新设计过的。


小结

研究完我最大的体会是:未来的 AI 替你打工,靠的不是一个啥都会的天才,而是一群各司其职的打工人

说得再具体点,是这样一个三层架构:

大模型负责想,Jev 负责选,程序负责干。

  • 大模型:我要帮用户订一张明天去上海的票

  • Jev:下一步调用 search_flights

  • 程序:执行

  • Jev:下一步选第二个航班

  • 程序:执行

  • 真遇到模糊问题:再把大模型叫回来

也许未来很多 Agent 根本不会是一个超级大模型从头干到尾,而是:

一个贵的大脑 + 一堆便宜、极快、专门化的反射神经。

所以回到最开始那个问题——Jev 跟 ChatGPT、Claude 到底有啥区别?

ChatGPT 和 Claude 更像负责思考和规划的大脑,Jev 更像负责瞬间判断的反射神经。

前者想的是接下来整个任务该怎么完成,Jev 更擅长回答的是眼前这几个选择现在该选哪个。而真正负责按键、点击和输入的,是后面的程序和执行器。

ChatGPT / Claude:什么都会一点的瑞士军刀。

Jev:只负责选哪个,但这一刀磨得极快。

有时候,只会做一件事的工具,比什么都会一点的天才更好用。


Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐