Jev 做选择,而不只是聊天:三个演示及其背后的局限
了解 TypeSafe 的 Jev 实际能做什么:包含 Browser Use GIF 和可播放演示、1,500 封邮件的 X 案例,以及官方游戏演示。看看类型化决策何时有帮助、何时会失败,以及如何评估真实工作流。
原创说明示意图,并非厂商基准测试。模型在定义好的范围内做选择;权限、验证和执行仍由应用代码负责。
收件箱分类器无需先写一篇文章再选择文件夹。浏览器控制器通常只需在现有按钮中选一个,而不是发明新命令。这些小型决策,正是 TypeSafe AI 的首款 System One 模型 Jev 最能展现价值的地方。
TypeSafe 于 2026 年 9 月 15 日推出 Jev。关键区别不只是它又是一款快速模型,而是它返回受约束的决策,而不是开放式散文。这会改变周边程序的构建方式,却不能消除选错答案的可能性。厂商对产品的定位请参阅官方发布公告。
本指南围绕三个公开演示展开:包含可下载 GIF 和视频证据的浏览器任务、作者报告的 1,500 封邮件分类案例,以及 TypeSafe 的游戏演示。我们也会把这些例子转化为一套具体的评估计划。本文以 9 月 18 日发布的 Tistory 用例文章作为研究起点;其中提出的应用场景并未被当作经过独立验证的客户部署。
简要概览:
- Jev 可以根据文本进行选择、评分或判断命题;它不能取代能够撰写任意文本的模型。
- 类型正确的结果在语义上仍可能错误。请在代码中保留验证和最终授权。
- 浏览器录屏是真实演示,但单个任务不是通用基准。邮件案例是作者的报告,不是已发表的准确率研究。
- 从可逆的分类任务开始,在自己的数据上测量错误,并将弃答设为受支持的结果。
答案越精简,问题就越要定义清楚
API 的三种核心原语是 Choice、Score 和 Noul。Choice 从具名备选项中进行选择。Score 根据有序且有说明的等级进行评估。Noul 为一个是非命题返回概率;接近中间的值表示对该命题存在不确定性,并非中等严重程度。原语文档定义了这些契约。
实际改变在于:先定义可能结果,再请模型做判断。与其要求模型为收到的支持消息写一段说明,不如询问它属于计费、账户访问、产品缺陷还是未归类项。应用再决定应该显示在哪个队列里。这更像铁路道岔,而不是整列火车:它能帮你分流工作,却不具备完成整个流程所需的所有能力。
| 原语 | 适合提出的问题 | 应用需负责的事项 |
|---|---|---|
| Choice | 这条消息最符合哪个队列? | 定义完整的选项集,并包含人工审核路径 |
| Score | 这条消息与各个已说明的紧急程度有多吻合? | 定义等级,并检验审核人员是否意见一致 |
| Noul | 这条消息是否明确要求取消? | 决定何种概率足以触发审核或可逆操作 |
设计好的备选项本身就是工程工作的一部分。如果两个标签彼此重叠,看似自信的选择可能掩盖分类体系的问题。如果没有任何标签适用,强行要求模型选择,就会把覆盖范围不足伪装成确定性。与其再添加一个定义狭窄的类别,往往不如提供审核选项,因为它能暴露决策契约需要完善的地方。
截至 2026 年 9 月 30 日,模型参考文档列出 jev-1.13.0,输入仅支持文本,价格为每百万输入 token 0.042 美元,输出 token 免费。这只是模型的 token 价格,并非运行智能体的总成本。浏览器、内容提取、辅助模型、重试和人工审核也都应纳入运营预算。
浏览器 GIF 展示的是真实搜索,不是机票预订
Browser Use 的公开仓库 jev-ultrafast包含一段从苏黎世飞往伦敦的 Google Flights 任务录屏。Jev 会根据当前页面表示选择操作和目标。如果所选操作需要输入文字,则由另一个生成式辅助组件提供文本。这是一个组合系统,并不能证明 Jev 本身会生成所有字符串或解读视频画面。

由作者实际录制的 GIF,固定到提交 1231850a0bf1a0c0341fe408ef1668dbbfdfac46。版权归 Browser Use 所有,2026 年,MIT 许可证。它展示搜索流程,不涉及购票。同一段录屏也可在下方播放。
作者提供的 MP4,按录制速度播放,并带有浏览器控件。原始录屏和测量说明;保留的 MIT 许可证。我们检查了公开素材,但没有重新运行这项基准测试。
作者测得这段录屏的任务完成时间为 7.073 秒。计时从首次观察主页后的第一次预测开始,而不是从启动全新浏览器时开始。初始化、首次导航和运行结束后独立进行的全新验证,都不包含在计时区间内。系统检查了搜索结果,没有选择或购买机票。理解这个数字时,这些边界至关重要。
同一份报告比较了六次交替运行,每种运行时各三次。任务时间中位数从 9.450 秒降至 7.092 秒,浏览器协议调用中位数则从 1,092 次降至 101 次。两组都使用 Jev 和同一个文本辅助组件,因此这主要是运行时比较,而非两个模型家族之间的较量。作者在性能报告中明确指出,样本量较小,实时网页也存在波动。
我们的看法是,浏览器外围循环和模型本身同样值得关注。反复收集页面、解析目标和使过期决策失效,所需成本可能超过一次点击表面上展现的简单程度。再快的决策引擎,也无法弥补对目标按钮描述不准确的问题。仓库保留了独立的结果验证,因为模型宣称任务已完成,并不能证明任务真的完成。
这也正是演示的局限值得重视之处。文档所述实现并未覆盖所有画面、画布、上传流程或任意键盘控件。团队评估时,应复现自己的典型任务和失败路径,而不是从一次成功的航班搜索推断出通用浏览器能力。应把这段录屏当作一个可检查的有效组合示例。
1,500 封邮件的帖子是个有前景的案例,但缺少分母
2026 年 9 月 16 日,vogel(@ryanvogel)在 X 上发帖称,他曾用 Jev 分类自己的 1,500 封邮件,并对分类结果印象深刻。原帖附有视频。这个真实用户案例很有参考价值:工作量具体,信息来自实验报告者本人,而非一份没有署名的假设应用清单。
不过,这不是准确率报告。该帖子没有提供公开的标注测试集、实测错误率、审核人员意见一致度或错误代价。处理过多少条消息,只能说明实验规模,不能证明分类正确。阅读者应带着这一区别观看原始 X 演示;视频仅以链接形式提供,因为我们没有再分发许可。
尽管如此,电子邮件分类仍是合理的评估起点,因为它可以设计成可撤销操作。你可以在现有收件箱旁显示建议标签,保持原邮件不变,并记录人工更正。对比容易混淆的类别,例如发票与付款提醒,或取消请求与仅仅提到取消的投诉。这些案例能揭示分类是否符合你的实际工作流程。
初次部署时,不应仅仅因为分类结果看起来有把握,就自动删除邮件、发送回复或批准交易。这些操作涉及不同权限和后果。先从建议或审核队列开始,只有在测得错误模式后,才逐步启用范围狭窄的操作。这是我们建议的评估流程,并非对 X 作者实现方式的描述。
Doom 和 Wikiracing 让决策循环一目了然
TypeSafe 的发布内容包括 Doom 演示和 Wikiracing 演示,两者都从官方发布文章链接。它们直观地说明了如何重复执行决策,但不能证明 Jev 是通用视觉模型,也不能证明它能解决任意规划问题。
在 Doom 示例中,模型接收的是结构化的状态文本描述,而不是截图。在 Wikiracing 中,它会从现有链接中选择,而不是自行编造目标 URL。有意思的机制是反复进行观察、有界选择和执行。游戏演示让这个循环更容易看清,但它能否迁移到不同环境,仍有待验证。
同样的分工也体现在 TypeSafe 的智能家居演示文档中。不同问题可以分别对请求进行分类,另一个组件则负责自由形式对话,或拆分复合请求。不要把这种架构描述成一个同时生成语言并执行所有决策的单一模型。除非实现明确标明边界,否则“助手”或“智能体”这类名称很容易将边界掩盖起来。
基于已文档化的 fan-out 契约绘制的原创示意图。并行问题共享状态,但不会暗中读取彼此的答案。
Fan-out 模式可以减少多个问题依赖同一来源时的串行等待。例如,可以分别判断消息主题,以及它是否明确要求回电。依赖新选主题的问题,不能假定同一次调用中已经存在该答案。应将这种依赖拆分成后续步骤,或在代码中确定性地组合独立结果。
类型正确的答案不等于正确答案
对受约束模型最危险的误解,是认为格式良好的答案不可能出错。事实并非如此。分类器可能选中一个允许但不合适的标签;操作选择器也可能在错误的表单上选中一个有效按钮。消除接口中的格式错误散文很有价值,但这解决的是另一类故障,并不能解决对任务的误解。
TypeSafe 的 Jev 1.13 不稳定性说明最后于 9 月 17 日审阅,其中描述了算术、计数、日期比较、干扰上下文和对抗性输入方面的弱点。精确比较应通过普通代码解析日期并计算数值。不要仅仅因为模型能回答某个问题,就把确定性规则改成语义判断。
置信度文档也很重要:Choice 和 Score 会提供概率分布及衍生置信度值;Noul 没有单独的置信度字段。这个数值并不代表答案正确的普遍概率。阈值需要根据你自己的任务验证,尤其当假阳性与假阴性的后果不同时。
原创评估示意图。通过一道关卡不代表通过下一道;输出即使符合许可范围,仍须确认解释正确且操作获得授权。
涉及多语言工作时,请测试你实际服务的每种语言。模型文档指出,英语是主要训练语言,其他语言(包括 CJK 文字)的质量并不一致。因此,韩语支持队列或多语言简报档案应当作为独立评估分组,而不是假定英语分数可以直接套用。翻译也可能改变证据内容,因此评估翻译文本时应保留原文。
设计一场允许诚实失败的试验
一个有用的试点项目,应从团队能够稳定标注的决策任务开始。选择一项可撤销的任务,例如建议支持请求队列、标记可能的重复项,或为文档添加后续审核标签。不要把演示是否流畅作为成功标准。应明确你能发现哪些错误、可能漏掉哪些错误,以及每种错误会给用户造成什么代价。
- 编写决策契约。 列出所有可能结果、所需来源字段和审核选项。区分语义解释、计算和权限。
- 建立评估集。 使用你获准处理的材料。纳入典型条目、模糊边界、多语言内容、空字段,以及来源文本中的恶意指令。
- 保留独立留出集。 在一组数据上调整标准,再用未参与措辞设计的材料进行测量。记录分歧,而不是悄悄重定义预期答案。
- 测量完整工作流。 追踪各类别错误、审核率、端到端延迟、重试次数和总成本。快速的模型调用若嵌在缓慢的检索循环中,产品整体仍然很慢。
- 以建议模式运行。 记录所选选项、相关概率、模型版本和人工更正,但不要自动执行后果重大的操作。
- 逐步启用一项有界操作。 在适当情况下要求明确授权,保留审计记录,并在来源或模型版本发生变化时提供回滚路径。
这套流程有意比看一段录屏更加严格。它要验证模型是否能处理你实际遇到的案例分布,包括那些棘手情形。较高的审核率可能比少量悄无声息且代价高昂的错误更可取。应在选择阈值之前就决定如何权衡,而不是等到事故发生后再讨论。
固定一个版本以便复现评估,并记录每条结果返回的版本信息。动态别名适合探索,但即使应用代码未变,行为也可能随之改变。评估材料应让其他人能够重建标准、输入、预期结果和执行边界。这样,富有前景的实验才能成为可维护的功能,而不是一组令人印象深刻的短片。
核心结论:把判断放进有界契约
当 Jev 在清楚掌握自身规则的程序中做出小而可检查的决策时,它最有意思。浏览器视频展示了一个有效组合,邮件帖子提供了值得测试的具体实验,官方演示则揭示了决策循环。接下来要问的不是模型能否选出答案,而是系统能否在错误选择造成影响之前识别它。
来源与媒体说明
- TypeSafe:介绍 System One 模型和 Jev,2026 年 9 月 15 日;官方发布信息和游戏视频背景。
- Browser Use:jev-ultrafast,于 2026 年 9 月 30 日检查并固定到指定源码。GIF 和 MP4 版权归 Browser Use 所有,2026 年,MIT 许可证;不暗示任何关联关系。
- Browser Use:录屏和匹配运行的测量结果,于 2026 年 9 月 30 日检查;为作者测量结果,并非我们复现所得。
- X 上的 vogel:1,500 封邮件分类实验,2026 年 9 月 16 日;带有原始视频的自述用例。
- TypeSafe 的原语、模型、置信度、fan-out和智能家居演示,于 2026 年 9 月 30 日查阅。
- Jev 1.13 不稳定性说明,最后审阅于 2026 年 9 月 17 日;于 9 月 30 日查阅。
- Tistory 上的 Jev 用例文章,2026 年 9 月 18 日;研究起点,不是部署验证。
将证据与笔记放在一起
研究新模型时,请保留来源、日期,以及演示实际能证明什么。创建 Telli.sh 账户,整理自己的研究材料和衍生笔记,避免把摘要与原始证据混为一谈。