封面提示词:A giant ancient deer-like mythical beast, far larger than a human, with massive, gnarled, withered wood-like antlers. The deer's head is cold and stern with pale blue glowing eyes, its neck covered in thick grayish-white fur, and its torso clad in coarse blue-gray scales. Its limbs are thick and powerful, with fur fluttering in the wind, exuding an aura of majesty and ancient sorrow. Standing beside the beast is a Taoist priest with an immortal air, his white hair tied in a bun, wearing a grayish-white ancient-style robe with fluttering sleeves and ribbons, cradling an ancient zither in his arms. --ar 16:9 --exp 40 --sref 3818841042 2306239852 1759006419 --profile 1c1f1di --hd --raw

上周精选✦

TypeSafe 的新型模型 JEV

上周最火的模型是由 AI 公司 TypeSafe 开发的 JEV 模型。它和现在的大语言模型(LLM)截然不同,你可以把它当成一个通用的分类器。

它不会像普通大语言模型那样输出长篇文案或进行对话,而只针对输入的问题给出判断。主要支持三种类型的判断:

  1. 选择题:比如"以下哪个选项更好",直接输出判断后的选项结果
  2. 内容打分:不局限于纯数字打分,还包括好中差、优质劣质,或者 1-10 分、0-100 分等各种通用评分
  3. 是非判断:回答诸如"是真的吗"、"能用吗"这类通用问题,输出布尔值(0 和 1)

举个例子:

普通 LLM 的处理方式是看完一段字幕,分析哪里适合剪辑、说明理由并给出剪辑方案;而 JEV 的任务则是对给定的字幕逐句进行独立判断,比如是否包含完整观点、是否有具体建议、是否依赖前文,最终给出每一句对应的"是/否"结果。

官方将它的定位称为 System 1(系统 1),即快思考慢思考中的"快思考":属于不需要复杂推理、下意识得出结果的思考模式。

它最大的亮点在于速度。

在日常使用 LLM 编写程序并进行大批量数据或内容处理时,往往面临速度过慢的问题;而 JEV 的速度极快,成本极低,尤其适合大规模数据处理。

核心机制与训练方式

  • 训练路线称为 RLCD(面向校准决策的强化学习),核心在于优化判断与概率,让概率能够真实反映结果的不确定性。
  • 官方批评了当前的 RLHF,认为人们在表达时往往偏好特定说法,却无法提供可信的不确定性。
  • 它改变了架构、采样器和训练算法,并非只是给普通模型套上提示词,也没有完全绕开预训练阶段;底座信息、网络结构、奖励公式等细节目前尚未公开,后续会开源 。
  • 极速的原因在于:普通自回归模型即便最终只需要 JSON 格式,在思考和输出字段、取值的过程中也需要逐 token 生成;而 JEV 官方表示其会先并行输出判断所需的概率,完全省去生成自由文本和逐 token 吐字的过程,直接返回极简结果 。
  • 支持多问题并行评估:可以在一次请求中同时输入多个独立问题,无需让每个问题都走一遍对话流,且增加问题对响应时间的影响很小(例如对同一段字幕检查 10 个维度,它能一次性返回所有独立判断供代码调用;若用普通 LLM,要么开 10 个并发推高成本,要么串流处理极其耗时,且即便是并发往往也不如 JEV 迅速)。

核心优势:低延迟、多问题并行评估、输出种类固定、输出置信度概率、成本极低:输出免费,输入仅需 $0.042 / 百万 token。

当前劣势与局限

  1. 多跳推理和复杂指代能力较弱,不适合让它处理需要绕几层关系才能推导出的结论
  2. 数学计算、计数和日期处理不可靠(这部分建议交由代码完成)
  3. 倾向于字面理解,无法理解隐喻
  4. 无关的上下文会降低其准确率,需要前置过滤和清洗检索到的内容
  5. 容易受到恶意输入影响,提示词注入等风险比前沿大语言模型更为严重
  6. 各个独立判断之间无法保证逻辑一致性
  7. 目前仅支持纯文本输入,暂不支持音频与视频
  8. 中文表现弱于英文(训练阶段未经历足够的多语言数据训练)
  9. 不会生成文字解释,因此遇到错误时,需要主动检查输入问题、评判标准并定位对照样本

怎么使用

目前他们官方渠道的使用资格需要申请,一般申请后一天多就可以获得资格。

建议在申请的时候,把问题回答一下(申请方式分为“只填邮箱”和“回答问题”两种,建议选择回答问题)。

另外,还有两个渠道可以免费使用这个模型,而且不需要申请:Vercel 的 AI Gateway、OpenRouter。它的官方后台在这里官方文档在这里

在适配上,JEV 的适配主要分成两层。接通接口非常简单,但要发挥它的优势,需要把任务改造成明确的小判断和代码组合。对于已经用大语言模型做分类和评分的地方,改动比较小;但对于聊天和自主规划的 Agent,则需要做比较大的改动。

接口层: 它的原生协议和聊天模型不同。通常大语言模型是接收 messages,返回消息或工具调用;而 JEV 的原生接口输入是模型、待评估的材料和问题,输出则是按问题 ID 返回选择、评分或概率。所以这块需要重新进行适配。

POST <https://api.typesafe.ai/v1/systemone>

输入model + state + questions
输出answers + usage

提示词方面,建议从"描述任务"转变为"定义判断标准"。这里有两个容易踩的坑:

  1. 概率部分代表的是命题成立的概率,而不是质量得分
  2. 评分时必须明确定义等级和含义,不能只要求"给个分数",必须定义每个分数的具体要求

工作流层面: 建议把独立问题合并,这样才能发挥它的速度优势。传统流程可能是依次判断是否值得处理、判断类型、判断质量、判断下一步;而 JEV 可以给出同一份材料,一次性问完所有需要做的判断,让它并发完成,最终返回一个代码组合的结果。

此外,JEV 虽然支持包含聊天历史,但并不要求把全部历史原样塞回去。建议先检索出材料,明确相关字段组织,把比较确定性的规则留在代码里。在工具调用方面,它能够选工具,但不能直接接管整个 Agent,所以很多时候依然需要大语言模型配合

团队背景

查了一下他们的创始团队背景:

CEO Diogo Almeida : 曾任职于 OpenAI 和谷歌,参与过 InstructGPT 和 ChatGPT 的核心项目工作。官网称其为 RLHF 和 InstructGPT 的共同发明者。

核实发现: 在 InstructGPT 论文中,其名字排在第四位,带星号标注为主要作者,ChatGPT 2022 年发布的文章中将其列入贡献名单,GPT-4 技术报告在指令遵循与 API 测评部分列出了其名字,RLHF 发明者这点不太好查,没有查到具体说法,因为涉及到非常多人的长期合作。

联合创始人兼 COO Sasha Sheng: 曾是 Meta 和 FAIR 的研究工程师,负责信息流 AI 产品和研究部分,有多模态模型研究经历

CTO Erik Gafni: 连续创业者,曾创办过一家癌症筛查公司;背景更偏向机器学习的系统性落地,曾在 Invitae、Freenome 工作.

公司在 9 月 15 日完成了由 DCVC 领投的 4000 万美元融资。在公布融资之前,他们进行了约两年的隐形开发。

An image to describe post

一些有意思的 Jev 案例

启发了学界,类似的模型

它们这几天爆火,是因为本身的训练方式和输出结果其实比较容易复刻。虽然达到相当的能力不容易,但训练一个小模型相对还是非常快速的。

由于 GPT-6 这种能力的提升,很多公司开始训练这类模型:

Devin:原来做 AI 编程的这家公司训练了一个叫 Kev 0.5B 的模型,带有与 TypeSafe 兼容的 API,基于 Qwen2.5-0.5B(更正为 0.5B)进行后训练。主要优势在于它只有 0.5B,所以直接在 MacBook Pro 上就能进行训练和微调。

An image to describe post

CUA:训练了一个叫 CUA-S1 模型,专为 computer use 打造。他们会有多个模型系列,目前也开源了第一个,叫 CUA-S1-formers。
An image to describe post