打开APP

不会聊天、不写文字,Jev为什么突然火了

TypeSafe发布仅负责判断、分类的AI模型Jev,可处理工作中的分类、评分等任务,多家公司测试后认为其速度快、成本低,适合与大模型配合分工。

老板说“有个小需求”,你还没来得及回复,旁边已经弹出一个判断:“小需求”真的小吗?否,98%。

如果把Jev拉进工作群,大概就会有下面这番画面。

来源于网络的虚构梗图

来源于网络的虚构梗图

笑点来自大家熟悉的需求膨胀。但它恰好点出了 Jev 的定位:它不负责写方案,也不替人做最终决定,而是把“是不是小需求”“风险高不高”“该不该继续”“要不要升级处理”这类原本依赖经验的模糊判断,转成软件可以直接使用的分类、概率和置信度。

TypeSafe AI 新发布的 Jev 不会聊天、不会写文章,也不会生成代码。它只在开发者预设的选项和标准中作出判断。根据 TypeSafe 官方数据,Jev 的端到端响应时间约为70—500毫秒,每百万输入Token收费0.042美元,不收输出费用;每项判断都会附带概率和置信度。

它真正值得关注的地方,不只是AI行业又多了一个模型,而是提出了一种新的分工:大模型负责复杂思考和内容生成,Jev这类模型负责分类、路由、检查与放行。

这种分工能不能成立?本文结合TypeSafe创始人 Diogo Almeida 的官方介绍,以及Every、Box、Vercel和LangChain的测试与演示,看看Jev究竟解决了什么问题,又有哪些能力尚未得到证明。

Jev介绍

TypeSafe创始人Diogo Almeida曾在OpenAI参与指令跟随研究,是2022年InstructGPT论文的共同作者之一。这项研究帮助推动了ChatGPT的诞生。

在官方介绍中,他提出了一个贯穿自己过去几年研究的问题:模型已经很会聊天,为什么大规模自动化没有随之发生?

Almeida认为,软件需要一个更容易依赖的AI接口。聊天模型可以写出完整意见,但程序往往只需要其中一个判断:这封邮件是否紧急,这份报告属于哪一类,这一步应该继续还是交给人处理。

以客服邮件为例,用户可能想读一段情绪分析,程序却更需要“客户表达愤怒的概率”,再据此决定是否升级处理。

普通大模型也能通过结构化输出接口返回数字、分类和JSON,并不必然先写一篇解释。Jev的区别在于,它从产品设计上就放弃自由文本生成,专门处理这类判断。据TypeSafe介绍,它可以并行回答多个问题,直接返回软件可用的结构化结果。

开发者先定义问题、候选项和评分标准,Jev主要提供三类输出:

选择:从给定选项中选择,并提供相关概率;

评分:按照预先定义的等级或标准评价;

是非判断:估计某个判断成立的概率。

例如,程序可以提供“普通处理、升级处理、人工复核”三个选项,Jev负责判断,后续操作由代码按照规则执行。

TypeSafe将这一类模型称为“System One Models”,借用了Daniel Kahneman在《思考,快与慢》中对快速直觉与慢速推理的区分。这是对模型定位的比喻,并不意味着它复制了人的直觉。

官方称,Jev采用新的模型架构、并行采样器和“校准决策强化学习”(RLCD)训练方法。所谓校准,是希望模型表达的不确定性与实际表现相符:例如,对一批事件都预测90%的发生概率,长期观察时应有约90%真正发生。

如果这些概率在具体业务中经过验证,开发者就可以据此设置自动处理和人工复核的门槛。但概率和置信度不能直接当成保证,阈值是否适用仍需业务数据检验。

TypeSafe还使用了“不会幻觉”的说法。其明确保证的是输出符合预设类型和结构,不能延伸为判断永远正确。即使程序只允许“通过”和“拒绝”,模型仍可能选错。

官方四项工作流测试给出了193.6倍的速度优势和444.6倍的成本优势。值得注意的是,参考答案来自其他模型的平均预测,测试也要求对比模型返回结构化概率。官方承认这些数字可能处在真实收益的较高端,具体效果仍要看任务。

Jev测评

文章检查,0.7秒完成777次判断

Jev能不能处理有主观性的文字评价?Every作者Mike Taylor拿自己的文章做了实验。

他选取27篇已发表文章,再加入10篇刻意带有AI写作风格的文本。每篇都接受21项检查,包括是否重复观点却不补充证据、是否强行凑出对称的正反论述、是否把简单问题讲得过于啰嗦。

37篇文章、777项判断,在不到0.7秒内返回结果,估算成本约0.0025美元。

Taylor浏览后认为,结果与自己对哪些文章更依赖AI的印象相符。但这些检查针对的是写作特征,不能据此鉴定文章是否由AI创作。他也表示,在投入生产之前,需要更充分地验证准确性。

Every CEO Dan Shipper又做了一项对照测试:准备12段合成文本,其中6段清晰,6段被故意加入问题。检查标准包括动作有没有解释清楚、推理有没有缺环、是否用实现机制替代了预期结果,以及是否歪曲来源。

Jev处理每段的中位时间为0.35秒,Fable 5.1在高推理强度下为8.83秒,约相差25倍;估算费用约为后者的五百八十分之一。7处预设问题中,Jev找到6处,Fable找到全部7处。

漏掉的问题是一句“由家长和工作人员共同教授的共享预约日历”。日历怎么被“教授”?这个语义不清的动作,Jev连续三次都没有识别出来。

这是一项很小的测试,却呈现了一个具体取舍:快速、便宜的检查可以多做,但反复调用未必能消除同一种盲区。

Every因此把它比作知识工作的“linter”,也就是类似代码静态检查工具的角色:按照明确标准标记可疑内容,再交给写作模型或人复核。它暂时不能替代编辑,但让每篇文章、每个版本都接受一轮初筛,变得更容易尝试。

放进企业流程,判断完直接决定文件去哪

Box创始人兼CEO Aaron Levie 展示的场景,是处理企业文件。

程序从Box读取一份事故报告,让Jev判断它是否面向客户、严重程度如何,再依据结果将文件移入“升级处理”“持续观察”或“复核”文件夹,并把结果写入文件的元数据。

这段演示中,Jev负责理解材料和返回判断,程序负责移动文件、更新记录。原本需要人读完报告再操作的几个步骤,被串成了一条流程。

Levie还提到保险理赔、合同管理、贷款处理、安全审查和客户日志分析等潜在用途。这些行业都有类似需求:材料属于哪一类,是否紧急,应该交给谁。

他形容演示几乎即时完成、成本极低,但没有提供具体耗时、样本量或准确率。因此,这里展示的是一个可以实现的流程,并非这些行业已完成部署的证明。

工程测试:检查命令安全,给智能体打分

Vercel 创始人兼 CEO Guillermo Rauch分享了团队对编程智能体fx的测试。fx的自动模式会在命令执行前进行安全审查,原先使用的模型是GPT-5.6 Luna。

团队成员Pranit 称,换用Jev后,测试速度约快5—18倍,准确率也更高。Rauch进一步指出,P95这一指标上的速度优势最高达18倍。换成耗时表达,即相应测试中的P95延迟约为对比模型的十八分之一。

P95是第95百分位延迟:约95%的请求能在这一时间内完成,剩余约5%更慢。它关注的是偏慢请求的体验,不能与平均速度混为一谈。

Rauch认为,Jev有望成为该安全审查模块的新默认模型。不过,这条帖子没有披露具体准确率和样本规模,不能据此认定它在所有命令安全任务上都更可靠。

另一个已确认的进展是,Vercel宣布在AI Gateway接入Jev,开发者可以通过其接口进行分类、风险评分和流程分流。平台接入与团队测试是两项相关进展,现有材料没有证明前者完全由后者促成。

LangChain团队则测试了Jev给智能体打分的表现:把5条固定的天气智能体运行记录,各重复评判100次,与人工标注比较。Jev的500次合格与否判断全部一致;Terra、Luna和Sonnet 4.6分别为99.8%、96.4%和80%。其连续评分方差也更低。

团队报告的平均耗时为0.44秒,每次约0.00035美元。这支持了进一步测试的价值,但样本仍只有5条,500次是重复判断次数。它不能证明Jev对500种不同情况都能判断正确,也不能保证结果适用于其他业务。

Braintrust创始人兼CEO Ankur Goyal也宣布将Jev接入评分工具,并声称切换后评分费用可降至原来的约四百分之一。他同时表示还会继续评测,因此这更适合作为工具接入的补充信息,而非完整的质量验证。

从命令检查到智能体评分,这些尝试都在回答同一个实际问题:当AI不断执行任务,能否以足够低的成本,持续检查它做得对不对?

分类并不新,争议在于Jev能把它做得多通用

围绕Jev的分歧,核心在于如何理解它的新意。分类、评分和路由早已存在,但把这些能力做成一个能够适应不同任务、方便软件调用的模型,是否仍然算得上重要进展?业内对此有不同看法。

机器学习研究员、《Build a Large Language Model (From Scratch)》作者 Sebastian Raschka 认为,用“不过是个分类器”概括Jev,忽略了它的泛化能力。他指出,过去的编码器式分类模型通常针对特定用途,并存在一定限制;Jev让他看重的,是跨任务应用的潜力。他还推测,关键优势可能更多来自训练数据,而不只是训练算法,再加上良好的接口设计。

前微软Bing、Windows和广告业务负责人 Mikhail Parakhin 则描述了一种两极反应:在他的社交圈里,ChatGPT之后才接触AI的人兴奋得像刚发现火,而更早从事机器学习的人,有些不明白这为什么值得成为新闻。这条评论反映了部分从业者对Jev“新颖性”的保留态度。

评价Jev,需要同时看技术上的新意和实际使用价值。分类、评分并不是新任务,但将这些能力做得更通用、更便宜、更容易接入软件,仍可能带来有意义的改进。关键在于,它能否减少开发者为不同任务反复训练和适配模型的工作,同时满足具体业务对可靠性的要求。

现阶段,将Jev称为技术革命还为时过早,简单归为“老分类器的新包装”也不足以说明它的价值。它尝试让专门的判断模型承担软件中频繁出现的小决定,与负责生成和复杂推理的大模型配合。这种分工能否成为普遍做法,还需要时间和实际应用来检验。

【本文由投资界合作伙伴硅星人授权发布,本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

相关企业

AI数据总览

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】