你最近应该已经多次刷到过Jev,但还没有着手尝试,也不一定搞懂了它是个啥。
(资料图片仅供参考)
这是一个很奇怪的AI 产品。不会跟你聊天,不会写文章,不会写代码,甚至不会给你生成一句完整的话。
9月15日发布到现在,却热度不减。
最开始的热度来自创始人本身。
Diogo Almeida,是前 OpenAI 研究员,参与了RLHF 研究,是让 ChatGPT 变得“会说话”的人之一。
他创立的公司叫TypeSafe AI ,刚刚宣布完成 4000 万美元种子轮融资。
Diogo Almeida 认为,AI 行业可能在一个关键问题上走偏了。
他在 X 上发帖称,共同发明 ChatGPT 之后,就一直问自己,为什么超人类聊天模型没有带来 AGI?
过去 2 年,他一直在隐秘中构建一种新的模型训练方法(RLCD),由此拿出了一种新型的前沿 AI 模型Jev。
“据我所知,这是通往基于 AI 的经济革命的最短路径”。他说。
价格也是Jev 出圈的另一个原因。
TypeSafe 目前给出的价格是每百万输入 token 约 0.042 美元,也就是每十亿输入 token 42 美元,输出不收费。
官方称,在特定的 System One 任务上,Jev 相比同类前沿大模型可以达到约 20—200 倍速度、40—400 倍成本优势;官方公布的端到端响应时间约为 70—500 毫秒。
但更重要的走红原因,还是 Jev 开启的完全不同 的 AI 产品形态,及路径逻辑。
发布 Jev 时,Diogo Almeida 还宣布一种新的模型类别System One Models。
名字来自心理学家 Daniel Kahneman《思考,快与慢》中的“系统1”和“系统2”。
简单说,ChatGPT 更像一个需要思考、推理、写答案的 AI 助手。
Jev 则更像人的直觉判断。
比如,看到一封邮件,它不需要告诉你为什么,而是直接判断,是不是垃圾邮件?看到一张客服工单,它不需要写分析报告,而是直接判断,应该交给哪个部门?看到一个 AI Agent 刚刚执行完一项任务,它不需要长篇点评,而是直接判断,通过,还是不通过。
所以,Jev 最核心的区别就是,ChatGPT 是给人看的,Jev 是给软件用的。
传统大模型的基本工作方式,是输入文字,输出文字。
比如,你问它,“这条客服消息应该归到哪个部门?”它可能回答,“根据用户描述,这个问题主要涉及订单退款,因此建议将其转交给售后团队处理……”
对人来说,这没什么问题。
但对于软件来说,这就很麻烦。程序真正想要的可能只有一个值,“售后”。但它还得从 AI 的一大段话里把答案解析出来。而下一次,模型还可能换一种说法。
所以开发者过去一直在想办法给大模型套上 JSON、Structured Output、Function Calling 等各种约束,让它说话的时候尽可能像一个程序。
Jev 的解决方案就是,干脆不要让 AI 说话。
你给它一份“状态”,再给它几个已经定义好的问题。
它只返回程序能够直接使用的结构化结果。
比如,状态:用户说“我的信用卡被扣了两次钱,而且鞋子尺码也发错了”。
问题一:应该交给哪个部门?
它只能在“退换货、账务、物流”里面选择。
问题二:用户是否要求退款?
回答一个 0 到 1 的概率。
问题三:用户是否处于高情绪状态?
还是一个判断。
Jev 目前主要有三种问题类型。
第一种是 Choice,也就是选择题。
你给它几个确定选项,它选择其中一个,并给出各个选项的概率。
第二种是 Score,也就是评分。
你可以定义几个等级,让它判断一份材料处于什么程度。
第三种是 Noul,可以理解成判断题。
答案就是“是”或者“否”,同时返回相应概率。
最重要的一点是,这些问题可以一次性并行处理。
也就是说,一条客服记录过来,你可以同时问它,是不是退款请求?是不是投诉?应该分给哪个部门?客户情绪是否激烈?是否需要人工介入?
然后,一次拿回全部结果。而不是每一个问题都生成一段文字。
与之相比,ChatGPT 的强项是开放式任务。
写一篇文章、分析一份报告、写代码、做复杂推理、跟人对话,这些都需要语言生成。
Jev 则把任务缩小到了一个非常具体的范围
,即判断。而且是可以提前定义答案范围的判断。
TypeSafe 说,Jev “不会幻觉”。这就很容易理解了。
当然,不是说 Jev 永远不会判断错。
而是说,你给它规定了三个答案,它不会突然创造第四个答案。
这也是为什么 Jev 特别强调 probability 和 confidence。
它不仅告诉你答案,还告诉你自己有多大把握。
于是软件就可以自己决定,95%以上,自动处理;60%,交给人工确认;30%,直接转给更强的大模型。
现实情况也是, AI 应用场景里,确实藏着大量这样的“小判断”。
客服工单该给谁?邮件是不是垃圾邮件?这个订单是不是欺诈?这个用户是不是高风险?这段内容是否违反规则?这个 Agent 下一步应该调用哪个工具?一条销售线索值不值得跟进?
这些事情可能根本不需要一个 ChatGPT 这样的大模型来解决。
尤其是在 AI Agent 越来越成为互联网流量的主要来源时,这个思路就更有趋势感。
因为一个 Agent 往往不是“问一次 AI,得到一个答案”就结束了。
它往往需要判断下一步做什么、选择工具、执行工具、判断执行结果、判断是否继续、判断是否需要人工介入,最后才是让大模型生成答案。
如果每一次都调用昂贵的大模型,速度和成本都会迅速增加。
Jev 在做的,正是把这些大量简单、重复、结构明确的判断拿出来,让大模型负责复杂思考,而 Jev 负责快速判断。
目前, LangChain 已经把它放进 Agent 的执行循环里研究,Langfuse 则尝试用它做 AI 输出评估。
Langfuse 公布的一项测试中,用 Jev 对 6003 个 rubric 检查进行评分,它与 Claude Fable 5.1 的判断一致率为 91.5%,而测试中 Jev 的成本明显低于参与比较的几款大模型。
9月20日,LangChain 旗下 LangSmith 又公布了一项针对 Agent 评测的测试,报告称 Jev 在连续评分任务中的结果波动显著低于参与比较的模型,同时平均单次耗时约 0.44 秒。
当然,也很容易理解,Jev 不是 ChatGPT 的替代品,因为后者能做的他也做不了。
作为普通用户,你也可能暂时不会直接打开 Jev 聊天。但未来,或现在,你使用的很多软件,可能正在后台偷偷调用它。
最终, AI 更可能的形态应该不是聊天工具,而是像数据库、搜索、API 一样,变成所有软件背后随时可以调用的一种基础能力。
因为一个技术变得越高效,成本越低,使用量才可能暴涨。正如煤炭蒸汽机效率提高后,人类并没有因此少烧煤,反而消耗了更多煤。
TypeSafe 认为,AI 可能也会这样。当软件到处使用智能时,AGI 应该也就到了。
那么,如何可以去体验 Jev?
一个是去 TypeSafe 官网排队申请(话说它的官网真的不是给人类看的,满屏的“二维码风”),通过后会收到一封“You‘re in!”的邮件,点进去注册账号就能拿到 API 密钥。
然后,让 Codex 安装 TypeSafe Skill;在后台创建 API Key。注意提问时加一句“Use the TypeSafe skill”。
几分钟接入,就能让 Agent 更快、更便宜地处理分类、判断和结构化决策。
另一个途径就是 OpenRouter。不用排队,注册后直接调用 typesafe/jev 模型,按量付费。
基于此,已经有很多用户在 X 是分享Jev 的场景可能
比如,给 AI 助手当“决策器”
代表性案例是 Browser Use 开源的 Jev Ultrafast:不再每步截图给视觉模型看,而是把网页拆成带编号的元素清单,让 Jev 选“做什么、对哪个”。
比如海量数据的逐条分类。
输出免费、输入极便宜,对几百万条数据逐条问“这条要不要报警”、“这封邮件是不是诈骗”等,十分省钱,而用大模型的话太贵且太慢。
还有下面这些代表性的场景和案例。
暂时放下 ChatGPT ,去试试 Jev 吧……
相关文章
-
暂时忘了ChatGPT,去试试Jev吧!_快讯
-
佰维存储(688525.SH):公司OEC产品目前正在与客户合作开发6.4TNP
-
加拿大央行释放加息信号叠加油价反弹,USD/CAD接近密集压力区间
-
即时:煤炭板块午后拉升 大有能源涨停
-
开海迎丰收 连云港海鲜市场迎来购销旺季
-
固德电材:截至2026年9月18日股东总数为11,477户|焦点报道
-
阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中
-
焦点热门:干饭哥又破纪录!盛李豪/王子菲破10米气步枪混团资格赛
-
生意社:9月21日国内纯碱库存变化
-
2026国家制造强国建设论坛在合肥举行
-
长江民歌会唱响浪漫宣恩
-
9月21日创业板50ETF华夏基金份额减少400万份,重仓股中际旭创、
-
今日看点:9月21日红利质量ETF华夏基金份额增加400万份,重仓股同
-
龙腾光电:融资净买入178.62万元,融资余额9491.63万元 每日快报
-
官宣退役!20年生涯结束!再见了,NBA
-
亚马逊封锁Meta旗下Muse AI购物代理,AI代购时代规则之争开始
-
每日快讯!航天电器财务总监辞职,去年薪酬约113万
-
三元生物最新筹码趋于集中
-
“924”行情两周年!超1400只个股翻倍
-
快资讯:艾领创2026年上半年净利465.77万元同比增长9597.27% 订