Jev突然爆紅洗版:不會聊天,不寫程式,只做判斷
- 核心觀點:前OpenAI核心成員推出Jev模型,專注低成本高速度的判斷與機率輸出,押注Agent時代AI自動化需要海量快速決策而非深度對話,質疑RLHF範式在自動化場景的適用性。
- 關鍵要素:
- Jev僅做Yes/No、選擇、評分三類判斷,直接輸出結果和機率,端到端延遲70-500毫秒,輸入每百萬Token僅0.042美元。
- TypeSafe測試顯示Jev最高提速193.6倍,成本降低444.6倍,已有開發者用於廣告分析、上下文清理和Agent任務評估。
- 創辦人Diogo Almeida曾參與GPT-4和RLHF研發,現反思RLHF將人類偏好嵌入訓練導致AI過度承諾、無法自主完成自動化任務。
- TypeSafe提出RLCD訓練方法,核心是讓模型輸出的機率置信度真實可校準,以支撐自動化系統中的分級決策。
- Jev定位為「System One Model」,承接Agent運行中每天數十萬次的高頻小判斷,複雜推理仍交給大模型處理。
- 命名源自「傑文斯悖論」——判斷成本趨近於零時,AI判斷調用量將不降反增。
原文作者:朱雪瑩
原文來源:華爾街見聞
這兩天,一個有點反常的 AI 模型突然刷屏了。
它叫 Jev。
不會聊天,不寫程式碼,甚至不會像 ChatGPT 一樣給你生成一大段答案。它只幹一件事:做判斷。
但就是這樣一個看起來「能力被砍了一大半」的模型,卻突然在開發者圈火了。
有人用它 40 秒分析 724 條即時廣告,總共做出 8724 次判斷;有人把它接進 Claude Code,專門清理沒用的上下文;還有人讓它給 AI Agent 當「裁判」,檢查任務到底有沒有真的完成。LangChain 也已經開始測試 Jev 作為 Agent 評估器的表現。
更誇張的是速度和價格。
TypeSafe 公布的測試中,Jev 最高提速約 193.6 倍,成本最多降低 444.6 倍。輸入每百萬 Token 只要 0.042 美元,輸出 Token 甚至免費。
一個能力看起來更少的 AI,為什麼反而火了?
因為到了 Agent 時代,AI 真正需要的可能不只是「深思熟慮」,還有海量、快速、便宜的判斷:下一步做什麼、該呼叫哪個工具、任務到底完成沒有。更重要的是,這些判斷未來需要 AI 自己在後台完成,不再需要人一直坐在螢幕前盯著。Jev 看上的,就是這些每天可能發生幾百萬次的小決定。
更有意思的是,Jev 模型創始人 Diogo Almeida,恰恰參與過 RLHF,而現在他開始反思 RLHF:這套讓 ChatGPT 變得更好用的訓練方式,可能並不適合 AI 真正走向自動化。
一個多月前,Almeida 做過一場演講。現在回頭再看,那場演講幾乎就是 Jev 的「思想說明書」。

AI 都會做高等數學了,為什麼還做不好客服?
Diogo Almeida 的履歷很特殊。
他曾在 OpenAI 工作,是 GPT-4、ChatGPT 以及 InstructGPT/RLHF 相關工作的參與者。也就是說,他曾親手參與構建了今天大模型最重要的一套後訓練範式。
但在那場演講裡,他上來就調侃自己,是 OpenAI 內部少數幾個公開「黑」ChatGPT 的人之一。
他的演講主題更加直接:What's Next After RLHF?
Diogo 先提出了一個看起來很矛盾的問題。
今天的大模型已經可以挑戰非常難的數學題,程式碼、推理和各種 benchmark 一路往上走。
可到了很多企業真正想自動化的業務裡,人卻始終拿不掉。
比如客服。
讓 AI 查資料、總結文件、起草回覆,沒問題。
但如果讓 AI 自己決定:這筆錢到底退不退?這個用戶要不要賠償?
企業一下就謹慎起來了。
明明這些事情看起來比高等數學簡單得多,為什麼反而不敢交給 AI?
Diogo 給出的答案很簡單:Today's AI is incredible at assistance, not automation.
今天的 AI 很會幫你幹活,卻還不太能自己把活幹完。
這兩件事看起來只差一點,實際上完全不同。
Claude Code 再強,你通常還是坐在電腦前。它寫程式碼,你看;它改檔案,你檢查;錯了,你再讓它改。
所以在 Diogo 看來,Claude Code 依然屬於 ChatGPT 開啟的「協助時代」。
真正的自動化是什麼?
人根本不在場。
AI 在後台自己判斷、自己執行,一天可能運行幾十萬甚至幾百萬次,你甚至永遠不會看到它做了什麼。
問題也就來了:為什麼今天的 AI 這麼聰明,卻偏偏離不開人?
Diogo 把矛頭指向了一個自己非常熟悉的東西——RLHF。
我們訓練 AI 的時候,就把人塞進了迴路裡
這件事多少有點諷刺。
因為 RLHF,恰恰是 Diogo 當年參與推動的技術路線之一。
RLHF 的基本邏輯其實不複雜:收集人的偏好,然後讓模型越來越符合人的偏好。
所以 Diogo 在演講裡給出了一個非常直白的解釋:為什麼今天的大模型總需要有人在迴路裡?
因為訓練它的時候,我們字面意義上就把人塞進了那個迴路裡。
模型從一開始就在學習:什麼樣的回答,人更喜歡?
這也解釋了大模型一個我們已經非常熟悉的特點——哪怕不知道,它也經常能說得特別像那麼回事。
Diogo 在現場舉了一個很損的例子。
有人給 ChatGPT 發了一段放屁的錄音,告訴它這是自己創作的一首音樂,請它「真誠、坦率」地評價。
結果 ChatGPT 一本正經地誇了起來,說這是一首很有陰森、詭異氛圍感的環境音樂。
Diogo 甚至用了一句話總結:「Overpromising is a feature.」
過度承諾不是 Bug,是 feature。
對於聊天產品來說,這未必致命。用戶還在螢幕前,錯了可以糾正。
但真正的自動化系統完全不同。
機器不關心你的回答好不好聽,它只需要知道兩件事:到底該怎麼做,以及你到底有多大把握?
這也就解釋了,為什麼一個多月後發布的 Jev,看起來會如此反常。
所以,Jev 乾脆不讓 AI「說話」了
普通大模型哪怕最終只需要回答「A 還是 B」,往往也要經過生成 Token 的過程。
Jev 直接把這部分砍掉。
它目前主要做三件事:
- Noul,回答 Yes 還是 No;
- Choice,從幾個選項裡選一個;
- Score,按照標準打分。
然後直接返回判斷和機率。
不給你寫小作文,也不陪你聊天。
官方公布的端到端延遲低至 70—500 毫秒,相比前沿模型快 20—200 倍,價格低 40—400 倍。
但真正關鍵的,其實不是「快」,是後面那個機率。
為此,TypeSafe 提出了一套新的訓練方法:RLCD,Reinforcement Learning for Calibrated Decisions,校準決策強化學習。
它想解決的問題非常現實:如果 AI 告訴你一件事有 80% 的機率發生,這個 80% 到底能不能信?
理想情況下,模型判斷為 80% 機率的一批事情,最後就應該大約有 80% 真的發生。
這在自動化系統裡非常重要。
99% 的把握,可以直接執行。
51% 的把握,可以扔給更強、更貴的大模型,甚至轉給人。
真正麻煩的不是 AI 不知道,是 AI 不知道自己不知道。
所以 Jev 真正想改變的,是 AI 輸出的對象。
過去 ChatGPT 生成的答案,主要是給人看的。Jev 給出的判斷和機率,則是準備直接交給軟體用的。
Agent 時代,可能需要的不是一個更大的大腦
這也解釋了為什麼 Jev 偏偏在現在火了。
因為 Agent 真正運行起來以後,會產生海量的小判斷:
下一步呼叫哪個工具?這個網頁該點哪個按鈕?這條資訊還有沒有用?任務到底完成沒有?結果要不要重新檢查?
這些問題單個看都不難,但一個 Agent 一天可能需要判斷幾十萬、幾百萬次。
如果每一次都叫最強的大模型,花幾秒鐘「深思熟慮」,再吐出一大段 Token,成本和延遲很快就上去了。
Jev 想搶的,就是這一層。
大量高頻的小決定交給 Jev,真正需要複雜推理的任務,再交給大模型。
這也是為什麼 TypeSafe 把 Jev 叫做 System One Model。
這個概念來自丹尼爾·卡尼曼的「系統 1」和「系統 2」:一個負責快速、直覺式的判斷,一個負責慢速、複雜的思考。
Jev 甚至連名字都來自「傑文斯悖論」:
一種資源變得越來越便宜,人們未必會少用,反而可能用得更多。
如果呼叫一次 AI 很貴,你只會把它用在最重要的地方。
但如果一次 AI 判斷便宜到幾乎可以忽略呢?
一封郵件、一條日誌、一次工具呼叫、一個網頁按鈕、Agent 執行的每一步,都可能加入一次 AI 判斷。
當然,現在就說 Jev 代表下一代 AI,還太早。
它所謂的「零幻覺」,更多意味著不會跳出規定的答案類型亂編,不代表不會選錯;193.6 倍、444.6 倍這樣的極端數據,也主要來自 TypeSafe 自己的測試。
但 Jev 這次爆火真正值得關注的,可能不是它能不能挑戰 GPT 或者 Claude。
而是一個參與造出 ChatGPT 的人,正在重新追問一個更底層的問題:
過去幾年,整個行業都在想,怎樣讓 AI 想得更久、說得更多。
但如果未來真正需要的是幾十億次機器之間的判斷,AI 為什麼每一次都要先「說一段話」?
ChatGPT 教會了機器怎麼和人說話。
而 Jev 押注的下一步是:當人不再坐在螢幕前,機器能不能自己做決定?


