BTC
ETH
HTX
SOL
BNB
Xem thị trường
简中
繁中
English
日本語
한국어
ภาษาไทย
Tiếng Việt

Jev bất ngờ bùng nổ gây sốt: Không biết trò chuyện, không viết code, chỉ đưa ra phán đoán

星球君的朋友们
Odaily资深作者
Bài viết này có khoảng 3446 từ, đọc toàn bộ bài viết mất khoảng 5 phút
Bước tiếp theo mà Jev đặt cược là: Khi con người không còn ngồi trước màn hình nữa, liệu máy móc có thể tự đưa ra quyết định không?
Tóm tắt AI
Mở rộng
  • Quan điểm cốt lõi:Cựu thành viên nòng cốt của OpenAI ra mắt mô hình Jev, tập trung vào đầu ra phán đoán và xác suất với chi phí thấp và tốc độ cao, đặt cược rằng tự động hóa AI trong kỷ nguyên Agent cần lượng lớn quyết định nhanh chóng thay vì đối thoại sâu, đồng thời đặt câu hỏi về tính phù hợp của mô hình RLHF trong các tình huống tự động hóa.
  • Yếu tố then chốt:
    1. Jev chỉ thực hiện ba loại phán đoán: Yes/No, lựa chọn và chấm điểm, trực tiếp xuất kết quả và xác suất, độ trễ đầu cuối chỉ 70-500 mili giây, chi phí đầu vào chỉ 0,042 USD mỗi triệu Token.
    2. Kiểm thử TypeSafe cho thấy Jev tăng tốc tối đa 193,6 lần, giảm chi phí 444,6 lần, đã có nhà phát triển sử dụng cho phân tích quảng cáo, dọn dẹp ngữ cảnh và đánh giá tác vụ Agent.
    3. Nhà sáng lập Diogo Almeida từng tham gia phát triển GPT-4 và RLHF, hiện đang suy ngẫm rằng RLHF nhúng sở thích con người vào quá trình huấn luyện dẫn đến AI hứa hẹn quá mức, không thể tự hoàn thành các tác vụ tự động hóa.
    4. TypeSafe đề xuất phương pháp huấn luyện RLCD, cốt lõi là để độ tin cậy xác suất đầu ra của mô hình thực sự có thể hiệu chỉnh được, nhằm hỗ trợ quyết định phân cấp trong hệ thống tự động hóa.
    5. Jev được định vị là "System One Model", đảm nhận hàng trăm nghìn phán đoán nhỏ tần suất cao mỗi ngày trong quá trình vận hành Agent, các suy luận phức tạp vẫn giao cho mô hình lớn xử lý.
    6. Tên gọi bắt nguồn từ "Nghịch lý Jevons" — khi chi phí phán đoán tiến gần đến zero, lượng gọi phán đoán AI sẽ không giảm mà còn tăng.

Tác giả gốc: Zhu Xueying

Nguồn gốc: Wall Street Insights

Hai ngày nay, một mô hình AI có chút bất thường đột nhiên gây bão.

Nó tên là Jev.

Không biết trò chuyện, không viết code, thậm chí không giống ChatGPT tạo ra cho bạn một đoạn trả lời dài. Nó chỉ làm một việc: đưa ra phán đoán.

Nhưng chính một mô hình trông như bị "cắt đi một nửa năng lực" này lại đột nhiên bùng nổ trong giới lập trình viên.

Có người dùng nó phân tích 724 quảng cáo thời gian thực trong 40 giây, tổng cộng đưa ra 8.724 phán đoán; có người tích hợp nó vào Claude Code, chuyên dọn dẹp ngữ cảnh vô dụng; còn có người để nó làm "trọng tài" cho AI Agent, kiểm tra xem nhiệm vụ có thực sự hoàn thành hay không. LangChain cũng đã bắt đầu thử nghiệm hiệu suất của Jev với vai trò bộ đánh giá Agent.

Còn tốc độ và giá cả thì càng khoa trương.

Trong bài thử nghiệm TypeSafe công bố, Jev tăng tốc tối đa khoảng 193,6 lần, chi phí giảm tối đa 444,6 lần. Đầu vào chỉ 0,042 USD mỗi triệu Token, Token đầu ra thậm chí miễn phí.

Một AI trông có ít năng lực hơn, tại sao lại bùng nổ?

Bởi vì đến thời đại Agent, điều AI thực sự cần có thể không chỉ là "suy nghĩ sâu sắc", mà còn là hàng loạt phán đoán nhanh, rẻ, với số lượng lớn: bước tiếp theo làm gì, nên gọi công cụ nào, nhiệm vụ đã hoàn thành chưa. Quan trọng hơn, những phán đoán này trong tương lai cần AI tự hoàn thành ở chế độ nền, không cần con người ngồi trước màn hình theo dõi nữa. Jev nhắm đến chính những quyết định nhỏ có thể xảy ra hàng triệu lần mỗi ngày.

Điều thú vị hơn là, nhà sáng lập mô hình Jev, Diogo Almeida, lại chính là người từng tham gia RLHF, và giờ ông bắt đầu phản tư về RLHF: phương pháp huấn luyện giúp ChatGPT trở nên hữu dụng này có thể không phù hợp với việc AI thực sự tiến tới tự động hóa.

Hơn một tháng trước, Almeida đã có một bài phát biểu. Giờ nhìn lại, bài phát biểu đó gần như chính là "bản tuyên ngôn tư tưởng" của Jev.

AI đã làm được toán cao cấp, tại sao vẫn chưa làm tốt chăm sóc khách hàng?

Lý lịch của Diogo Almeida rất đặc biệt.

Ông từng làm việc tại OpenAI, là người tham gia vào GPT-4, ChatGPT và các công việc liên quan đến InstructGPT/RLHF. Nói cách khác, ông từng trực tiếp tham gia xây dựng một trong những paradigm hậu huấn luyện quan trọng nhất của mô hình lớn ngày nay.

Nhưng trong bài phát biểu đó, ngay từ đầu ông đã tự trào rằng mình là một trong số ít người trong nội bộ OpenAI công khai "dìm" ChatGPT.

Chủ đề bài phát biểu của ông còn trực diện hơn: What's Next After RLHF?

Diogo trước tiên đặt ra một câu hỏi trông có vẻ mâu thuẫn.

Mô hình lớn ngày nay đã có thể thách thức những bài toán cực khó, code, suy luận và các benchmark khác nhau đều tăng lên không ngừng.

Nhưng đến nhiều nghiệp vụ mà doanh nghiệp thực sự muốn tự động hóa, con người vẫn luôn không thể loại bỏ.

Ví dụ chăm sóc khách hàng.

Để AI tra tài liệu, tóm tắt văn bản, soạn phản hồi, không vấn đề gì.

Nhưng nếu để AI tự quyết định: khoản tiền này có hoàn hay không? Người dùng này có cần bồi thường không?

Doanh nghiệp lập tức trở nên thận trọng.

Rõ ràng những việc này trông đơn giản hơn toán cao cấp nhiều, tại sao lại không dám giao cho AI?

Câu trả lời Diogo đưa ra rất đơn giản: Today's AI is incredible at assistance, not automation.

AI ngày nay rất giỏi giúp bạn làm việc, nhưng vẫn chưa thể tự mình làm xong việc.

Hai việc này trông chỉ khác một chút, thực tế hoàn toàn khác nhau.

Claude Code có mạnh đến đâu, bạn thường vẫn ngồi trước máy tính. Nó viết code, bạn xem; nó sửa file, bạn kiểm tra; sai rồi, bạn lại bảo nó sửa.

Vậy nên theo Diogo, Claude Code vẫn thuộc "thời đại hỗ trợ" mà ChatGPT mở ra.

Tự động hóa thực sự là gì?

Con người hoàn toàn không có mặt.

AI tự phán đoán, tự thực thi ở chế độ nền, một ngày có thể chạy hàng trăm nghìn thậm chí hàng triệu lần, bạn thậm chí sẽ không bao giờ thấy nó đã làm gì.

Vấn đề cũng đến: tại sao AI ngày nay thông minh như vậy, mà lại cứ không thể rời khỏi con người?

Diogo hướng mũi nhọn vào một thứ ông vô cùng quen thuộc — RLHF.

Khi huấn luyện AI, chúng ta đã nhét con người vào vòng lặp

Điều này có chút mỉa mai.

Bởi vì RLHF chính là một trong những hướng kỹ thuật mà Diogo năm đó tham gia thúc đẩy.

Logic cơ bản của RLHF thực ra không phức tạp: thu thập sở thích của con người, rồi để mô hình ngày càng phù hợp với sở thích của con người.

Vậy nên Diogo trong bài phát biểu đã đưa ra một lời giải thích rất trực tiếp: tại sao mô hình lớn ngày nay luôn cần có người trong vòng lặp?

Bởi vì khi huấn luyện nó, chúng ta theo nghĩa đen đã nhét con người vào vòng lặp đó.

Mô hình ngay từ đầu đã học: kiểu trả lời nào con người thích hơn?

Điều này cũng giải thích một đặc điểm mà chúng ta đã vô cùng quen thuộc của mô hình lớn — dù không biết, nó vẫn thường nói rất ra vẻ.

Diogo tại chỗ đã đưa ra một ví dụ rất "độc".

Có người gửi cho ChatGPT một đoạn ghi âm tiếng đánh rắm, bảo nó đây là một bản nhạc do mình sáng tác, nhờ nó đánh giá "chân thành, thẳng thắn".

Kết quả ChatGPT nghiêm túc khen ngợi, nói đây là một bản nhạc ambient mang không khí u ám, quái dị.

Diogo thậm chí dùng một câu để tóm tắt: "Overpromising is a feature."

Hứa quá nhiều không phải Bug, mà là feature.

Với sản phẩm trò chuyện, điều này chưa chắc đã chí mạng. Người dùng vẫn ở trước màn hình, sai rồi có thể sửa.

Nhưng hệ thống tự động hóa thực sự thì hoàn toàn khác.

Máy không quan tâm câu trả lời của bạn có hay không, nó chỉ cần biết hai điều: rốt cuộc nên làm thế nào,rốt cuộc bạn tự tin đến mức nào?

Điều này cũng giải thích tại sao Jev ra mắt hơn một tháng sau lại trông bất thường đến vậy.

Vậy nên, Jev đơn giản là không để AI "nói" nữa

Mô hình lớn thông thường dù cuối cùng chỉ cần trả lời "A hay B", thường vẫn phải trải qua quá trình sinh Token.

Jev trực tiếp cắt bỏ phần này.

Hiện tại nó chủ yếu làm ba việc:

  • Noul, trả lời Yes hay No;
  • Choice, chọn một trong vài lựa chọn;
  • Score, chấm điểm theo tiêu chuẩn.

Rồi trực tiếp trả về phán đoán và xác suất.

Không viết bài luận cho bạn, cũng không trò chuyện với bạn.

Độ trễ end-to-end chính thức công bố thấp tới 70—500 mili giây, nhanh hơn 20—200 lần so với mô hình tiên tiến, giá rẻ hơn 40—400 lần.

Nhưng điều thực sự then chốt, thực ra không phải "nhanh", mà là xác suất phía sau.

Vì vậy, TypeSafe đã đề xuất một phương pháp huấn luyện mới: RLCD, Reinforcement Learning for Calibrated Decisions, học tăng cường cho quyết định được hiệu chỉnh.

Vấn đề nó muốn giải quyết rất thực tế: nếu AI nói với bạn một việc có 80% xác suất xảy ra, 80% này rốt cuộc có thể tin được không?

Trong điều kiện lý tưởng, một loạt việc được mô hình phán đoán có 80% xác suất, cuối cùng đại khái nên có 80% thực sự xảy ra.

Điều này cực kỳ quan trọng trong hệ thống tự động hóa.

99% tự tin, có thể thực thi trực tiếp.

51% tự tin, có thể ném cho mô hình lớn mạnh hơn, đắt hơn, thậm chí chuyển cho con người.

Thứ thực sự rắc rối không phải là AI không biết, mà là AI không biết mình không biết.

Vậy nên thứ Jev thực sự muốn thay đổi, là đối tượng đầu ra của AI.

Trước đây câu trả lời ChatGPT tạo ra chủ yếu là để con người xem. Còn phán đoán và xác suất Jev đưa ra thì chuẩn bị giao trực tiếp cho phần mềm dùng.

Thời đại Agent, có thể không cần một bộ não lớn hơn

Điều này cũng giải thích tại sao Jev lại bùng nổ đúng vào lúc này.

Bởi vì sau khi Agent thực sự vận hành, nó sẽ tạo ra vô số phán đoán nhỏ:

Bước tiếp theo gọi công cụ nào? Trang web này nên nhấp nút nào? Thông tin này còn hữu ích không? Nhiệm vụ đã hoàn thành chưa? Kết quả có cần kiểm tra lại không?

Những vấn đề này nhìn riêng

công nghệ
AI
Chào mừng tham gia cộng đồng chính thức của Odaily
Nhóm đăng ký
https://t.me/Odaily_News
Nhóm trò chuyện
https://t.me/Odaily_GoldenApe
Tài khoản chính thức
https://twitter.com/OdailyChina
Nhóm trò chuyện
https://t.me/Odaily_CryptoPunk