BTC
ETH
HTX
SOL
BNB
시장 동향 보기
简中
繁中
English
日本語
한국어
ภาษาไทย
Tiếng Việt

Jev가 갑자기 폭발적으로 화제를 모으며 화면을 뒤덮었다: 대화도 못 하고, 코드도 안 쓰고, 오직 판단만 한다

星球君的朋友们
Odaily资深作者
이 기사는 약 3446자로, 전체를 읽는 데 약 5분이 소요됩니다
Jev가 베팅한 다음 단계는 이것이다: 사람이 더 이상 화면 앞에 앉지 않을 때, 기계가 스스로 결정을 내릴 수 있을까?
AI 요약
펼치기
  • 핵심 관점: 전 OpenAI 핵심 멤버가 Jev 모델을 출시했다. 저비용 고속 판단과 확률 출력에 집중하며, Agent 시대의 AI 자동화에는 심층 대화가 아닌 대량의 신속한 의사결정이 필요하다고 베팅하고, 자동화 시나리오에서 RLHF 패러다임의 적용 가능성에 의문을 제기한다.
  • 핵심 요소:
    1. Jev는 Yes/No, 선택, 점수 매기기 세 가지 유형의 판단만 수행하며, 결과와 확률을 직접 출력한다. 엔드투엔드 지연 시간은 70-500밀리초, 입력은 백만 Token당 단 0.042달러다.
    2. TypeSafe 테스트에 따르면 Jev는 최대 193.6배 속도 향상, 444.6배 비용 절감을 보여주었으며, 이미 개발자들이 광고 분석, 컨텍스트 정리, Agent 작업 평가에 활용하고 있다.
    3. 창립자 Diogo Almeida는 GPT-4와 RLHF 연구개발에 참여한 바 있으며, 현재 RLHF가 인간 선호도를 훈련에 내재화하여 AI가 과도하게 약속하고 자동화 작업을 자율적으로 완수하지 못하게 만든다고 반성한다.
    4. TypeSafe는 RLCD 훈련 방법을 제안했으며, 핵심은 모델이 출력하는 확률 신뢰도를 실제로 보정 가능하게 만들어 자동화 시스템에서의 계층적 의사결정을 뒷받침하는 것이다.
    5. Jev는 "System One Model"로 포지셔닝되어, Agent 운영 중 매일 수십만 번의 고빈도 소규모 판단을 담당하며, 복잡한 추론은 여전히 대형 모델이 처리한다.
    6. 이름은 "제번스 역설"에서 유래했다 — 판단 비용이 거의 제로에 가까워지면, AI 판단 호출량은 줄어들지 않고 오히려 증가할 것이다.

원문 작성자: 주쉐잉

원문 출처: 월스트리트 견문

요 며칠 사이, 뭔가 좀 색다른 AI 모델 하나가 갑자기 화제를 휩쓸었다.

이름은 Jev.

대화도 못 하고, 코드도 안 쓰고, ChatGPT처럼 긴 답변을 생성하지도 않는다. 오직 한 가지 일만 한다: 판단하기.

그런데 이렇게 보면 "능력이 반쯤 잘려나간" 것 같은 모델이 갑자기 개발자 커뮤니티에서 인기를 끌기 시작했다.

누군가는 이걸로 40초 만에 실시간 광고 724건을 분석해 총 8724번의 판단을 내렸고, 누군가는 Claude Code에 연결해 쓸모없는 컨텍스트를 정리하는 데 쓰고 있으며, 또 누군가는 AI Agent의 "심판"으로 삼아 과업이 실제로 완수됐는지 검사하게 했다. LangChain도 이미 Jev를 Agent 평가자로서 테스트하기 시작했다.

더 놀라운 건 속도와 가격이다.

TypeSafe가 공개한 테스트에서 Jev는 최대 약 193.6배 빨라졌고, 비용은 최대 444.6배 절감됐다. 입력은 백만 Token당 단 0.042달러, 출력 Token은 심지어 무료다.

능력은 더 적어 보이는 AI가 왜 오히려 인기를 끄는 걸까?

Agent 시대에 이르러 AI가 진정으로 필요로 하는 것은 어쩌면 "깊은 사고"만이 아니라 대량의, 빠르고, 저렴한 판단이기 때문이다: 다음에 무엇을 할지, 어떤 도구를 호출할지, 과업이 실제로 완료됐는지. 더 중요한 것은, 이런 판단들이 앞으로는 AI 스스로가 백그라운드에서 완료해야 하며, 더 이상 사람이 계속 화면 앞에 앉아 지켜볼 필요가 없다는 점이다. Jev가 노리는 것은 바로 매일 수백만 번씩 일어날 수 있는 이런 작은 결정들이다.

더 흥미로운 점은, Jev 모델 창업자 Diogo Almeida가 바로 RLHF에 참여했던 사람이라는 것이다. 그런데 이제 그는 RLHF를 되돌아보기 시작했다: ChatGPT를 유용하게 만든 이 훈련 방식이, AI가 진정으로 자동화로 나아가는 데는 어쩌면 적합하지 않을 수 있다고.

한 달여 전, Almeida는 한 번 강연을 했다. 지금 다시 돌아보면, 그 강연은 거의 Jev의 "사상 설명서"였다.

AI가 고등수학은 하는데, 왜 고객서비스는 잘 못 할까?

Diogo Almeida의 이력은 상당히 특별하다.

그는 OpenAI에서 일한 적이 있으며, GPT-4, ChatGPT, 그리고 InstructGPT/RLHF 관련 작업의 참여자였다. 즉, 그는 오늘날 대형 모델에서 가장 중요한 후속 학습 패러다임 중 하나를 직접 구축하는 데 참여한 사람이다.

하지만 그 강연에서 그는 시작하자마자 자신을 놀리며, OpenAI 내부에서 공개적으로 ChatGPT를 "까는" 몇 안 되는 사람 중 하나라고 말했다.

그의 강연 주제는 더 직접적이었다: What's Next After RLHF?

Diogo는 먼저 모순처럼 보이는 질문을 던졌다.

오늘날 대형 모델은 이미 매우 어려운 수학 문제에 도전할 수 있고, 코드, 추론, 각종 benchmark가 계속 올라가고 있다.

그런데 많은 기업이 진정으로 자동화하고 싶어 하는 업무에 이르면, 사람은 끝내 떼어낼 수 없다.

예를 들어 고객서비스.

AI에게 자료를 찾게 하고, 문서를 요약하게 하고, 답변 초안을 작성하게 하는 건 문제없다.

하지만 AI 스스로 결정하게 하면: 이 돈을 환불할지 말지? 이 사용자에게 보상할지 말지?

기업은 순간 신중해진다.

분명 이런 일들은 고등수학보다 훨씬 쉬워 보이는데, 왜 오히려 AI에게 맡기기를 두려워하는 걸까?

Diogo가 내놓은 답은 간단하다: Today's AI is incredible at assistance, not automation.

오늘날의 AI는 당신의 일을 도와주는 것은 잘하지만, 아직 스스로 일을 끝내는 것은 잘 못 한다.

이 두 가지는 조금만 달라 보이지만, 실제로는 완전히 다르다.

Claude Code가 아무리 강력해도, 당신은 보통 여전히 컴퓨터 앞에 앉아 있다. 그것이 코드를 쓰면 당신이 보고, 파일을 고치면 당신이 확인하고, 틀리면 다시 고치라고 시킨다.

그래서 Diogo가 보기에 Claude Code는 여전히 ChatGPT가 연 "지원 시대"에 속한다.

진정한 자동화란 무엇인가?

사람이 아예 현장에 없는 것이다.

AI가 백그라운드에서 스스로 판단하고 스스로 실행하며, 하루에 수십만 심지어 수백만 번 작동할 수 있고, 당신은 그것이 무엇을 했는지 영원히 보지 못할 수도 있다.

그러면 문제가 생긴다: 왜 오늘날의 AI는 이렇게 똑똑한데도 유독 사람을 떼어낼 수 없는 걸까?

Diogo는 그 화살을 자신이 매우 잘 아는 무언가로 돌린다—RLHF.

우리가 AI를 훈련할 때, 이미 사람을 루프 안에 밀어 넣었다

이 일은 다소 아이러니하다.

왜냐하면 RLHF는 바로 Diogo가 당시 참여해 추진했던 기술 노선 중 하나였기 때문이다.

RLHF의 기본 논리는 사실 복잡하지 않다: 사람의 선호를 수집하고, 모델이 점점 더 사람의 선호에 부합하도록 만든다.

그래서 Diogo는 강연에서 매우 직설적인 설명을 내놓았다: 왜 오늘날의 대형 모델은 항상 누군가가 루프 안에 있어야 하는가?

그것을 훈련할 때, 우리가 문자 그대로 사람을 그 루프 안에 밀어 넣었기 때문이다.

모델은 처음부터 배우고 있었다: 어떤 답변을 사람이 더 좋아하는가?

이것은 또한 우리가 이미 매우 익숙한 대형 모델의 특징 하나를 설명한다—모르더라도, 그것은 종종 그럴듯하게 말할 수 있다.

Diogo는 현장에서 매우 독한 예를 하나 들었다.

누군가 ChatGPT에게 방귀 소리 녹음 한 토막을 보내며, 이것이 자신이 창작한 음악이라며 "진실하고 솔직하게" 평가해 달라고 했다.

결과적으로 ChatGPT는 진지하게 칭찬하기 시작하며, 이것이 매우 음산하고 기괴한 분위기의 앰비언트 음악이라고 말했다.

Diogo는 심지어 한마디로 요약했다: "Overpromising is a feature."

과잉 약속은 Bug가 아니라 feature다.

채팅 제품에게 이것은 치명적이지 않을 수 있다. 사용자가 아직 화면 앞에 있고, 틀리면 고칠 수 있다.

하지만 진정한 자동화 시스템은 완전히 다르다.

기계는 당신의 답변이 듣기 좋은지 관심 없고, 단지 두 가지를 알면 된다: 도대체 어떻게 해야 하는가, 그리고 당신이 도대체 얼마나 확신하는가?

이것은 또한 한 달여 후에 출시된 Jev가 왜 이렇게 색다르게 보이는지를 설명한다.

그래서 Jev는 아예 AI가 "말하게" 하지 않는다

일반 대형 모델은 최종적으로 "A냐 B냐"만 답하면 되는 경우에도, 흔히 Token을 생성하는 과정을 거쳐야 한다.

Jev는 이 부분을 아예 잘라냈다.

그것은 현재 주로 세 가지 일을 한다:

  • Noul, Yes냐 No냐 답하기;
  • Choice, 몇 가지 선택지 중 하나 고르기;
  • Score, 기준에 따라 점수 매기기.

그런 다음 바로 판단과 확률을 반환한다.

작은 글을 써주지도 않고, 대화를 같이 해주지도 않는다.

공식 발표된 엔드투엔드 지연은 70—500밀리초에 불과하며, 최전선 모델 대비 20—200배 빠르고, 가격은 40—400배 저렴하다.

하지만 진정으로 중요한 것은 사실 "빠름"이 아니라, 뒤에 있는 그 확률이다.

이를 위해 TypeSafe는 새로운 훈련 방법을 제안했다: RLCD, Reinforcement Learning for Calibrated Decisions, 캘리브레이션된 의사결정 강화학습.

그것이 해결하려는 문제는 매우 현실적이다: 만약 AI가 어떤 일이 80% 확률로 일어난다고 말한다면, 이 80%를 도대체 믿을 수 있는가?

이상적으로는, 모델이 80% 확률로 판단한 일련의 일들은 최종적으로 대략 80%가 실제로 일어나야 한다.

이것은 자동화 시스템에서 매우 중요하다.

99%의 확신이면, 바로 실행할 수 있다.

51%의 확신이면, 더 강력하고 더 비싼 대형 모델에 넘기거나, 심지어 사람에게 넘길 수 있다.

진짜 문제는 AI가 모르는 것이 아니라, AI가 자신이 모른다는 것을 모르는 것이다.

그래서 Jev가 진정으로 바꾸려는 것은 AI 출력의 대상이다.

과거 ChatGPT가 생성한 답변은 주로 사람이 보기 위한 것이었다. Jev가 내놓는 판단과 확률은 소프트웨어에 직접 넘겨 쓰기 위한 것이다.

Agent 시대에 필요한 것은 어쩌면 더 큰 뇌가 아닐지도 모른다

이것은 또한 Jev가 왜 하필 지금 인기를 끄는지도 설명한다.

Agent가 실제로 작동하기 시작하면, 대량의 작은 판단이 생겨나기 때문이다:

다음 단계에 어떤 도구를 호출할까? 이 웹페이지에서 어느 버튼을 눌러야 할까? 이 정보가 아직 쓸모가 있을까? 과업이 실제로 완료됐을까? 결과를 다시 검사해야 할까?

이 문제들은 하나하나 보면 어렵지 않지만, 하나의 Agent가 하루에 수십만, 수백만 번 판단해야 할 수도 있다.

만약 매번 가장 강력한 대형 모델을 불러 몇 초 동안 "깊이 숙고"하고 다시 긴 Token을 토해내게 하면, 비용과 지연은 금방 치솟는다.

Jev가 노리는 것은 바로 이 층이다.

대량의 고빈도 소규모 결정은 Jev에게 맡기고, 진정으로 복잡한 추론이 필요한 과업은 다시 대형 모델에 맡긴다.

이것이 또한 TypeSafe가 Jev를 System One Model이라고 부르는 이유다.

이 개념은 대니얼 카너먼의 "시스템 1"과 "시스템 2"에서 왔다: 하나는 빠르고 직관적인 판단을 담당하고, 하나는 느리고 복잡한 사고를 담당한다.

Jev는 심지어 이름조차 "제번스 역설"에서 왔다:

어떤 자원이 점점 더 저렴해져도, 사람들이 반드시 덜 쓰는 것은 아니고 오히려 더 많이 쓸 수 있다.

만약 AI를 한 번 호출하는 것이 매우 비싸면, 당신은 그것을 가장 중요한 곳에만 쓸 것이다.

하지만 만약 AI 판단 한 번이 거의 무시할 수 있을 만

기술
AI
Odaily 공식 커뮤니티에 가입하세요