말하지 않는 AI Jev, 판정만 하는 'System One' 모델이 지금 핫한 이유
2026년 9월 15일 공개된 Jev(제브)는 이상한 AI다. 글을 못 쓴다. 코드도 못 짠다. 설명도 안 한다. 할 수 있는 것은 단 하나. 주어진 선택지에서 답을 고르고, 그 판단에 대한 보정된 확신도(%)를 돌려주는 것. ex-OpenAI 연구자가 만든 이 '판정 전용 모델'이 출시 나흘 만에 개발자 커뮤니티를 달구고 있다. 생성형 AI 시대에 생성을 버린 모델이 왜 주목받는지 분석했다. (참고: 한국 뉴스의 JEV는 일본뇌염 바이러스 약자와 겹친다. 그쪽은 질병관리청 계절 경보이고, 이 글은 AI 모델 이야기다.)
만든 곳은 TypeSafe AI, 창업자는 InstructGPT와 RLHF 연구에 참여했던 ex-OpenAI 연구자 Diogo Almeida다. 모델 이름은 경제학자 윌리엄 스탠리 제번스(Jevons)에서 따왔다. 효율이 좋아지면 소비가 오히려 늘어난다는 '제번스의 역설'의 그 제번스다. 이름부터가 선언인 셈이다. 판정 비용이 충분히 싸지면, 세상은 지금보다 훨씬 많은 것을 AI에게 판정시키게 될 것이라는. 현재는 대기자 명단 기반 얼리 액세스 단계다.
| 항목 | 내용 |
|---|---|
| 모델 | Jev: TypeSafe AI (2026.09.15 공개, 웨이트리스트 얼리 액세스) |
| 창업자 | Diogo Almeida (ex-OpenAI, InstructGPT·RLHF 연구 참여) |
| 출력 | 텍스트 생성 없음. 선택지 판정·점수·예/아니오 + 보정된 확신도 |
| 학습 방식 | RLCD (Reinforcement Learning for Calibrated Decisions), "System One" 모델 클래스 |
| 속도·가격 | 지연 70~500ms · 입력 $0.042/1M 토큰 · 출력 토큰 무료 |
| 성능(자사 평가) | 4개 워크플로 평균 67.8%: GPT-5.6(74.1%)보다 낮고 Sonnet 5와 대등, 호출당 약 $0.0004 |
Jev는 정확히 무엇을 하는 모델인가?
Jev는 입력을 받아 타입이 정해진 결정(typed decision)만 반환한다. 미리 정의된 선택지 중 하나, 점수, 또는 예/아니오. 그리고 매 판정에 보정된(calibrated) 확신도를 붙인다. "확신도 92%"라고 말하면 실제로 100번 중 92번쯤 맞는다는 뜻이 되도록 훈련됐다는 것이 핵심 주장이다.
TypeSafe는 이것을 "System One" 모델이라 부른다. 심리학자 카너먼의 빠르고 직관적인 사고(시스템 1)에서 딴 이름이다. 천천히 추론하며 긴 답을 쓰는 기존 LLM(시스템 2)과 달리, 즉각적 판단만 대량으로 처리한다. 훈련 방식도 그에 맞춰 RLCD(보정된 결정을 위한 강화학습)라는 별도 기법을 쓴다고 밝혔다. 설명을 못 한다는 것은 버그가 아니라 설계다. 설명을 만들지 않기 때문에 70~500ms의 응답 속도와 호출당 $0.0004 수준의 비용이 나온다.
왜 "출력 토큰 무료"가 판을 흔드나?
LLM 비용의 큰 몫은 출력 토큰에서 나온다. Jev는 출력이 판정값 하나뿐이라 출력 토큰 과금 자체를 없앴다(입력 $0.042/1M). 분류·필터링·라우팅처럼 답이 짧고 호출이 많은 작업의 경제학이 달라진다.
회사 측 주장으로는 비슷한 분류 작업에서 기존 LLM 대비 최대 200배 빠르고 400배 저렴하다. 자체 측정치이므로 그대로 믿을 필요는 없지만, 구조적으로 쌀 수밖에 없는 이유는 분명하다. 자사 공개 평가에서도 흥미로운 정직함이 보인다. 4개 워크플로 평균 정확도 67.8%로, GPT-5.6(74.1%)보다 낮다고 스스로 밝힌 것이다. 요컨대 "우리가 더 똑똑하다"가 아니라 "충분히 똑똑하면서 200배 빠르고 400배 싸다"는 포지셔닝이다. 정확도 몇 %p를 속도·비용과 바꾸는 거래, 대량 반복 판정 작업에서는 남는 장사가 되는 지점이 분명히 존재한다.
Jev의 승부수는 지능이 아니라 경제학이다. 판정 한 번에 0.4초·0.0004달러라면, 지금까지 "AI 쓰기엔 아까웠던" 수백만 건의 작은 판단들이 전부 AI의 일이 된다. 이름이 제번스인 이유다.
실전에서는 어디에 쓰이나: 왜 검증 진영이 주목하나?
공개 직후 나온 활용처는 콘텐츠 필터링, 리드 스코어링, 광고 차단, 음성 브라우저 라우팅, 그리고 컨텍스트 압축(100만 토큰을 약 1초 만에 8.6만 토큰으로 선별)이다. LangChain이 "Jev로 하네스 만들기" 글을 낸 것이 상징적이다. 이 모델의 본진은 생성이 아니라 검증·통제 레이어다.
이 블로그의 독자라면 구조가 눈에 익을 것이다. LLM-as-a-Judge 패턴의 4원칙 중 첫 번째가 "생성 모델과 검증 모델의 분리"였다. Jev는 아예 검증밖에 못 하는 모델이라는 점에서 이 분리를 아키텍처 수준으로 밀어붙인 경우다. 에이전트가 행동을 제안할 때마다 "이 행동이 규칙에 맞는가"를 0.4초에 판정하는 부품, 생성 모델의 출력을 외부로 내보내기 전 "위험/안전"을 거르는 관문, 긴 컨텍스트에서 "관련 있음/없음"을 선별하는 필터: 전부 AutoHarness가 증명한 하네스 레이어의 부품 자리다. "작은 모델 + 좋은 하네스 > 큰 모델"이라는 명제에서, Jev는 그 '작은 모델' 자리를 위해 태어난 전용 부품인 셈이다.
한계와 주의점은 무엇인가?
세 가지를 기억해야 한다. ①선택지를 사람이 먼저 설계해야 한다(열린 질문에는 쓸 수 없다 ②정확도는 프론티어 모델보다 낮다)오판의 대가가 큰 단건 판단에는 부적합하다 ③실전 검증 전 단계다. 얼리 액세스이고 자사 평가 외 독립 벤치마크가 아직 없다.
실무자 관점의 판단 기준은 이렇다. 같은 유형의 판정이 하루 수천 번 반복되고, 선택지가 명확히 정의되며, 개별 오판의 비용이 낮고 확신도로 애매한 건을 사람에게 넘길 수 있는 작업, 여기가 Jev형 모델의 자리다. 반대로 판정 기준 자체가 매번 달라지거나, 한 번의 오판이 치명적인 작업은 여전히 사람과 대형 모델의 영역이다. 실무자들 사이에서는 프로덕션 콘텐츠 필터링에 바로 투입하는 것에 대한 신중론도 나온다. 확신도가 보정됐다는 주장 자체가 독립 검증 대상이기 때문이다. 도입한다면 낮은 리스크 작업부터, 확신도 임계값 아래는 사람 검토로 넘기는 이중 구조가 안전하다.
Jev가 나흘 만에 화제가 된 것은 성능 때문이 아니다. 방향 때문이다. 모두가 "더 크게, 더 똑똑하게"를 외칠 때, "덜 하지만 확실하게, 그리고 압도적으로 싸게"라는 반대 방향의 모델 클래스가 등장했다. 이것은 AI 아키텍처가 단일 만능 모델에서 역할별 부품의 조립으로 옮겨간다는 신호이기도 하다. 생성은 큰 모델이, 판정은 Jev류가, 연결과 통제는 하네스가. 조립의 시대에 필요한 역량은 가장 좋은 부품을 고르는 안목이 아니라, 부품들을 하나의 신뢰할 수 있는 시스템으로 배선하는 설계력이다. 그 설계력의 이름이 하네스 엔지니어링이다.
참고: Jev: TypeSafe's System One Model — DataCamp (2026.09) · Building a Harness with Jev — LangChain · What is Jev AI? — Medium
판정 모델이 궁금하다면, 검증 설계부터
Jev 같은 부품이 들어갈 자리: 생성과 검증을 분리하는 검증 에이전트 설계 패턴을 먼저 읽어보세요.
LLM-as-a-Judge 심화 글 읽기