Opus 5.5·GPT-6 Sol 동시 출격, 'AI 작업당 비용' 전쟁이 직장인 업무를 바꾸는 방식
AI 작업당 비용(cost per task)이 새 경쟁축으로 올라섰다. 2026년 9월 22일, 앤트로픽이 Claude Opus 5.5를 내놓은 뒤 약 한 시간 만에 OpenAI가 GPT-6 Sol과 Luna를 공개했고, 두 회사가 발표 자료에서 앞세운 지표는 벤치마크 점수가 아니었다. 경쟁축이 '얼마나 똑똑한가'에서 '이 일 하나를 끝내는 데 얼마 드는가'로 옮겨간 순간이고, 그 이동은 실무자의 역할도 함께 옮긴다.
가격표만 보면 결론이 단순해 보인다. Opus 5.5는 100만 토큰당 입력 4달러·출력 20달러, GPT-6 Sol은 입력 2달러·출력 10달러. 정확히 절반이다. 그런데 독립 측정에서는 순위가 뒤집히는 구간이 나온다. 단가가 반값인 모델이 작업당 비용에서 더 비싸지는 일이 실제로 생기기 때문이다. 이 간극을 이해하는 것이 앞으로 AI 예산을 다루게 될 실무자에게 가장 실용적인 지식이다.
| 모델 | 입력 / 출력 (100만 토큰) | 직전 세대 대비 |
|---|---|---|
| Claude Opus 5.5 | $4 / $20 | Opus 5($5/$25) 대비 20% 인하, 캐시 읽기 $0.20로 60% 인하 |
| GPT-6 Sol | $2 / $10 | GPT-5.6 Sol($4/$20) 대비 50% 인하, 캐시 입력 $0.20 |
| GPT-6 Luna | $0.10 / $0.50 | GPT-5.6 Luna($0.20/$1.20) 대비 대폭 인하, 역대 최저가권 |
'작업당 비용'은 토큰 단가와 어떻게 다른가?
토큰 단가는 글자당 값이고, 작업당 비용은 일 하나를 끝낼 때까지 든 총값이다. 에이전트는 한 작업에 수십에서 수백 번 모델을 호출하고, 도구 실행 결과를 다시 읽는다. 단가가 절반이어도 헤매는 횟수가 두 배 이상이면 총비용은 더 비싸진다. 단가는 견적서, 작업당 비용은 청구서다.
실제 측정치가 그 간극을 보여준다. 독립 평가에서 최대 추론 강도의 Sol은 47.5점을 내며 작업당 1.06달러를 썼고, 기본 설정의 Opus 5.5는 51.2점에 작업당 1.34달러를 썼다. 점수는 Opus가 높고 비용은 Sol이 낮다. 명확한 승자가 없는 형태다. 반면 특정 업무 워크플로 세트에서는 Sol이 Opus 5.5와 같은 수준을 내면서 비용은 40%에 머물렀고, 개발 환경 벤치마크인 Terminal-Bench 4.0에서는 Sol 43.9%, Opus 5.5 52.5%로 격차가 다시 벌어졌다. 브라우저 조작 벤치마크에서는 Sol이 66.9점으로 Opus 5.5의 59.4점을 앞서면서 비용도 더 낮았다.
단가는 공개된 숫자 하나지만, 작업당 비용은 내 업무의 모양에 따라 달라지는 함수다. 남의 벤치마크로는 내 청구서를 예측할 수 없다.
벤더 자체 발표도 같은 지표로 옮겨왔다. OpenAI는 Luna의 작업당 비용이 Claude Opus 5 대비 93%, Claude Fable 5 대비 96% 낮다고 밝혔다. 자사 측정이라는 전제를 붙여 읽어야 하는 숫자지만, 비교의 단위 자체가 토큰에서 작업으로 바뀌었다는 신호로는 충분하다. 한 가지 더 기억할 조건이 있다. Sol의 인하 가격은 프로모션 성격으로 11월 21일까지 보장된 것으로 공지됐다. 지금 가격표가 내년 기준선이라고 전제하고 예산을 짜면 안 된다.
값이 싸지면 기업은 AI를 왜 더 많이 쓰게 되나?
단가가 내려가면 이전에는 손익이 맞지 않던 업무가 손익 안으로 들어온다. 한 건에 500원이 드는 작업은 월 1만 건이면 500만 원이라 검토 대상이 아니지만, 50원이 되면 50만 원이다. 가격 인하는 사용량 절감이 아니라 사용 범위 확장으로 귀결된다. 총지출은 대개 줄지 않고 늘어난다.
이 현상은 새로운 게 아니다. 저장장치 값이 떨어졌을 때 기업이 데이터를 덜 저장하게 된 게 아니라 전부 저장하기 시작한 것과 같은 구조다. AI에서 이 확장이 향하는 곳은 명확하다. 지금까지 '사람이 하기엔 사소하고 자동화하기엔 애매했던' 중간 지대다. 회의록 정리, 1차 검토, 문서 대조, 티켓 분류, 정형 리포트 초안. 이 구간이 통째로 AI 쪽으로 넘어가면 실무자의 업무 구성비가 달라진다.
비용이 낮아질 때 실제로 늘어나는 건 호출 횟수뿐이 아니다. 검증해야 할 산출물의 양도 같은 비율로 늘어난다. 이 부하를 설계 없이 사람에게 그대로 얹으면 도입 효과가 상쇄된다. 토큰을 덜 쓰면서 같은 일을 하는 구조적 접근은 컨텍스트 운용으로 토큰 비용을 줄이는 방법에 정리해뒀고, 검증 부하를 사람 대신 파이프라인이 받게 만드는 패턴은 LLM-as-a-Judge 검증 에이전트 쪽이다.
내 작업당 비용은 무엇이 결정하나: 직접 겪은 구간
작업당 비용을 밀어 올리는 건 대개 모델이 아니라 요청의 모양이다. 무엇을 만들어야 하는지 정의가 흐릿하면 모델은 여러 방향을 시도하고, 그 시도가 전부 청구된다. 재시도 횟수가 곧 비용이라는 사실은 가격표에 적혀 있지 않다.
AI 관상 서비스 '상냥'을 컨셉부터 개발, 결제 연동까지 혼자 붙여 런칭하면서 이 감각을 비용으로 배웠다. 전환 퍼널과 가격 티어, 그리고 Claude API 비용 구조를 반복해서 손봤는데, 가장 크게 움직인 건 모델을 바꾼 게 아니라 요청의 형태와 출력 길이를 다시 정의한 쪽이었다. 첫 결제 알림은 새벽에 왔고 나는 자고 있었다. 코드가 대신 일한다는 감각의 실체는 그런 것이었다. 이 서비스는 지금 운영만 유지하고 마케팅은 접었다. 큰 구매 퍼널을 만들지 못했고, 스스로 크게 관심 있는 분야가 아니었던 게 원인이라고 본다. 비용을 잘 다루는 것과 사업이 되는 것은 다른 문제였다.
그 경험에서 남은 실무 규칙은 단순하다. 모델 가격표를 비교하기 전에, 같은 작업을 몇 번 다시 시켰는지를 먼저 세어본다. 재시도가 많은 업무는 어떤 모델을 써도 비싸고, 재시도가 적은 업무는 대체로 더 싼 모델로 내려가도 버틴다.
그래서 실무자의 역할은 어디로 옮겨가나?
세 방향이다. 스펙을 쓰는 사람(재시도를 줄여 비용을 줄이는 역할), 검증 관문을 설계하는 사람(늘어난 산출물을 사람 대신 구조가 걸러내게 만드는 역할), 모델을 라우팅하는 사람(업무 난이도별로 값이 다른 모델을 배분하는 역할). 세 역할 모두 모델 지식보다 업무 지식이 더 많이 필요하다.
- 스펙 작성이 비용 관리가 된다. 완료 조건, 출력 형식, 참조 자료 범위, 하지 말아야 할 것. 이 네 줄이 있는 요청과 없는 요청의 작업당 비용은 몇 배 차이가 난다. AI를 잘 쓰는 사람의 정의가 '좋은 답을 받는 사람'에서 '적은 시도로 끝내는 사람'으로 바뀐다
- 검증 관문 설계가 필수 업무가 된다. 값이 싸져서 10배 더 돌리면 검토 대상도 10배가 된다. 사람이 전수로 볼 수 없는 양이 되는 순간, 무엇을 자동 통과시키고 무엇을 사람에게 올릴지 정하는 일이 남는다. 이 판단은 도메인을 아는 실무자만 할 수 있다
- 모델 선택이 '성능 비교'에서 '라우팅'으로 바뀐다. 정답은 하나의 최고 모델이 아니라 업무별 배분이다. 분류·추출·요약은 저가 모델로, 판단이 필요한 구간만 상위 모델로. 다만 배분을 늘리면 캐시 재사용이 깨지는 등 숨은 비용이 생기므로, 실제 업무 샘플로 측정한 뒤에 나누는 게 순서다
정리하면, 값이 싸지는 것은 실무자에게 위협도 기회도 자동으로 되지 않는다. 싸진 만큼 더 많이 돌려보고, 그 결과를 판정할 기준을 가진 사람에게만 기회가 된다. 같은 도구로 개선폭이 4%에서 65%까지 벌어지는 이유도 결국 여기에 있다. 생산성 격차를 만드는 사용 패턴에서 그 편차를 실측 데이터로 다뤘다.
같은 날 나온 두 모델이 알려준 건 성능 순위가 아니다. AI의 값을 재는 단위가 토큰에서 작업으로 바뀌었다는 사실이다. 단위가 바뀌면 잘하는 사람의 정의도 바뀐다. 토큰 단가는 벤더가 정하지만 작업당 비용은 요청을 쓰는 사람이 정한다. 그래서 다음 분기에 회사가 AI 예산을 늘릴 때, 그 예산의 효율을 실제로 좌우하는 건 어떤 모델을 골랐느냐가 아니라 같은 일을 몇 번 다시 시키지 않고 끝낼 수 있느냐가 된다. 지금 확인해볼 수 있는 숫자는 하나다. 이번 주에 AI에게 같은 작업을 몇 번 다시 시켰는가.
참고: Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war — Simon Willison (2026.09.22) · GPT-6 Sol Halves OpenAI Prices but Trails Opus 5.5 in Tests — implicator.ai · OpenAI releases GPT-6 Sol and Luna models, slashing API costs 50% or more — VentureBeat
이 주제의 전체 그림: 기업 AI 교육 완벽 가이드
팀의 AI 작업당 비용을 누가 관리하고 있나요?
스펙 작성부터 검증 관문 설계, 업무별 모델 라우팅까지: 실무자가 AI 비용과 품질을 함께 책임지는 방법을 기업 교육 과정으로 설계합니다.
B2B 기업교육 문의하기