Safety

AI를 끄자 AI 쓰기 전보다 못해졌다: 선종 발견율 28.4%에서 22.4%가 던진 질문

AI 의존이 실력을 깎는다는 말은 오래된 걱정이었다. 이제는 측정된 숫자가 있다. AI 보조 대장내시경에 노출된 전문의들이 AI 없이 검사할 때 선종 발견율이 28.4%에서 22.4%로 6.0%p 떨어졌다. 문제는 '원래대로 돌아간 것'이 아니라는 점이다. AI를 도입하기 전 수준보다 아래로 내려갔다. 그리고 이 연구는 흔히 인용되는 것과 달리 스탠퍼드의 연구가 아니다.

이 수치가 한국에서 소셜미디어로 퍼질 때 대개 "스탠퍼드 연구"라는 꼬리표가 붙어 있다. 확인해보면 출처가 다르다. 숫자의 출처는 폴란드 4개 센터에서 수행된 다기관 관찰연구이고, 스탠퍼드가 내놓은 건 별개의 결과다. 이 글은 두 가지를 한다. 먼저 연구가 실제로 무엇을 발견했는지 원문 기준으로 정리하고, 그다음 '나도 AI에 의존하다 실력이 줄고 있는 건 아닐까'를 직장인이 스스로 점검하는 방법으로 옮긴다.

조건선종 발견율(ADR)해석
AI 도입 전, AI 미사용 검사28.4%기준선
AI 도입 후, AI 미사용 검사22.4%-6.0%p (95% CI -10.5 ~ -1.6, p=0.0089)
AI 보조를 받은 검사25.3%AI를 켠 상태에서는 안정적으로 유지

연구는 정확히 무엇을 발견했나?

2025년 8월 The Lancet Gastroenterology & Hepatology에 실린 「Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy」다. 폴란드 4개 내시경 센터(ACCEPT 시험 참여 기관)가 2021년 말 AI 폴립 검출 도구를 도입한 전후를 비교했다. 전문의 19명이 수행한 AI 미사용 검사 1,443건(도입 전 795건, 도입 후 648건)이 분석 대상이다.

핵심 결과는 표에 정리한 그대로다. AI를 쓰지 않는 조건에서 선종 발견율이 28.4%에서 22.4%로 떨어졌고, 통계적으로 유의했다. 반면 AI 보조를 받은 검사에서는 25.3%로 유지됐다. 연구진은 이 감소가 탈숙련(deskilling)과 안심(complacency)으로 적어도 일부 설명될 수 있다고 봤다.

단서를 분명히 해야 한다. 이 연구는 관찰·후향 설계다. 무작위 배정 시험이 아니므로 "AI가 실력을 떨어뜨렸다"는 인과를 확정하지 않는다. 같은 기간의 다른 변화(장비, 환자 구성, 검사 환경)가 영향을 줬을 가능성이 배제되지 않았다. 다만 방향과 크기가 충분히 커서, 같은 저널이 별도 논평으로 이 문제를 다뤘고 이후 여러 리뷰가 이 결과를 탈숙련 논의의 출발점으로 인용하고 있다.

AI를 끄면 AI를 쓰기 전으로 돌아가는 게 아니다. 그보다 아래로 내려갈 수 있다. 이 차이가 이 연구의 전부다.

왜 '스탠퍼드 연구'라는 꼬리표가 붙었나?

두 개의 다른 결과가 섞였다. 탈숙련 수치(28.4%→22.4%)는 폴란드 다기관 관찰연구에서 나왔다. 스탠퍼드가 내놓은 결과는 다른 이야기다. 일련의 시험에서 GPT-4를 함께 쓴 의사가 쓰지 않은 의사보다 더 나아지지 않았고, 모델 단독 성적은 92점 수준이었다. 하나는 '끄면 나빠진다', 다른 하나는 '켜도 안 좋아진다'다.

스탠퍼드 HAI의 AI Index 2025 보고서에도 관련 수치가 있다. 임상 사례 기반 진단 테스트에서 GPT-4가 인간 의사보다 정확도가 16%p 높았고, 모델 단독이 가장 높고 일관됐으며 의사와 AI의 협업은 활용 방식에 따라 성과 편차가 컸다는 내용이다. 이 편차라는 단어가 중요하다. AI와 함께 일한다는 사실 자체가 결과를 좋게 만들지 않는다는 뜻이기 때문이다.

두 결과를 붙여 읽으면 그림이 더 불편해진다. AI를 켜도 사람의 성과는 안정적으로 올라가지 않고, AI를 끄면 사람의 성과는 이전보다 내려갈 수 있다. 이건 도구의 문제가 아니라 사람이 도구와 일하는 방식을 설계하지 않은 상태의 문제다. 그리고 이 기사를 "스탠퍼드 연구 충격"으로 옮겨 적는 과정 자체가 같은 문제의 작은 예시다. 출처를 확인하지 않고 옮기는 것.

AI 시대의 가장 흔한 오류는 AI의 오류가 아니라, AI에 관한 이야기를 검증하지 않고 옮기는 것이다.

실력은 어떤 경로로 줄어드나: 자동화 편향의 구조

두 경로다. 하나는 탈숙련(쓰지 않는 판단 근육이 약해진다. 다른 하나는 자동화 편향)AI가 제시한 답이 있을 때 사람이 자기 판단을 AI 쪽으로 옮긴다. 후자는 실력이 줄지 않은 사람에게도 즉시 작동한다. 그래서 더 위험하다.

2026년에 발표된 의학 분야 탈숙련 스코핑 리뷰는 여러 분과에서 같은 신호를 모았다. 유방영상 전문의 27명을 대상으로 한 통제 연구에서는 잘못된 AI 프롬프트가 위양성 재검을 최대 12% 늘렸고, 경력이 많은 판독의도 예외가 아니었다. 계산병리 분야의 웹 기반 과제에서는 시간 압박이 있는 조건에서 참가자의 30% 이상이 맞았던 초기 진단을 잘못된 AI 제안에 맞춰 뒤집었다.

이 두 숫자가 사무직에게 주는 함의는 직접적이다. 자동화 편향이 나타나는 조건이 '전문성 부족'이 아니라 '시간 압박'과 '그럴듯한 제안'이라는 것이다. 마감에 쫓기면서 잘 쓴 초안을 받는 상황은 대부분의 직장인이 매일 겪는다. 실제 개선 효과와 체감 효과가 어긋나는 구간을 실측 데이터로 다룬 글은 생산성 개선폭 4~65% 분석에 있다.

현장의 인식도 이미 여기에 있다. 2026년 3월 미국 의사·간호사 355명을 대상으로 한 설문에서 일상적인 AI 사용은 1년 사이 3배로 늘었고, 동시에 74%가 AI가 대체하고 있는 임상 역량이 침식될 것을 우려한다고 답했다. 쓰는 양과 걱정의 양이 같이 늘고 있다.

내가 AI에 의존하고 있는지 어떻게 점검하나?

네 가지를 확인하면 된다. 기준선을 측정하고, 내 결론을 먼저 적고, 뒤집은 횟수를 세고, 틀린 것을 찾은 횟수를 확인한다. 네 항목 모두 추가 도구가 필요 없고, 한 주치 업무 안에서 답이 나온다.

  1. 한 달에 한 번은 AI 없이 처음부터 해본다. 자주 하는 업무 하나를 정해 AI를 끄고 끝까지 수행한다. 목적은 효율이 아니라 기준선 확인이다. 이번 달의 '맨손 결과물'이 지난 분기보다 나빠졌다면, 그게 폴란드 연구가 잡아낸 그 변화다
  2. AI를 열기 전에 내 결론을 한 줄로 적는다. 자동화 편향은 앵커링에서 시작한다. 먼저 본 답이 기준이 된다. 내 가설을 먼저 종이에 적어두면 AI의 답과 대조할 기준점이 생긴다. 순서만 바꾸는 일이라 비용이 0이다
  3. AI 제안 때문에 판단을 뒤집은 횟수를 센다. 일주일만 세어보면 된다. 뒤집은 것 중에 나중에 내 원래 판단이 맞았던 경우가 있는지까지 본다. 계산병리 연구에서 30% 이상이 맞은 판단을 뒤집었다는 건, 이 숫자가 0일 가능성이 낮다는 뜻이다
  4. 틀린 AI 결과를 발견한 횟수가 0이면 경고로 읽는다. AI가 완벽해진 게 아니라 내가 검증을 멈춘 상태일 확률이 훨씬 높다. 검증하는 사람은 반드시 오류를 발견한다. 발견 기록이 없다는 건 검증 기록이 없다는 뜻이다

네 항목 중 가장 빠르게 효과가 나는 건 두 번째다. 순서를 바꾸는 것만으로 앵커링이 끊긴다. 가장 불편하지만 가장 정확한 건 첫 번째다.

조직은 무엇을 설계해야 하나?

개인의 주의력에 맡기면 반드시 샌다. 필요한 건 사람의 판단이 반드시 개입하는 지점을 구조로 고정하는 것이다. AX is가 기업 교육에서 쓰는 하네스 엔지니어링 프레임워크(Prompt → Context → Harness → Loop)에서 이 역할을 맡는 단계가 Harness와 Loop다. 검증 관문의 위치와, 그 결과를 다시 사람 역량으로 되돌리는 루프.

국내 대기업 임원을 대상으로 AI 교육을 진행하면서 들은 말 중 가장 오래 남은 건 "AI는 건방지네"였다. 시키지 않은 것까지 마음대로 다 완성해버려서 나온 반응이었다. 처음 들을 때는 세대 차이에서 나온 농담처럼 들렸지만, 이 연구들을 보고 나서는 정확한 진단이었다고 생각한다. 시키지 않은 것까지 완성해주는 도구 앞에서, 사람이 무엇을 시켰는지를 기억하지 못하게 되는 것이 탈숙련의 실제 모양이다. 검증 지점을 설계할 때 이 문장을 기준으로 삼으면 판단이 쉬워진다. 이 단계에서 AI가 '알아서 해준 것'이 무엇인지 사람이 말할 수 있는가.

실무적으로는 세 가지를 문서로 남기는 것부터 시작한다. ① AI가 자동 통과시켜도 되는 산출물과 사람 검토가 필수인 산출물의 경계, ② 검토자가 무엇을 보는지의 체크 항목, ③ 오류가 발견됐을 때 그 사례를 어디에 축적할지. 조직 차원에서 AI 산출물 검증을 사람 대신 파이프라인이 받게 만드는 패턴은 LLM-as-a-Judge 검증 에이전트에, 검증 없는 AI 도입이 실제로 어떤 사고로 이어졌는지는 딜로이트 호주 보고서 환각 사건에 정리해뒀다. 프레임워크 전체는 하네스 엔지니어링 총론에 있다.

이 연구가 말하는 건 'AI를 쓰지 말라'가 아니다. AI 보조를 받은 검사의 발견율은 25.3%로 안정적이었다. 문제는 AI가 없는 조건에서의 실력이 조용히 내려갔다는 것이고, 그 사실은 AI를 끄는 날이 오기 전까지 아무에게도 보이지 않는다. 직장인에게 이 연구가 남기는 실질적 과제는 하나다. AI 없이 일해본 마지막 날이 언제인지 기억하는가. 기억나지 않는다면, 그게 이 글의 첫 번째 점검 항목을 이번 달에 해봐야 하는 이유다. 실력은 쓰지 않으면 줄고, 줄어든 것은 측정하지 않으면 보이지 않는다.

참고: Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy: a multicentre, observational study — The Lancet Gastroenterology & Hepatology (2025.08) · Routine AI assistance may lead to loss of skills in health professionals — EurekAlert! · Artificial intelligence in medicine: a scoping review of the risk of deskilling and loss of expertise among physicians (2026) · AI Index Report — Medicine, Stanford HAI

이 주제의 전체 그림: 하네스 엔지니어링 총론

AI를 도입하면서 팀의 실력도 지키고 있나요?

검증 관문의 위치, 자동 통과 기준, 오류 사례 축적까지: 하네스 엔지니어링 프레임워크로 AI 활용과 역량 보존을 함께 설계하는 교육 과정을 제공합니다.

B2B 기업교육 문의하기