536 / 707

2 분 소요

hits
사람이 매번 '예'를 누른다면, 그 감독은 이미 없다

미국 반도체 회사 AMD의 한 대담에서, 클로드 코드를 만든 보리스 처니가 자기 습관 하나를 털어놓는다. 에이전트가 점점 오래 돌면서 명령을 실행할 때마다 승인을 요청하자, 어느 순간부터 그는 그 내용을 읽지 않게 되었다고 한다. 그냥 예, 예, 예를 눌렀다는 것이다. 나중에 보니 보안팀도 똑같이 하고 있었다. 그래서 앤트로픽이 찾은 해법은 사람을 더 꼼꼼히 읽게 만드는 쪽이 아니었다. 승인이라는 판단 자체를 별도의 분류기에 넘겨 버렸다. 이름은 auto 모드, 고객에게도 권한다.

우리는 흔히 인공지능은 사람이 고삐를 쥐고 있으니 안전하다고 말한다. 처니의 고백은 그 고삐가 반복 앞에서 어떻게 스르르 풀리는지 보여준다. 백 번 중 아흔아홉 번 옳은 시스템에서 백 번째 오류 하나를 사람이 붙잡아 내는 일은 성실함의 문제가 아니다. 주의력이라는 것의 물리적 한계에 부딪히는 문제다. 주의는 수도꼭지처럼 틀어 두면 계속 흐르는 물이 아니라서, 아무 일도 없는 시간이 길어질수록 오히려 말라 버린다.

여기에는 자동화 편향이라는 이름이 붙어 있다. 십 년째 아무도 빠지지 않은 수영장의 안전요원을 떠올리면 된다. 사고가 없으니 긴장이 풀리고, 긴장이 풀린 바로 그 순간이 가장 위험하다. 아무 일도 일어나지 않았다는 사실 자체가 감시를 조금씩 마모시킨다. 그러니 사람이 모든 것을 일일이 승인한다는 설계는 안전장치라기보다 안전을 연기하는 무대에 가깝다. 앤트로픽이 정직했던 지점은 이 마모를 인정하고, 지쳐 버린 사람을 레드팀과 모의 침투로 검증한 분류기로 갈아 끼웠다는 데 있다.

교실로 옮겨 보면 조금도 낯설지 않다. AI가 초안을 써 준 학생 피드백 150개를 검토하는 교사는 60번째쯤이면 이미 예를 누르고 있다. 사람이 최종적으로 확인하니 괜찮다는 안심은, 정작 그 확인을 해낼 수 없는 사람에게 조용히 기대고 있는 셈이다.

물론 반론이 있다. 분류기라고 틀리지 않겠는가. 사람을 빼 버리면 책임은 누가 지는가. 가장 날카롭게 벼리면 이렇다. 지친 사람에게라도 책임은 물을 수 있지만, 분류기는 그 책임을 학습 데이터 속으로 흩어 놓는다. 옳은 지적이다. 다만 같은 인터뷰가 더 깊은 곳을 가리킨다. 처니는 이제 모델을 선임 동료처럼 믿고 맡긴다고 말하는데, 그 신뢰가 막연한 기대가 아니라 근거 있는 신뢰인 까닭은 그가 십수 년을 직접 손으로 디버깅해 왔기 때문이다. 그는 한 일화를 든다. 손으로 버그를 잡겠다고 고집하던 자신을, 갓 합류한 신입이 그냥 클로드에게 물어 20분 만에 앞질렀다. 지친 사람을 대신하게 된 그 분류기를 설계한 이들도 한때는 손으로 하나하나 확인하던 사람들이었다. 위험은 그다음 세대에 있다. 처음부터 모든 것을 auto 모드로 배운 사람은, 언제 아니오를 눌러야 하는지 아는 감각을 한 번도 길러 볼 기회가 없다.

그래서 진짜 물음은 사람을 고리 안에 넣느냐 마느냐가 아니다. 사람을 그 고리에 둘 만한 값어치를 만드는 판단이 대체 어디서 자라는가, 그리고 우리는 그것을 아직 기르고 있는가이다. 학생에게 AI의 답을 검토하게 하는 이유는 검토라는 행위 자체에 있지 않다. 그 학생도 언젠가는 예를 누를 테니까. 이유는 다른 데 있다. 이해가 받쳐 주는 검토를 충분히 반복하는 동안 판단이라는 것이 몸에 앉기 때문이다. auto 모드는 그 판단을 이미 갖춘 사람에게는 편리한 도구다. 문제는 단 한 번도 아니오를 눌러 본 적 없는 사람의 손에 그것부터 쥐여 주는 일이다.

출처

  • Advanced Insights (AMD). Boris Cherny — Claude Code 인터뷰. https://youtu.be/eQ6tb7j3Z2U
공유