702 / 707
LLM 시대, 생각을 멈추는 순간 사라지는 것들
인공지능, 특히 거대 언어 모델(LLM)의 발전은 많은 이에게 ‘생각할 필요 없는 시대’가 오는 것 아닌가 하는 기대를 품게 한다. 그러나 현실은 다르다. LLM이 고도로 발전하더라도 인간의 고유한 판단과 노력은 여전히 대체 불가능한 가치를 지닌다. 이 글은 LLM의 결과물을 맹목적으로 수용하거나 단순 중계하는 방식이 어떻게 개인의 가치와 일자리를 위협하는지 분석한다.
LLM 단순 중계의 함정
LLM의 결과물을 확인하지 않고 받아들이거나, 문제가 생길 때마다 해결해달라고 요청하는 방식은 장기적으로 개인의 가치를 지키기 어렵다. 현재 이런 방식으로 만든 소프트웨어에는 심각한 문제가 남는다. 미래에 LLM이 홀로 훌륭한 소프트웨어를 만들게 되면, 기업은 중간에서 요청만 전달하는 직원 없이 모델을 직접 반복 실행한다. 결국 해당 직원은 해고된다.
이런 현상을 Niklas Gruhn은 meat proxy라고 부른다. 사람이 while이나 for 반복문처럼 행동하며 LLM에 요청하고 재시도하는 역할을 뜻한다. 2025년 초부터 LLM에 요약이나 코드 작성을 맡긴 뒤, 그 결과가 제대로 됐다고 가정하는 사용 방식이 나타났다. 당시에는 대체로 잘 작동하지 않고 우스운 결과를 낳았다.
모델이 좋아지며 이런 사용은 더 늘어난다. 결과가 작동하지 않으면 사람이 문제를 판단하는 대신 LLM에 다시 해결을 요청하는 경우도 흔하다. 2026년 9월 시점의 관찰에서는 사람이 반복문 역할만 하는 개발자의 결과물이 2025년 초보다는 나아졌다. 어느 정도 작동하기도 했지만, 직접 사용하고 싶거나 성공적이라고 평가할 정도는 아니었다.
앞으로 이런 방식으로도 평균적인 품질의 소프트웨어를 만들거나, 사람 없이 훌륭한 소프트웨어를 만드는 수준까지 LLM이 발전할 수 있다. 그런 수준에 도달하면 기업은 LLM을 직접 반복 실행하고 중간의 직원을 해고한다. 현재는 품질이 부족하고, 충분히 좋아진 뒤에는 중계 역할이 불필요하므로 직원에게 유효한 시점은 존재하지 않는다.
가치 있는 작업에는 인간의 판단이 필수다
가치가 높은 작업에는 품질 검증과 설계 판단이 여전히 필요하다. 특히 명세로 옮기기 어려운 요구사항과 학습 분포 밖의 문제에서 사람의 개입은 중요하다. Luke Burton은 실패해도 되는 낮은 가치의 작업에 한해서만 LLM 결과를 지켜보지 않고 자리를 떠날 수 있다고 본다. 가치가 높은 작업을 LLM이 한 번에 해결할 가능성은 훨씬 낮아, 사람이 품질 보증 담당자, 엔지니어링 관리자, 아키텍트 역할을 맡아야 한다.
반복 작업을 감독하는 과정은 마감 직전처럼 느껴지기도 한다. 하지만 빠뜨린 요구사항이나 부정확한 프롬프트는 나중에 되돌려야 할 설계 선택을 만든다. 에이전트의 높은 처리량은 출시 품질 기준도 높인다. 이전에는 MVP를 출시하고 개선했을 작업에서도 더 많은 다듬기와 예외 상황 탐색을 요구한다. 에이전트는 이런 작업을 명시적으로 요청하지 않으면 수행하지 못한다. 쉬운 과제를 끝냈다는 데 만족하지 않고 더 어려운 과제까지 맡길 필요가 있다.
Bazel 빌드 전환은 자동화하기 쉬워 보이는 작업이지만, 에이전트를 사용해도 수개월이 걸린 사례가 있다. 명세로 표현하기 어려운 요구사항이 숨어 있어 지속적인 감독이 필요했다. “Bazel로 전환하라”고 요청하고 떠나도 되는 시점은 최소 수개월, 어쩌면 수년 뒤일 수 있으며, 아예 오지 않을 가능성도 있다. 결정할 지점이 많고, 무엇을 모르는지조차 알지 못하는 요소도 많다. 기존 코드가 왜 그렇게 동작하는지에 따라 올바른 변경 방향이 달라진다. 개발 경험에 영향을 주는 동작인지, 이미 고객이 사용하는 기능인지 확인해야 한다. 반대로 이해관계자 검토에서 더는 쓰지 않는 기능임이 드러나면, 보존해야 한다는 잘못된 전제 아래 내린 결정들을 돌아봐야 한다.
학습 분포 밖에서 드러나는 AI의 한계
에이전트가 학습 분포 밖의 문제를 만났을 때는 사람이 판단해야 할 필요성이 더욱 뚜렷해진다. 프로그래밍 언어별 에이전트 성능 비교 연구에서는 학습 데이터에 포함돼 있어도 주류 언어보다 학습량이 적은 생소한 언어에서 성능이 크게 떨어졌다.
체스나 바둑 같은 고전 게임이 아닌 Lost Cities와 Dominion 같은 보드게임에서는 최첨단 모델도 보드게임에 능숙하지만 해당 게임은 처음 접하는 사람보다 대체로 못한다. 게임 관련 지식은 많고 초보자에게 그럴듯하게 들리는 말도 하지만, 게임을 이해하는 사람에게는 명백히 틀린 조언을 내놓는다. Dominion 초보자가 챗GPT의 도움을 받은 사례에서는 조언의 절반 정도가 맞고 절반은 틀렸다. 틀린 부분은 일반적인 게임 판단 원칙을 따르는 것보다 나쁜 선택으로 이끌어, 챗GPT의 도움은 그 초보자의 플레이를 오히려 악화시킨 것으로 보였다.
Dominion에는 공개 정보가 충분하다. 처음 하는 사람도 사전에 약 5시간 자료를 읽으면 상위 1% 이상 수준에 도달할 수 있다는 추정이 있다. 플레이 중 참고자료를 볼 수 있다면 준비 시간이 약 30분이어도 가능하지만, 재미를 해칠 수 있어 권장하는 방식은 아니다. 검색과 API 조회가 가능한 에이전트도 이런 성과를 내지 못한다는 점에서 현재 사람과 에이전트 사이의 격차가 드러난다. 코딩 중에도 이런 문제를 알아채고 직접 처리해야 전체적으로 좋은 결과를 얻는다.
‘프로그래밍이 해결됐다’는 오해와 실제
프로그래밍 분야의 한 영향력 있는 인물은 여러 분야의 프로젝트에서 Claude가 전문가만큼 문제를 해결했다며 “프로그래밍이 해결됐다”고 선언했다. 그러나 확인한 실제 사례들은 작동하지 않거나 매우 나쁘게 작동했다.
| 평가 관점 | LLM 평가 | 실제 사용 기준 |
|---|---|---|
| GitHub 사례 | 전문가만큼 문제를 해결했다는 주장 | 작동하지 않거나 매우 나쁘게 작동했다 |
| 보드게임 AI | AlphaZero 방식 봇과 비교 시 | LLM이 만든 단순 미니맥스 봇이 AlphaZero 봇보다 약했다 |
| 상용 제품 | 문제 해결 주장 | 일반적인 사용 흐름이 무한 반복에 빠졌다 |
보드게임 AI를 만들면서 대전 상대를 찾다가 확인한 AlphaZero 방식의 봇도 그중 하나였다. 이 봇은 LLM에 단순한 미니맥스 휴리스틱 봇을 작성시키고 평가 함수를 몇 차례 조정한 결과보다 약했다. 해당 게임에서는 평범한 수준의 AlphaZero 방식 봇이 그런 미니맥스 봇을 압도해야 했다. 실제 상용 제품에서도 일반적인 사용 흐름이 무한 반복에 빠지는 문제가 있었다. 프로그래머라면 빠져나오는 방법을 찾을 수 있었겠지만, 프로그래머용이 아닌 그 제품의 일반 사용자는 핵심 기능에 접근하기 어려웠을 것이다.
개인용 도구의 한계와 상용 품질은 구분해야 한다. 좁은 개인 용도에서만 작동하는 소프트웨어 자체는 나쁘지 않다. 에이전트로 만든 정규식 엔진은 개인 컴퓨터에서 ripgrep 검색 속도를 높이기 위한 것이었다. Rust 인터프리터는 일부 프로젝트에서 에이전트 반복 작업의 속도를 높이기 위한 것이었다. 둘 다 실제 제품이라면 사실상 작동하지 않는 수준으로 평가할 도구이며, 다른 사람이 사용하는 것은 권하지 않는다. 데이터 분석에 에이전트를 반복 실행하는 방식도 완전히 틀린 결과를 사람이 바로잡도록 지시하는 과정까지 포함하면 가치가 있다. 한계를 알고 쓰거나 잘못된 결과를 수정하는 것과, 작동하지 않는 소프트웨어를 만들고 프로그래밍이 해결됐다고 선언하거나 상용 제품으로 내놓는 것은 분명히 다르다.
산출물 검토와 측정으로 현실을 직시해야 한다
Thomas Dullien은 LLM이 모든 프로그래밍 문제를 해결하지 못한다고 말하면 사람들이 자신을 이상하게 보는 경험을 전했으며, 서로의 평가가 크게 어긋났다. Gary Bernhardt는 일상적인 변경을 검토하면서 에이전트가 만든 변경량을 원래의 25%로 줄이는 경우가 잦았다. 불필요한 테스트, 과도한 방어 처리, 뒤집힌 논리가 많았다. DATABASE_URL 관리를 고치라는 요청에 에이전트는 NPM 스크립트 안에 if를 넣고, CI에는 인라인 JavaScript를 실행하는 조건부 Node 호출을 추가해 약 20개 변경 블록을 만들었다. 사람이 바로잡은 최종 변경은 줄 추가 없이 단어 하나를 추가하는 수준이었다.
큰 생산성 향상을 말하는 사람들이 남들보다 LLM을 훨씬 잘 활용할 가능성도 고려할 수 있지만, 축적된 사례를 보면 스스로 결과를 과대평가하고 있을 가능성이 더 크다. 보드게임 AI는 결과물의 실력을 직접 측정할 수 있다는 장점이 있다. A > B > C > A처럼 상대에 따른 순환 관계는 있을 수 있지만, AI가 만든 결과가 터무니없는 수준이면 객관적으로 확인하기 쉽다. 상용 소프트웨어도 회사 관계자와 대화하거나 데이터를 확인하면 낮은 전환율, 높은 이탈률, 높은 사용자 불만을 파악할 수 있다.
인간의 대체 가능성은 포기의 근거가 아니다
단순 전달자 방식이 창업자나 대주주에게는 유효할 수도 있지만, 관찰된 사례는 주로 직원이나 개인 프로젝트 개발자가 소프트웨어 문제가 해결됐다고 평가하는 경우였다. “곧 모두 쓸모없어질 테니 포기하자”는 판단은 인간이 매우 가까운 시점에 불필요해진다는 보장이 없다면 순서가 뒤바뀐다. 이미 은퇴할 재정적 준비가 됐다면 노력을 멈출 수 있지만, 이는 LLM 이전에도 가능했다. 준비가 되지 않았다면 더 많은 돈을 벌 행동이 필요하며, 생각을 멈추는 방식은 대체로 여기에 해당하지 않는다. 인간이 계속 필요한 미래라면 급하게 돈을 벌 특별한 이유가 없지만, 대체가 임박했다고 믿고 돈이 필요하다면 오히려 지금 판단하고 행동할 이유가 커진다. “열심히 하거나 올바르게 일해도 보수가 늘지 않는다”는 말과 달리, 문제를 찾아 해결해 급여 인상과 보너스를 받은 경험이 있다. 주변 사람들도 비슷한 경험을 했으며, 좋은 일을 전혀 보상하지 않는 매우 비정상적인 조직에서는 다른 곳으로 이동했다.
조직 관성에 기대기에도 불리한 시기
LLM이 프로그래머를 대체할 만큼 좋아진 뒤에도 조직의 관성 덕분에 단순 전달자로 버틸 기간이 있을 수 있다는 반론이 있다. 그러나 기업들이 해고에 적극적인 상황을 고려하면, 최소한의 일만 하고 버티기에 더 좋은 시기는 오히려 과거였다. 대기업에서는 출근도 원격근무도 하지 않는 사람을 해고하기까지 수개월에서 수년이 걸린 사례가 있었다. 팬데믹 이전의 비원격 기업에서, 은퇴를 결정한 뒤 출근을 중단하고 급여를 더 받으려 한 직원을 해고하는 데 기억상 약 6개월이 걸렸다. 다른 회사에서는 2년이 걸렸으며, 오랫동안 해고 절차 자체가 시작되지 않은 뒤 단계적인 경고 절차가 진행됐다. 그 사례의 관리자는 직원이 다시 출근해 일하는 척만 했어도 절차가 처음부터 다시 시작돼 더 오래 걸렸을 것이라고 본다.
최근 몇 년에는 이런 사례가 덜 들린다. 기업들은 AI를 명분으로 이런 상태에서 벗어나려는 것으로 보인다. 따라서 노력이나 가치 제공 없이 일자리를 유지하려는 시도로는 현재와 가까운 미래가 오랜 기간 중 가장 불리한 시기일 수 있다. 일부 기업에서는 여전히 가능하겠지만, 아무 일도 하지 않고 급여만 받으려 했다면 과거에 더 쉬운 환경이 있었다.
행동경제학의 시선으로 보면
사람들이 LLM의 능력을 과대평가하거나, 자신이 LLM을 잘 활용한다고 착각하는 현상은 행동경제학의 과신 편향으로 설명한다. 이는 실제 능력보다 자신의 능력을 더 높게 평가하는 인지적 편향이다. LLM이 만든 결과물에 대한 객관적인 검증 없이 “프로그래밍이 해결됐다”고 단언하는 모습은 이런 과신 편향의 명확한 예시이다.
출처
- 원문: https://danluu.com/brain-off/
- 경유: GeekNews https://news.hada.io/topic?id=33909










