744 / 749

6 분 소요

hits

Paper2Agent는 연구 논문을 대화할 수 있는 AI 에이전트로 바꾸는 시스템이다. README에 실린 예시도 유전체·단일세포 분석처럼 코드가 딸린 과학 논문이다. 깃허브 사용자 icerain-cmd가 이를 포크해 만든 paper2Agent-Humanities는 여기에 인문학 연구용 층을 얹는다. 논문마다 자기 문헌 근거에만 묶인 에이전트를 세우고, 여러 논문의 주장과 개념, 해석을 서로 맞부딪치게 하는 것이 목표다. 다만 이 인문학 기능은 아직 실험 단계다. 저장소의 기본 브랜치(main)는 원조 Paper2Agent에 가깝고, 인문학 대화 기능은 Draft PR과 별도 브랜치에서 개발·검증하고 있다.

Paper2Agent 로고
원조 Paper2Agent 로고. 인문학 포크의 README도 이 로고를 그대로 쓴다. (출처: icerain-cmd/paper2Agent-Humanities)

원조 Paper2Agent

원조 Paper2Agent(jmiao24/Paper2Agent)는 연구 논문을 최소한의 사람 개입으로 상호작용형 AI 에이전트로 바꾸는 다중 에이전트 시스템이다. 여러 전문 에이전트를 병렬로 조율해 과학 논문을 신뢰할 수 있는 MCP(Model Context Protocol) 서버와 스킬로 만든다. 개발진의 논문은 2026년 Nature에 실렸다(Miao 외, “Reimagining research papers as interactive and reliable AI agents”).

쓰는 방법은 간단하다. Claude Code나 Codex 같은 코딩 에이전트에게 paper2agent 스킬을 설치하게 한 뒤, 논문과 코드 저장소를 주고 에이전트로 만들어 달라고 요청한다. README는 세 가지 예를 든다. 유전체 데이터를 해석하는 AlphaGenome 에이전트, 불확실성을 보정한 단일세포 공간 전사체 분석을 하는 TISSUE 에이전트, 단일세포 데이터의 전처리와 군집화를 하는 Scanpy 에이전트다. 만들어진 MCP 서버를 Claude Code, Codex, Gemini CLI 같은 코딩 에이전트에 연결하면 논문의 분석 도구를 대화로 쓸 수 있다. 세 에이전트는 Hugging Face에 호스팅된 서버로도 연결할 수 있다.

인문학 갈래가 더하는 것

paper2Agent-Humanities는 2026년 9월 28일 만들어진 MIT 라이선스 포크다. 한국어 사용자 매뉴얼은 이 도구를 이렇게 정의한다. 논문을 단순히 요약하는 대신 각 논문을 자기 문헌 근거에 묶인 Paper Agent로 만들고, 여러 논문의 주장·개념·해석을 대화시키는 연구 환경이다.

이를 위해 에이전트의 발화를 여섯 유형으로 나눈다.

유형 뜻
SOURCE_QUOTE 원문 직접 인용
AUTHOR_CLAIM 원문으로 확인되는 저자의 주장
INTERPRETATION 연구자의 해석
AI_SYNTHESIS AI가 여러 근거를 연결한 종합
CRITIQUE 비판
UNRESOLVED 근거 부족, 충돌, 미해결 문제

AI가 그럴듯하게 말하게 하는 것보다, 누가 어느 문헌에서 무엇을 실제로 말했는지를 먼저 보존하자는 설계다.

지켜야 할 연구 경계

매뉴얼은 네 가지 경계를 반드시 지키라고 한다.

  1. 한 에이전트는 한 문헌 코퍼스만 대변한다. Paper Agent는 자기 논문의 근거로만 저자를 대변하고, 다른 논문이나 후대 저술, 웹 지식, 모델의 일반 지식을 섞지 않는다.
  2. 판본을 합치지 않는다. 같은 저자의 같은 글이라도 판본이 다르면 필요에 따라 독립 자료로 관리한다. 이 프로젝트의 벤야민 실험도 V2와 V3를 별도 Paper Agent로 유지했다.
  3. 저자의 주장과 해석을 나눈다. “저자는 X라고 말한다”는 AUTHOR_CLAIM이고 원문 근거가 필요하다. “이 대목은 X로 해석할 수 있다”는 INTERPRETATION, “A와 B를 함께 보면 C가 보인다”는 AI_SYNTHESIS다. 좋은 AI 해석이라도 자동으로 저자의 주장이 되지는 않는다.
  4. 모르면 멈춘다. 근거가 부족하거나 충돌하면 UNRESOLVED로 남기고, 빈칸을 그럴듯한 문장으로 채우지 않는다.

권장하는 작업 순서도 이 경계를 따른다. 권위 있는 원문을 확보하고, Paper2Skill로 먼저 원문을 들여와 쪽을 검토하고 자료 해시를 확인한 뒤, 검토를 마친 자료 묶음에서 Paper Agent를 만든다. 각 명제를 여섯 유형으로 나누고 AUTHOR_CLAIM과 SOURCE_QUOTE의 쪽 근거를 검사한다. 여러 논문을 다룰 때는 논문마다 Paper Agent를 따로 두고, 비판과 응답이 오간 뒤 원문 근거를 다시 확인한다. 종합과 연구 질문은 AI 산출물로 보고 최종 판단은 연구자가 한다.

연구 워크플로

한 논문을 깊게 읽을 때는 에이전트에게 핵심 명제와 쪽, 직접 근거, 개념 정의, 논증의 전제와 결론, 명시적으로 말하지 않은 것, 해석이 필요한 지점을 요구한다. 매뉴얼은 목표가 요약이 아니라 논증 지도라고 말한다.

두 논문을 비교할 때는 공통 연구 질문 하나를 정하고 각 에이전트가 자기 논문만 근거로 답하게 한다. 비교 단계에서도 문장마다 출처를 유지한다.

논문 에이전트끼리 토론시킬 때 권장하는 흐름은 다섯 단계다.

  1. POSITION(입장): 각 논문의 입장과 근거
  2. CRITIQUE(비판): 상대 입장의 전제·공백·긴장 지적
  3. REBUTTAL(반박): 자기 문헌 근거 안에서 응답
  4. REVISION(수정): 고칠 수 있는 지점과 유지할 지점 구분
  5. CLOSING(종합): 합의점, 남은 이견, 새 연구 질문

“벤야민이라면 이렇게 말했을 것이다” 같은 자유 역할극보다 “이 판본에서 확인되는 근거에 따르면”이라는 방식이 연구용으로 안전하다는 것이 매뉴얼의 판단이다. 2~3개 논문으로 넓힐 때도 쟁점 하나를 중심에 두고 각 자료의 정체성을 유지한다. 종합 에이전트는 심판이 아니다. 승패 대신 공통 문제, 남은 차이, 문헌의 빈 공간, 추가 검증이 필요한 주장, 후속 연구 질문을 정리하게 한다.

인문학자를 위한 활용 원칙

매뉴얼이 꼽는 활용법은 여섯 가지다.

  • 내 논문을 먼저 공격하게 한다. 자기 논문을 에이전트로 만들고 고전이나 경쟁 이론의 에이전트에게 비판을 맡기면, 익숙해서 보이지 않던 전제와 개념적 비약이 드러난다.
  • ‘누가 옳은가’보다 ‘어디서 갈라지는가’를 묻는다. 인문학에서는 승패보다 개념이 갈라지는 정확한 지점이 더 중요한 성과일 수 있다.
  • 아투라(Artura)의 순간을 기록한다. 토론 중 예상하지 못한 연결이나 순간적 통찰이 나오면 결론으로 바로 채택하지 말고 연구 메모로 남긴다. 어떤 충돌에서 생겼는지, 계기가 된 자료는 무엇인지, AI가 제안했는지 연구자가 발견했는지, 원문으로 검증할 수 있는지, 어떤 추가 문헌이 필요한지를 적는다. 통찰이 생기는 일과 그것을 검증하는 일은 별개의 단계다.
  • 불일치를 보존한다. 억지 합의를 요구하지 말고, 화해하지 않는 두 이론의 차이를 UNRESOLVED로 남기는 편이 더 생산적일 수 있다.
  • 답보다 질문을 만든다. 두 문헌이 답하지 않은 질문, 같은 개념을 다르게 정의하는지, 한 이론이 다른 이론의 맹점을 드러내는지, 판본·시대 변화가 논증을 바꾸는지를 묻는다.
  • AI를 저자 시뮬레이터가 아니라 연구 환경으로 쓴다. Paper Agent는 실제 저자의 의식이나 의도를 재현하지 않는다. 검토된 문헌을 근거로 제한된 발화를 만드는 연구 인터페이스다.

실험 기능, 라이브 토론 실행기

범용 라이브 토론(Live Debate) 실행기는 main이 아니라 feat/live-agent-debate 브랜치에 있다. 실행기는 Codex를 호출하므로 Codex가 설치돼 있고 모델을 부를 수 있는 환경이어야 한다.

이 브랜치에는 샘플 Paper Agent 네 개가 들어 있다. 벤야민 예술작품 논문의 V2·V3 판본 에이전트(benjamin-artwork-v2, benjamin-artwork-v3)와 이용욱의 2019년 논문을 다룬 에이전트 두 개(lee-aura-2019, lee-aura-2019-phase2)다. 매뉴얼은 run_live_debate.py로 벤야민 V2와 이용욱 논문 에이전트에게 “기술적 복제와 아우라의 변형은 어떻게 이해해야 하는가?”를 주제로 토론시키는 예를 보여 준다. 실행기의 기본 모델은 현재 코드상 gpt-6-sol이고 --model로 바꿀 수 있다. 기본 토론 길이 8턴은 에이전트마다 8번이 아니라 세션 전체 발언 수다.

터미널에는 턴마다 에이전트, 행동 유형, 발언, 근거 ID와 쪽이 찍힌다. 근거가 충분하지 않으면 ABSTAIN이 나오는데, 실패가 아니라 근거 경계를 지키는 정상 동작이다. 결과는 --json-out으로 JSON에 저장해 연구 기록으로 남긴다. 같은 브랜치에 로컬 API(기본 포트 8765)와 웹 UI도 있지만 역시 실험 기능이라 공개 서비스용 안정판으로 보면 안 된다.

내 논문을 추가하려면

자동화된 것과 아직 연구자가 해야 하는 것을 구분해야 한다. 지금 저장소에는 미리 만든 샘플 에이전트를 골라 토론을 돌리는 실행기가 있을 뿐, 임의의 인문학 PDF를 넣으면 완성된 에이전트가 자동 등록되는 단일 명령은 아직 main의 안정 기능이 아니다.

그래서 매뉴얼은 논문 PDF를 바로 역할극 프롬프트에 넣지 말고 Paper2Skill의 원문 검증부터 거치라고 한다. 토론에 넣기 전 새 에이전트에는 최소한 고유한 논문·에이전트 ID, 정확한 저자·논문·판본 정보, 검토된 근거 색인, 근거 문장 ID, 실제 쪽 정보, AUTHOR_CLAIM과 INTERPRETATION의 구분, 허용된 코퍼스 범위가 있어야 한다. 논문 저자가 자기 자신이어도 같은 기준을 적용한다.

등록한 뒤에는 단독 검증부터 한다. 핵심 명제 세 개와 근거 쪽을 대게 하고, 논문이 주장하지 않는 것 세 가지를 말하게 하고, 해석이 필요한 문장과 저자의 직접 주장을 나누게 하고, 근거 없는 질문에는 답하지 않게 한다. 이 단계에서 잘못된 저자 귀속이나 가짜 쪽 번호가 나오면 토론에 넣지 않는다.

토론은 에이전트 둘과 분명한 쟁점 하나로 시작해 안정되면 세 번째 논문을 더한다. 좋은 주제는 “두 논문의 핵심 개념이 정확히 어디서 갈라지는가?”나 “B의 비판을 받아들이면 A의 어떤 명제를 고쳐야 하는가?” 같은 것이다. “누가 더 위대한가?”, “두 사람이라면 오늘날 AI를 어떻게 평가할까?”, “자유롭게 토론해라” 같은 주제는 문헌 근거보다 역할극과 모델의 일반 지식이 끼어들 가능성이 크다.

토론에서 연구로

라이브 토론 자체는 연구 결과가 아니다. 매뉴얼은 세 단계를 요구한다.

  1. 발견: 에이전트 사이의 충돌에서 새로운 연결, 반론, 아투라 후보를 찾는다.
  2. 검증: 해당 턴의 근거 ID와 쪽을 실제 원문에서 다시 읽고, 필요하면 선행 연구를 더 조사한다.
  3. 연구자 판단: 그 연결이 단순한 언어적 유사성인지 실제 개념적 관계인지 판단한다. 논문에 쓸 때는 AI 토론 문장을 권위로 인용하지 말고 원문과 선행 연구를 근거로 자기 논증을 다시 세운다.

이 과정을 거치면 이 도구는 AI가 대신 논문을 쓰는 도구가 아니라, 연구자가 문헌 사이의 마찰을 설계하고 새 질문을 찾는 환경이 된다. 연구에 쓸 때는 원조 Paper2Agent의 Nature 논문을 인용하고, 인문학 확장을 썼다면 커밋·브랜치, 자료 판본, 모델, 프롬프트·프로토콜, 사람의 검토 절차를 기록하라고 매뉴얼은 권한다. AI가 생성한 토론은 문헌을 대체하지 않으며, 가장 중요한 근거는 언제나 원문이다.

출처

공유