585 / 592
POSTECH 생성형 AI 연구 데이터 분석 실습 가이드
포스텍 교육혁신센터가 주관하는 ‘생성형 AI 활용 연구 데이터 분석’ 실습 가이드는 연구자들이 인공지능을 이용해 데이터 분석을 수행하고, 그 과정을 체계적으로 관리하는 방법을 익히도록 돕는다. 2026년 8월 19일부터 20일까지 이틀간 온라인으로 진행되는 이 워크숍은 실용적인 접근법으로 AI를 연구에 통합하는 방안을 제시한다.
생성형 AI로 연구 데이터 분석하기
워크숍의 첫째 날은 자신의 연구 데이터를 활용해 AI와 함께 재현 가능한 분석 과정을 구축하는 데 초점을 맞춘다. 이 과정은 ‘하네스’라는 개념을 통해 AI에게 명확한 작업 지침과 환경을 제공하고, 예측 가능한 결과를 얻도록 돕는다. 실습은 키트 수령부터 분석 결과 해석까지 5단계의 체크포인트를 거쳐 진행된다.
실습 키트 및 환경 준비
참가자는 postech-practice-kit.zip 파일(38KB)을 받아 실습을 시작한다. 이 키트에는 더미 데이터(CSV), 클로드(Claude) 분석 규약 파일(CLAUDE.md), 다양한 프롬프트 버전, 그리고 옵시디언(Obsidian) 분석 로그 템플릿이 포함된다.
실습 환경은 두 가지 경로 중 하나를 선택한다.
- 경로 A (코드 실행 환경): 키트 폴더에서 터미널을 통해 직접 코드를 실행한다. 파이썬(Python) 패키지인
pandas,scipy,statsmodels,matplotlib설치가 필요하다. 에이전트가 패키지 설치를 요청하면 승인 후 기다리면 된다. - 경로 B (웹 챗 환경): claude.ai 또는 chatgpt.com 같은 웹 챗 인터페이스에 CSV 파일을 직접 업로드하고 프롬프트를 복사하여 진행한다. 이 경우 웹 챗 도구의 데이터 정책을 미리 확인하는 것이 중요하며, 민감한 미공개 연구 데이터는 웹에 업로드하지 않도록 유의한다.
연구 데이터 분석 5단계 체크포인트
실습은 총 다섯 단계로 구성된다. 각 단계는 특정 작업을 수행하고, AI의 응답이 제시된 통과 기준을 충족하면 다음 단계로 넘어간다.
| 체크포인트 | 주요 내용 | 통과 기준 |
|---|---|---|
| 데이터 구조 파악 | experiment_nanoparticle.csv 파일의 데이터 구조(컬럼 타입, 결측치, 이상치 등)를 파악한다. |
AI가 4가지 데이터 문제(날짜 형식 혼용, 촉매 표기 불일치, 켈빈 단위 혼용, 소수점 누락으로 인한 10배 이상 값)를 스스로 발견한다. 문제가 미발견 시 “3명이 입력. 표기 불일치와 단위 혼용 가능성 의심. 다시 봐”라고 지시한다. |
| 정리 및 전처리 | 데이터 구조 파악에서 발견된 모든 문제를 해결하는 전처리 코드를 작성하고 실행한다. 원본 데이터는 수정하지 않고, 정리된 데이터를 data/clean/에 저장한다. |
clean_experiment.csv 파일이 생성되고, AI가 “무엇을 몇 건 고쳤는지” 요약해서 보고한다. |
| 분석 방향 설정 | 연구 질문(“어떤 조건에서 40nm 이하 입자를 수율 85% 이상으로 얻는가?”)에 적합한 2~3가지 분석 기법 후보를 각각의 가정 및 한계와 함께 제안한다. 아직 코드를 실행하지는 않는다. | AI가 특정 기법을 ‘선택’하지 않고, 여러 기법 후보와 그 가정 및 한계를 제시하며 연구자가 최종 선택하도록 한다. |
| 분석 코드 작성 및 실행 | 이전 단계에서 연구자가 선택한 분석 기법에 따라 코드를 작성하고 실행한다. 오류 발생 시 AI가 스스로 디버깅하며 최종 결과만 보고한다. | 촉매 효과와 온도 효과가 통계적으로 유의미하게 확인된다. (데이터에 신호가 강하게 있으므로, 결과가 나오지 않으면 전처리 단계 재확인) |
| 해석 및 시각화 | 분석 결과를 세 가지 다른 형식으로 정리한다. (1) 논문 결과 단락 초안 (3~4문장), (2) 학회 발표용 그래프 1개, (3) 지도교수 보고용 요약 (3줄). 그래프는 figures/에 PNG 형식으로 저장한다. |
동일한 분석 결과가 목적에 맞춰 다른 형태로 (논문, 발표, 보고서) 출력된다. 이는 분석과 전달의 분리를 보여준다. |
AI 하네스로 고정하기
실습을 마친 후, 오늘 정립된 데이터 분석 규칙과 절차를 CLAUDE.md 파일에 업데이트하여 ‘나만의 AI 하네스’를 완성한다. 웹 챗 사용자는 클로드/챗GPT의 프로젝트 지침에 따라 동일한 내용을 저장하면 된다. 이는 분석 과정을 명시적으로 기록하고 재현성을 확보하는 중요한 단계이다.
다양한 프롬프트 버전 직접 비교하기
강의 초반에 제시된 “같은 데이터, 세 가지 답” 시연에 사용된 세 가지 프롬프트(v1, v2, v3)를 직접 체험해 본다. 이를 통해 프롬프트 엔지니어링의 중요성을 실감한다.
| 프롬프트 버전 | 특징 | 결과 |
|---|---|---|
| v1: 그냥 물어보기 | “실험 데이터 분석해 줘”와 같이 맥락 없이 단순하게 요청한다. | 일반적인 답변을 제공하며, 데이터의 함정(오류)을 무시하여 실패한 분석 사례가 된다. |
| v2: 컨텍스트 활용 | 30줄 분량의 상세한 맥락을 제공한다. “너는 재료공학 연구실의 데이터 분석 조교다”와 같은 역할 부여, 데이터 배경, 연구 질문, 응용 규칙 등을 포함한다. | 정확하고 상세한 분석을 수행하며, 연구 질문에 초점을 맞춘 결과를 도출한다. |
| v3: 하네스 활용 | 키트 폴더에서 Claude Code를 실행한 후 CLAUDE.md 파일에 정의된 규칙에 따라 AI에게 작업 지시를 내린다. “연구 질문에 답해 줘: 어떤 조건에서 40nm 이하 입자를 수율 85% 이상 얻을 수 있어?”와 같이 간결하게 질문한다. |
가장 정교하고 재현 가능한 분석을 수행하며, 규정된 절차와 형식에 따라 결과를 제공한다. |
LLM 위키 구축, 지식 관리의 미래
워크숍의 둘째 날은 ‘아는 환경’ 즉, 구축된 AI 하네스와 연동되는 연구 지식 베이스, 즉 LLM 위키를 만드는 방법을 다룬다. 참가자는 자신이 가진 논문, 실험 노트, 분석 로그 등을 옵시디언(Obsidian)과 AI 에이전트를 활용하여 검색 및 연결 가능한 지식 베이스로 전환한다. 이는 연구 에이전트 완성을 위한 핵심 단계이다. 이를 위해 자신의 논문이나 실험 노트 2~3건과 첫째 날 실습에서 생성된 분석 로그 노트를 옵시디언에 넣어오는 준비를 한다.









