585 / 592

3 분 소요

hits

포스텍 교육혁신센터가 주관하는 ‘생성형 AI 활용 연구 데이터 분석’ 실습 가이드는 연구자들이 인공지능을 이용해 데이터 분석을 수행하고, 그 과정을 체계적으로 관리하는 방법을 익히도록 돕는다. 2026년 8월 19일부터 20일까지 이틀간 온라인으로 진행되는 이 워크숍은 실용적인 접근법으로 AI를 연구에 통합하는 방안을 제시한다.

POSTECH 생성형 AI 연구 데이터 분석 실습 가이드

생성형 AI로 연구 데이터 분석하기

워크숍의 첫째 날은 자신의 연구 데이터를 활용해 AI와 함께 재현 가능한 분석 과정을 구축하는 데 초점을 맞춘다. 이 과정은 ‘하네스’라는 개념을 통해 AI에게 명확한 작업 지침과 환경을 제공하고, 예측 가능한 결과를 얻도록 돕는다. 실습은 키트 수령부터 분석 결과 해석까지 5단계의 체크포인트를 거쳐 진행된다.

실습 키트 및 환경 준비

참가자는 postech-practice-kit.zip 파일(38KB)을 받아 실습을 시작한다. 이 키트에는 더미 데이터(CSV), 클로드(Claude) 분석 규약 파일(CLAUDE.md), 다양한 프롬프트 버전, 그리고 옵시디언(Obsidian) 분석 로그 템플릿이 포함된다.

실습 환경은 두 가지 경로 중 하나를 선택한다.

  • 경로 A (코드 실행 환경): 키트 폴더에서 터미널을 통해 직접 코드를 실행한다. 파이썬(Python) 패키지인 pandas, scipy, statsmodels, matplotlib 설치가 필요하다. 에이전트가 패키지 설치를 요청하면 승인 후 기다리면 된다.
  • 경로 B (웹 챗 환경): claude.ai 또는 chatgpt.com 같은 웹 챗 인터페이스에 CSV 파일을 직접 업로드하고 프롬프트를 복사하여 진행한다. 이 경우 웹 챗 도구의 데이터 정책을 미리 확인하는 것이 중요하며, 민감한 미공개 연구 데이터는 웹에 업로드하지 않도록 유의한다.

연구 데이터 분석 5단계 체크포인트

실습은 총 다섯 단계로 구성된다. 각 단계는 특정 작업을 수행하고, AI의 응답이 제시된 통과 기준을 충족하면 다음 단계로 넘어간다.

체크포인트 주요 내용 통과 기준
데이터 구조 파악 experiment_nanoparticle.csv 파일의 데이터 구조(컬럼 타입, 결측치, 이상치 등)를 파악한다. AI가 4가지 데이터 문제(날짜 형식 혼용, 촉매 표기 불일치, 켈빈 단위 혼용, 소수점 누락으로 인한 10배 이상 값)를 스스로 발견한다. 문제가 미발견 시 “3명이 입력. 표기 불일치와 단위 혼용 가능성 의심. 다시 봐”라고 지시한다.
정리 및 전처리 데이터 구조 파악에서 발견된 모든 문제를 해결하는 전처리 코드를 작성하고 실행한다. 원본 데이터는 수정하지 않고, 정리된 데이터를 data/clean/에 저장한다. clean_experiment.csv 파일이 생성되고, AI가 “무엇을 몇 건 고쳤는지” 요약해서 보고한다.
분석 방향 설정 연구 질문(“어떤 조건에서 40nm 이하 입자를 수율 85% 이상으로 얻는가?”)에 적합한 2~3가지 분석 기법 후보를 각각의 가정 및 한계와 함께 제안한다. 아직 코드를 실행하지는 않는다. AI가 특정 기법을 ‘선택’하지 않고, 여러 기법 후보와 그 가정 및 한계를 제시하며 연구자가 최종 선택하도록 한다.
분석 코드 작성 및 실행 이전 단계에서 연구자가 선택한 분석 기법에 따라 코드를 작성하고 실행한다. 오류 발생 시 AI가 스스로 디버깅하며 최종 결과만 보고한다. 촉매 효과와 온도 효과가 통계적으로 유의미하게 확인된다. (데이터에 신호가 강하게 있으므로, 결과가 나오지 않으면 전처리 단계 재확인)
해석 및 시각화 분석 결과를 세 가지 다른 형식으로 정리한다. (1) 논문 결과 단락 초안 (3~4문장), (2) 학회 발표용 그래프 1개, (3) 지도교수 보고용 요약 (3줄). 그래프는 figures/에 PNG 형식으로 저장한다. 동일한 분석 결과가 목적에 맞춰 다른 형태로 (논문, 발표, 보고서) 출력된다. 이는 분석과 전달의 분리를 보여준다.

AI 하네스로 고정하기

실습을 마친 후, 오늘 정립된 데이터 분석 규칙과 절차를 CLAUDE.md 파일에 업데이트하여 ‘나만의 AI 하네스’를 완성한다. 웹 챗 사용자는 클로드/챗GPT의 프로젝트 지침에 따라 동일한 내용을 저장하면 된다. 이는 분석 과정을 명시적으로 기록하고 재현성을 확보하는 중요한 단계이다.

다양한 프롬프트 버전 직접 비교하기

강의 초반에 제시된 “같은 데이터, 세 가지 답” 시연에 사용된 세 가지 프롬프트(v1, v2, v3)를 직접 체험해 본다. 이를 통해 프롬프트 엔지니어링의 중요성을 실감한다.

프롬프트 버전 특징 결과
v1: 그냥 물어보기 “실험 데이터 분석해 줘”와 같이 맥락 없이 단순하게 요청한다. 일반적인 답변을 제공하며, 데이터의 함정(오류)을 무시하여 실패한 분석 사례가 된다.
v2: 컨텍스트 활용 30줄 분량의 상세한 맥락을 제공한다. “너는 재료공학 연구실의 데이터 분석 조교다”와 같은 역할 부여, 데이터 배경, 연구 질문, 응용 규칙 등을 포함한다. 정확하고 상세한 분석을 수행하며, 연구 질문에 초점을 맞춘 결과를 도출한다.
v3: 하네스 활용 키트 폴더에서 Claude Code를 실행한 후 CLAUDE.md 파일에 정의된 규칙에 따라 AI에게 작업 지시를 내린다. “연구 질문에 답해 줘: 어떤 조건에서 40nm 이하 입자를 수율 85% 이상 얻을 수 있어?”와 같이 간결하게 질문한다. 가장 정교하고 재현 가능한 분석을 수행하며, 규정된 절차와 형식에 따라 결과를 제공한다.

LLM 위키 구축, 지식 관리의 미래

워크숍의 둘째 날은 ‘아는 환경’ 즉, 구축된 AI 하네스와 연동되는 연구 지식 베이스, 즉 LLM 위키를 만드는 방법을 다룬다. 참가자는 자신이 가진 논문, 실험 노트, 분석 로그 등을 옵시디언(Obsidian)과 AI 에이전트를 활용하여 검색 및 연결 가능한 지식 베이스로 전환한다. 이는 연구 에이전트 완성을 위한 핵심 단계이다. 이를 위해 자신의 논문이나 실험 노트 2~3건과 첫째 날 실습에서 생성된 분석 로그 노트를 옵시디언에 넣어오는 준비를 한다.

출처

공유