7 분 소요

hits

1. 연구의 목적

(1) 고등교육 현장에서 학습자에게 시의적절하고 질 높은 피드백을 제공하는 일은 늘 난제임. 늘어나는 수강생 수와 과제의 복잡성은 교사의 피드백 역량을 한계로 몰아세움. 이러한 현실에 생성형 인공지능(AI)이 대안으로 부상하고 있으나, 그 효과성과 인간 교사 피드백과의 실제적 동등성에 대한 논의는 활발함. 기존 연구는 주로 AI의 확장성과 적시성에 초점을 맞춤.

(2) 이 연구는 AI가 생성한 피드백이 프로젝트 기반 학습에서 실제적인 교육 효과를 지니는지, 그리고 경험 많은 인간 교사의 피드백과 실질적으로 비교될 수 있는지를 검증함. 학습 성과 변화와 학생들의 인식을 객관적으로 측정해 AI 피드백의 유효성을 다각도로 평가하는 것이 핵심 목표임.


2. 연구의 방법

(1) 이 연구는 준실험 설계를 채택함. 이탈리아 파도바 대학교의 학부생 238명을 47개 그룹으로 나누고, 세 가지 피드백 조건에 무작위 배정함. 연구의 진행은 총 5단계로 구성됨.

  • 초기 프로젝트 설계 과제 제출 (사전 평가)
  • 루브릭 공동 구성 및 예시 분석을 통한 평가 기준 공유
  • AI 챗봇(GPT-o4-mini 또는 DeepSeek R1) 또는 인간 교사의 피드백 제공
  • 피드백 반영 후 프로젝트 수정 및 재제출 (사후 평가)
  • 최종 성과 측정 및 학생 인식 설문조사

(2) 주요 분석 대상은 프로젝트 기반 학습을 수행한 47개 학생 그룹임. 비교 조건은 다음과 같음.

  • 인간 교사 피드백: 두 명의 전문 교사가 협업하여 피드백 제공.
  • AI 피드백 (GPT-o4-mini): 챗GPT 모델 기반.
  • AI 피드백 (DeepSeek R1): 다른 대규모 언어 모델. 학습 성과는 30점 만점의 분석적 루브릭을 사용한 프로젝트 점수 변화로 측정함. 학생 인식은 19개 문항의 설문지와 1개 문항의 개방형 질문으로 수집함. 통계 분석에는 비모수 검정, 로버스트 모델, 비열등성 및 동등성 분석을 사용함.

3. 주요 발견

이 연구는 AI가 고등교육 피드백 시스템에 효과적으로 통합될 수 있는지를 면밀히 탐색함. 특히 AI 피드백의 유효성이 단순히 기술적 우월성이 아니라, 명확한 교육적 설계와 맥락에 따라 좌우됨을 밝힘.

고등교육 피드백의 기술 지원 배경과 연구 초점
기술 지원 피드백의 발전과 AI 피드백의 역할

(1) 연구 설계: 교수 설계 및 평가 과정

이 연구는 교수 설계와 평가 과정이 AI 피드백의 효과를 결정하는 핵심 요소임을 강조함. 학생들은 루브릭을 공동으로 구성하고 예시를 분석하여 평가 기준을 내재화하는 과정을 거침. 이는 피드백의 출처와 무관하게 모든 학습자들이 피드백을 효과적으로 활용하도록 돕는 기반이 됨.

프로젝트 기반 학습 및 형성 피드백 연구의 5단계
프로젝트 기반 학습 및 형성 피드백 연구의 단계별 진행

AI 피드백은 교수학, 교육 설계, 평가, 피드백 전문성을 갖춘 교수 역할을 하도록 프롬프트를 설계함. 코스 자료, 과제 설명, 루브릭을 포함한 모든 교육 자료를 RAG(Retrieval-Augmented Generation) 방식으로 AI에 제공하여 문맥에 맞는 피드백을 생성하도록 유도함. 이는 AI 피드백이 단순한 텍스트 생성이 아니라, 교육적 맥락과 평가 기준에 깊이 기반함을 의미함.

(2) 피드백 제공 전후 프로젝트 성과 변화

피드백 출처와 관계없이 모든 조건에서 프로젝트 성과가 통계적으로 유의미하게 향상됨. 사전 피드백 점수는 평균 23.81점에서 사후 피드백 점수는 27.70점으로 크게 상승함. 이 개선은 30점 만점 척도에서 약 3.9점의 평균 증가를 나타내며, 효과 크기(rrb)는 0.77로 매우 큼. 이는 피드백 자체가 학습 성과 개선에 결정적 역할을 함을 증명함.

(3) 피드백 출처별 성과 비교

피드백 출처(인간 교사, GPT-o4-mini, DeepSeek R1) 간의 사후 프로젝트 성과에서는 통계적으로 유의미한 차이가 없음. 이러한 결과는 AI 피드백이 인간 교사 피드백과 동등한 학습 성과를 유도함을 시사함. 프로젝트 점수가 사후에 27점 이상으로 몰리는 ‘천장 효과’가 있었지만, 이를 보완하기 위한 분석(이득 점수, 기준선 조정 변화 점수)에서도 유사한 결과가 나타남.

출처 n 사전 평균 사전 SD 사후 평균 사후 SD 차이 평균 차이 SD
DeepSeek R1 16 24.94 3.73 28.00 0.37 3.06 3.94
교사 16 22.69 6.24 27.44 1.37 4.75 6.59
GPT-o4-mini 15 23.80 3.28 27.67 0.82 3.87 3.50
전체 47 23.81 4.63 27.70 0.95 3.89 4.84

위 표는 피드백 출처별 프로젝트 성과 변화를 보여줌. 모든 출처에서 사후 평균 점수가 상당히 높게 나타남. 피드백 출처 간 사후 점수에는 통계적으로 유의미한 차이가 없다는 점은 중요한 발견임.

(4) AI 피드백의 실질적 동등성 및 비열등성

통계적 유의미성 없음이 반드시 실질적 동등성을 의미하지는 않음. 이 연구는 비열등성 및 동등성 분석을 통해 AI 피드백의 실질적 가치를 확인하고자 함. 30점 척도에서 ±1점의 오차 범위를 동등성 기준으로 설정함.

비교 대상 n(AI) n(인간) 평균 차이 90% 신뢰 구간 비열등성 충족 동등성 충족
GPT-o4-mini vs 교사 15 16 0.23 [-0.46, 0.91]
DeepSeek R1 vs 교사 16 16 0.56 [-0.05, 1.18] 아니오

위 표는 AI 피드백과 인간 교사 피드백 간의 실질적 동등성 및 비열등성 검정 결과를 나타냄.

  • GPT-o4-mini는 인간 교사 피드백과 비교하여 비열등성뿐만 아니라 동등성 기준을 모두 충족함. 이는 GPT-o4-mini가 인간 교사의 피드백과 실질적으로 대등한 효과를 지닌다는 강력한 증거임.
  • DeepSeek R1은 비열등성 기준은 충족하지만, 동등성 기준은 충족하지 못함. 이는 DeepSeek R1의 피드백이 인간 교사 피드백보다 열등하지는 않으나, 완전히 동등하다고 단정하기는 어려움을 의미함.

(5) 학생들의 피드백 인식

학생들은 자신이 받은 피드백의 출처를 알지 못함. 이러한 블라인드 조건에서 학생들의 인식은 세 가지 주요 측면에서 유사한 양상을 보임.

차원 조건 n 평균 중앙값 SD 최소 최대
인지된 숙달도 DeepSeek R1 81 4.22 4.25 0.44 2.88 5
(P1-P8) 교사 63 4.14 4.13 0.48 3 5
  GPT-o4-mini 56 4.17 4.13 0.54 2.88 5
긍정적 감정 DeepSeek R1 81 4.21 4.33 0.59 2.5 5
(EP1-EP6) 교사 63 3.99 4.17 0.65 2.33 5
  GPT-o4-mini 56 4.20 4.33 0.60 2.67 5
부정적 감정 DeepSeek R1 81 1.22 1.20 0.35 1 3.6
(EN1-EN5) 교사 63 1.31 1.20 0.30 1 2.2
  GPT-o4-mini 56 1.39 1.20 0.52 1 3

위 표는 피드백 조건별 학생 인식 설문 결과임.

  • 인지된 숙달도: 모든 그룹에서 높게 나타남(평균 약 4.14–4.22). 피드백 출처와 관계없이 프로젝트 설계 역량 향상에 도움이 되었다고 인식함.
  • 긍정적 감정: 마찬가지로 높게 나타남(평균 약 3.99–4.21). 피드백이 동기 부여에 기여했다고 평가함.
  • 부정적 감정: 모든 그룹에서 낮게 나타남(평균 약 1.22–1.39). 피드백 과정에서 불편함이나 불참의 수준이 미미했음을 의미함. 전반적인 만족도 또한 98%로 매우 높았으며, 피드백 출처 간 유의미한 차이가 없음. 이러한 결과는 AI가 생성한 피드백이 학생들에게 수용 가능하고 지지적인 형성 평가의 형태로서 인간 교사 피드백에 비견될 만하다는 강력한 증거임.

4. 결론 및 시사점

(1) 이 연구는 피드백의 효과가 그 출처(AI인가 인간 교사인가)보다는 피드백이 내재된 교수 설계의 질에 더 크게 좌우됨을 입증함. 명확한 평가 기준, 루브릭의 공동 구성, 그리고 예시를 활용한 평가 기준 내재화가 뒷받침될 때, AI 생성 피드백은 고등교육에서 신뢰할 수 있는 형성 평가 도구로 기능함. AI는 교사를 대체하는 것이 아니라, 교사의 평가 리터러시를 증폭시키고 잘 설계된 교육적 구조를 지원하는 도구로서의 가치를 가짐.

(2) 교육 현장에 주는 가장 큰 시사점은 AI를 활용한 피드백 시스템 도입 시 기술 자체의 성능보다 명확한 교육적 아키텍처를 구축하는 데 우선순위를 두어야 한다는 점임. 교사는 AI 도구에 명시적인 평가 기준과 예시를 제공하여 피드백의 질을 높일 수 있음. 학생들은 루브릭 공동 구성과 예시 분석을 통해 평가 리터러시를 함양하고, 이는 AI 피드백을 수동적으로 수용하는 대신 능동적으로 해석하고 활용하는 능력으로 이어짐. 이는 AI 피드백이 가지는 확장성과 적시성을 교육적 품질 저하 없이 활용할 수 있는 핵심 조건이 됨.

(3) AI 기반 피드백은 학생들의 자기 성찰 능력을 강화하는 중요한 기회를 제공함. AI가 제공하는 즉각적이고 일관된 피드백은 학생들이 자신의 학습 과정을 지속적으로 모니터링하고 수정할 수 있는 기반을 마련함. 그러나 학생들이 AI 생성 피드백에 지나치게 의존하거나, 비판적 사고 없이 수용하는 위험 또한 존재함. 따라서 교육자는 AI 피드백을 활용하되, 학생들이 피드백을 비판적으로 평가하고 자신의 학습에 적용하는 능력을 키울 수 있도록 지도하는 역할을 포기하지 않아야 함.


5. 리뷰어의 ADD(+) One: 생각 더하기

(1) 이 논문에서 가장 주목할 지점은 AI 피드백의 효과를 단순히 ‘AI가 인간 교사만큼 좋다/나쁘다’는 이분법적 사고를 넘어, ‘어떤 조건에서 AI가 교육적으로 의미 있는 피드백을 제공하는가’라는 본질적인 질문으로 전환했다는 점임. 기존 논의가 주로 AI의 기술적 역량 자체에 집중했다면, 이 연구는 교사의 ‘평가 리터러시’가 AI 피드백의 교육적 품질을 좌우하는 핵심 연결고리임을 명확히 제시함. 루브릭 공동 구성, 예시 기반 학습 등 교사가 설계한 ‘페다고지컬 아키텍처’가 AI가 제공하는 피드백에 ‘영혼’을 불어넣는 조건이라는 단언은 교육 현장에 AI를 도입하려는 이들에게 날카로운 통찰을 제공함. 기술은 도구일 뿐, 그것을 어떻게 활용할지에 대한 교사의 전문성이 무엇보다 중요하다는 당연한 진리를 AI 시대에 새롭게 조명함.

(2) 이 연구가 명시하지 않은 더 넓은 의미는 AI 시대에 ‘교사의 전문성’이 재정의되어야 할 필요성임. 단순히 지식을 전달하고 평가하는 역할을 넘어, AI와 같은 기술 도구를 교육적 목표에 맞춰 ‘조율’하고 ‘매개’하는 고도화된 역량이 요구됨. 이는 HCI(인간-컴퓨터 상호작용) 관점에서 ‘인간-AI 협업’의 교육적 모델을 제시하는 동시에, 교육정책 측면에서는 AI 도입에 앞서 교사들의 평가 리터러시 및 AI 리터러시 교육을 필수화해야 한다는 함의를 지님. AI 피드백이 학습자의 메타인지 발달에 미치는 영향 또한 더 넓게 탐구되어야 함. 학생이 AI 피드백을 단순히 받아들이는 것을 넘어, 자신의 강점과 약점을 스스로 진단하고 학습 전략을 수정하는 데 AI를 활용할 수 있도록 돕는 방향으로 나아가야 함.

(3) 이 연구를 발전시킬 구체적 아이디어는 세 가지임. 첫째, 학생의 ‘평가 리터러시’ 수준을 직접 측정하고, 이 리터러시 수준이 AI 피드백 활용의 효과를 어떻게 조절하는지에 대한 심층 연구가 필요함. 예를 들어, 평가 리터러시가 높은 학생은 AI 피드백의 한계를 인지하고 비판적으로 수용하는 반면, 낮은 학생은 무비판적으로 수용하여 학습의 질적 성장을 저해할 가능성을 탐색할 수 있음. 둘째, AI 피드백의 ‘질적 특성’(예: 명확성, 구체성, 동기 부여 효과)을 정량적 점수 외에 다면적으로 평가하는 척도를 개발해야 함. 단순히 최종 프로젝트 점수 개선을 넘어, AI 피드백이 학습자의 추론 능력, 창의성, 문제 해결 능력에 어떤 영향을 미쳤는지를 질적으로 분석하는 것이 중요함. 셋째, AI 피드백 프롬프트 엔지니어링을 더욱 정교화하여, 학습자 개개인의 학습 스타일, 인지 부하, 감성적 특성을 고려한 맞춤형 피드백을 제공하는 방법을 연구할 필요가 있음. 이는 AI가 단순한 도구를 넘어, 학습자의 개별적 요구에 민감하게 반응하는 ‘지능형 조력자’로 진화하는 방향을 제시함.


6. 추가 탐구 질문

(1) 교과 영역, 학습자 연령 및 문화적 배경이 다른 다양한 교육 맥락에서 AI 피드백의 실질적 동등성 및 비열등성은 어떻게 달라지는가? 예를 들어, 문학 창작이나 철학적 에세이와 같이 주관적 해석이 중요한 과제에서 AI 피드백의 한계는 무엇인가?

(2) AI 피드백이 장기적인 관점에서 학생들의 자기조절학습 능력, 비판적 사고력, 그리고 교사에 대한 신뢰도에 어떤 영향을 미치는가? 단기적인 성과 향상을 넘어, 지속 가능한 학습 역량 강화에 AI가 기여할 수 있는 방안은 무엇인가?

(3) AI 피드백 시스템의 개발과 적용 과정에서 발생할 수 있는 데이터 프라이버시, 알고리즘 편향성, 그리고 학습 불평등 문제에 대한 윤리적·기술적 해법은 무엇인가? 모든 학생에게 공정하고 안전한 AI 피드백 환경을 제공하기 위한 정책적, 제도적 장치는 어떻게 마련되어야 하는가?


출처

DOI: 10.1080/02602938.2026.2697962

  • Grion, V., Doria, B., Agostini, D., & Slaviero, G. (2026). Artificial intelligence and feedback in university education: effectiveness and student perceptions. Assessment & Evaluation in Higher Education. https://doi.org/10.1080/02602938.2026.2697962
공유