658 / 660

6 분 소요

hits

1. 연구의 목적

(1) 인공지능(AI) 언어 모델(LLM)의 급속한 발전과 교육 현장 도입 가속화는 LLM의 역량을 정확하게 평가하는 것을 핵심 과제로 만듦. 이에 따라 인간의 기술과 역량을 측정하도록 설계된 기존 평가 도구, 특히 표준화된 시험이 LLM 평가에 광범위하게 사용됨. 하지만 이러한 접근은 LLM이 시험에서 보이는 성능이 인간에게서 측정되는 것과 동일한 ‘기저 역량(underlying constructs)’을 반영하는지에 대한 본질적인 의문을 제기함. 기존 평가 도구의 유효성 논리는 인간 집단에 맞춰 구축되었기에, AI 시스템에 그대로 전이될 수 없다는 회의적인 시각이 존재함.

(2) 이 연구는 과학 교육과 수리 추론이라는 두 가지 교육 맥락에서 인간용 평가 도구가 LLM에게도 동일한 잠재 구조를 측정하는지 여부를 검증함. 궁극적으로 인간과 LLM 간의 응답 패턴이 어떻게 다른지 요인 분석 기반으로 비교 분석하여, LLM 평가 관행의 유효성 문제를 다루는 데 목적이 있음.

2. 연구의 방법

(1) 응답의 잠재 구조 유사성을 평가하기 위해 탐색적 요인 분석(EFA), 요인 일치도(factor congruence) 분석, 그리고 반복 재표본 추출(repeated resampling) 기법을 결합함. 이 다단계 분석은 인간과 LLM 응답 간의 구조적 차이를 정량적, 질적으로 포착함.

(2) 주요 분석 대상 또는 비교 조건은 다음과 같음. (1) 고등학교 화학 진단 평가: 22개 객관식 문항으로 구성되었으며, 931명의 학생 응답 데이터를 사용함. (2) 대입 시험 수리 추론 섹션: 20개 객관식 문항으로 구성되었으며, 4,800명 이상의 수험생 응답 데이터를 사용함.

  • 두 평가 도구 모두 멀티모달(텍스트, 그림, 수식 포함) 특성을 가짐.
  • LLM 응답 데이터는 6개 멀티모달 LLM(GPT-4o, GPT-5.2; Gemini 1.5 Pro, Gemini 3 Pro; Claude 3.5 Sonnet, Claude 4.5)으로 수집함. 각 LLM별 20개, 총 120개의 독립적 응답 세트를 생성한 뒤 하나의 LLM 그룹으로 통합하여 분석함.

3. 주요 발견

이 연구는 인간용 평가 도구가 LLM과 인간에게 서로 다른 잠재 구조를 측정한다는 명확한 증거를 제시함. 이는 LLM이 정답을 맞히더라도 그 과정과 사고방식이 인간과 근본적으로 다를 수 있음을 시사함.

(1) 요인 추출 단계의 체계적 이질성

요인 추출 단계에서 LLM과 인간 응답 데이터는 측정된 잠재 요인의 수와 안정성에서 차이를 보임. 이는 평가 도구가 인간과 LLM에게 서로 다른 수의 기본적인 인지 차원을 반영함을 의미함.

기준/평가 도구 집단 추출 요인 수 안정성 (평행 분석)
카이저 기준 화학 인간: 4 -
    LLM: 4 -
  수리 추론 인간: 5 -
    LLM: 5 -
평행 분석 화학 인간: 5 100%
    LLM: 4 62.4%
  수리 추론 인간: 7-8 66% (8요인), 34% (7요인)
    LLM: 5 100%

위 표는 카이저 기준에서 일부 일치를 보였지만, 평행 분석에서는 LLM과 인간 간에 일관되게 요인 수의 차이가 나타남을 보여줌. 특히 수리 추론의 경우, 인간은 더 많은 요인을 통해 문제를 해결하는 반면, LLM은 더 적은 요인으로 응답 패턴을 설명함.

(2) 잠재 요인 구조의 질적 차이

요인 수가 유사한 경우에도, 각 문항이 어떤 요인에 얼마나 강하게 연결되는지(요인 부하 구조)에서 인간과 LLM 간에 현저한 질적 차이가 나타남. 이는 동일한 시험 문항이 인간과 LLM에게 서로 다른 인지 과정을 활성화함을 시사함.

인간과 LLM의 화학 시험 요인 부하 구조 비교. 파란색 선은 인간 응답의 요인 부하, 빨간색 선은 LLM 응답의 요인 부하를 나타냄.
그림 1: 화학 시험 문항별 인간(Hk) 및 LLM(Lk) 요인 부하 구조. 요인 수는 4개로 고정됨.

그림 1은 화학 시험의 요인 부하 구조를 보여줌. 예를 들어, LLM의 Lk3 요인은 Q5, Q16, Q19 문항에 0.5 이상의 높은 부하를 가지지만, 인간의 경우 이 문항들은 Hk1과 Hk2라는 두 개의 다른 요인에 분산되어 부하됨. 이는 LLM이 특정 문항 세트를 단일한 방식으로 묶어서 처리하는 경향이 있음을 시사함.

인간과 LLM의 수리 추론 시험 요인 부하 구조 비교. 파란색 선은 인간 응답의 요인 부하, 빨간색 선은 LLM 응답의 요인 부하를 나타냄.
그림 2: 수리 추론 시험 문항별 인간(Hk) 및 LLM(Lk) 요인 부하 구조. 요인 수는 5개로 고정됨.

그림 2의 수리 추론 시험에서도 유사한 패턴이 관찰됨. LLM의 Lk1 요인은 Q1, Q2, Q4 문항에 강한 부하를 보이지만, 인간에게 이 문항들은 Hk1과 Hk2 요인에 걸쳐 있음. 이는 LLM이 인간과 다른 방식으로 문항 간의 관계를 인식하고 처리함을 명확히 보여줌.

(3) LLM-인간 잠재 구조 유사성의 양적 부족

반복 재표본 추출을 통한 평균 요인 일치도 비교 결과, LLM-인간 그룹 간의 유사성은 인간-인간 그룹 간의 유사성보다 지속적으로 낮게 나타남. 이는 LLM이 인간과 동일한 방식으로 평가 도구에 반응한다고 보기 어려움.

인간-인간(파란색) 및 LLM-인간(빨간색) 그룹 간 평균 요인 일치도 분포 비교 그래프. 화학 시험(K=4)과 수리 추론 시험(K=5) 두 가지 평가 도구에 대한 결과를 보여줌.
그림 3: 인간-인간(Human-Human) 및 LLM-인간(LLM-Human) 요인 일치도 분포.

그림 3은 화학 및 수리 추론 시험 모두에서 LLM-인간 유사도 분포(빨간색)가 인간-인간 유사도 분포(파란색)보다 낮은 값으로 치우쳐 있음을 시각적으로 보여줌. 모든 요인 해결책에서 LLM-인간 유사도는 인간-인간 유사도보다 통계적으로 유의미하게 낮음(p < .001). 예를 들어, 수리 추론에서 인간-인간 평균 유사도는 0.535인 반면, LLM-인간은 0.449에 그침. 화학 시험에서도 각각 0.595와 0.513으로 차이를 보임. 이 간극은 LLM의 점수가 인간과 같은 의미를 갖지 못함을 강력히 주장함.

4. 결론 및 시사점

(1) 이 연구가 입증하거나 주장한 핵심 결론: 인간용 평가 도구가 LLM에게는 인간과 다른 잠재 구조, 즉 다른 능력이나 인지 과정을 측정함. LLM이 벤치마크에서 높은 점수를 얻더라도, 이는 모델이 특정 평가 형식에서 정답을 산출할 수 있음을 의미할 뿐, 인간이 가진 동일한 기저 역량을 측정함을 입증하지 못함.

(2) 교육 현장 또는 AI 설계에 주는 시사점 1: LLM 벤치마크를 설계할 때, 점수 비교만으로는 부족하며 ‘무엇을 측정하려 하는가’라는 타당성 관점을 명확히 해야 함. 벤치마크는 문제 난이도뿐 아니라 측정하려는 구성 개념(construct)이 무엇인지, 그리고 모델 아키텍처 변화에도 그 개념이 일관되게 해석 가능한지를 다루어야 함. LLM의 학습 데이터 오염 여부, 미세한 작업 변화에도 취약한 추론 능력 등도 평가 설계에 포함해야 함.

(3) 시사점 2: LLM을 교육적 목적으로 활용할 때 신중함이 필요함. 만약 학생과 LLM이 동일한 과제에서 같은 잠재 구조를 공유하지 않는다면, LLM은 신뢰할 수 있는 튜터 역할을 수행하기 어려움. 또한 학생 행동을 시뮬레이션하거나 평가 도구를 개발하는 데에도 부적합할 수 있음. LLM의 능력에 대한 잘못된 해석은 교육 현장에서의 비효율성과 오용을 초래할 수 있음.

5. 리뷰어의 ADD(+) One: 생각 더하기

(1) 이 논문에서 가장 주목할 지점: 이 연구는 LLM 평가의 근간을 뒤흔드는 ‘타당성(validity)’이라는 핵심 질문을 정면으로 다룸. 그동안 LLM 성능을 인간의 표준화된 시험 점수로 비교하는 관행이 만연했지만, 이 연구는 ‘점수가 높다/낮다’는 표면적인 비교에 머물지 않고, ‘그 점수가 무엇을 의미하는가?’라는 본질적인 질문을 던짐. LLM이 인간과 다르게 문제를 해결하고 사고한다는 경험적 증거는, LLM의 ‘인간 지능 모방’ 주장에 대한 결정적인 반론을 제시함. 이는 LLM이 단순히 인간처럼 정답을 도출하는 기계일 뿐, 인간과 같은 방식으로 지능을 구성하지 않을 가능성을 강력히 시사함.

(2) 논문이 명시하지 않은 더 넓은 의미: 이 연구는 교육 측정학(psychometrics) 분야의 중요성을 AI 평가 영역으로 성공적으로 확장함. LLM의 ‘블랙박스’ 인지 과정을 간접적으로 탐색하는 인지과학적 통찰을 제공함. LLM의 응답 패턴이 인간과 다르다는 것은, LLM이 정보를 처리하고 지식을 조직하는 방식이 인간의 그것과 근본적으로 다름을 의미함. 이는 AI 시스템의 윤리적 사용과 책임성 있는 배포를 위한 정책적 논의에 중요한 함의를 지님. 교육 현장에서 AI 도구를 도입할 때, 기술적 성능 지표뿐 아니라 측정학적 타당성 확보가 선행되어야 함.

(3) 이 연구를 발전시킬 구체적 아이디어:

  • 다중 방법론 통합 분석: 탐색적 요인 분석(EFA) 외에, 확인적 요인 분석(CFA)으로 잠재 구조 모델을 구체화하고, 항목 반응 이론(IRT) 기반의 차등 문항 기능(DIF) 분석을 통합함. DIF 분석은 특정 문항이 LLM과 인간에게 왜 다르게 작동하는지 심층적인 원인을 밝히는 데 기여함. 이는 ‘어떤 문항이 LLM에 더 취약하거나 강한가’에 대한 구체적 이해를 가능하게 함.
  • 맥락 및 모달리티별 심층 탐구: 텍스트, 이미지, 수식 등 문항의 모달리티나 문제 해결에 필요한 인지적 복잡성(예: 다단계 추론, 비판적 사고, 창의성) 수준에 따라 LLM-인간 간 잠재 구조 차이가 어떻게 변화하는지 심층 분석함. 이는 멀티모달 LLM 및 추론 능력 강화 LLM 개발 방향에 대한 실질적이고 미시적인 지침을 제공함.
  • 교육적 활용 시나리오 역설계: LLM의 응답 패턴 특성을 역으로 활용하여, 인간 학습자의 흔한 오류 패턴을 파악하고 맞춤형 피드백을 생성하는 시스템을 설계함. LLM이 인간과 ‘다른’ 방식으로 문제를 푸는 과정 자체를 학습 데이터로 활용하여, 인간 학습자가 인지적으로 막히는 지점을 예측하고 지원하는 교육적 개입 도구 개발에 기여할 수 있음.

6. 추가 탐구 질문

(1) 특정 인지 능력(예: 비판적 사고, 창의적 문제 해결)을 측정하는 복합적 문항에서 LLM과 인간의 잠재 구조 차이는 어떻게 더 심화되거나 유사해지는가?

(2) 인간 전문가가 LLM의 응답을 평가할 때, 그 평가 기준 자체가 인간 중심적 사고에서 벗어나 LLM의 고유한 작동 방식을 이해하고 반영할 수 있는가?

(3) LLM의 잠재 구조가 인간과 다르다는 점을 인정하고, 이 차이를 활용한 ‘AI 고유의 역량’을 측정하는 새로운 평가 도구 설계는 어떤 윤리적, 교육적 난관에 부딪히는가?

출처

  • Strugatski, A., Zeinfeld, L., & Alexandron, G. (2024). Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis. arXiv preprint.
공유