워킹페이퍼 · 동료심사 전

AI는 학생의 능력을 높이는가, 대신하는가?
채용 담당자의 학업 성적 해석

AI가 학생의 능력을 높인다고 보는가, 학생의 능력을 대신한다고 보는가에 따라 채용 담당자의 학업 성적 해석이 달라진다.

Early Evidence on Employer Responses to College Student Use of Generative AI (2026, EdWorkingPaper No. 26-1604)

연구 한눈에 보기

1,750명
완료 응답자
(미국 채용 의사결정 재직자)
3개 집단
대조군 · 약한 AI 프레이밍 ·
강한 AI 프레이밍 (무작위 배정)
3.8 vs 2.7
이력서 GPA (4.0 만점)
응답자당 1장씩 평가
92.2%
직장에서 어떤 형태로든
AI를 사용한다고 응답

조사 기간: 2026년 5월 21일 ~ 6월 8일 (Prolific). 이 연구는 AI가 실제 일자리를 얼마나 줄였는지가 아니라, 대학생의 AI 사용을 설명하는 정보가 채용 판단을 어떻게 바꾸는지를 살펴본다.

이론적 배경: 역량 형성 vs 역량 신호

대학의 역할에는 역량 형성과 역량에 대한 신호 제공이 함께 있다. 두 기능은 관련되어 있지만 동일하지 않다.

인적자본 관점

교육이 학생의 지식과 판단 능력을 높이는 것이 중요하다.

AI가 설명, 피드백, 연습을 지원하면 학습을 보완하는 도구가 된다.

신호 이론

성적이나 학위가 고용주에게 보이지 않는 능력과 노력을 전달하는 것이 중요하다.

AI가 과제 수행 자체를 대신하면 결과물과 학점이 학생 자신의 역량을 반영하는 정도가 낮아질 수 있다.

논문이 제기하는 문제

고용주는 이 두 사용(보완과 대체)을 구별하기 어렵다. 경력자는 직장 성과나 경력 기록을 제시할 수 있지만, 신규 졸업생은 학위와 GPA에 더 의존할 수 있어 신호의 불확실성이 중요하다.

이는 연구의 이론적 설명이며, 이 실험에서 경력자와 신입의 실제 고용을 비교한 것은 아니다. 또한 신호가 불확실해지면 인종·성별 차이가 커질 가능성도 검토했지만, 지원자 인종·성별에 따른 일관된 처치 효과 차이는 찾지 못했다.

연구 설계: 설문 실험

무작위 배정된 세 가지 조건 탭을 눌러 비교

대조군

이력서 평가 안내만 받았다.

단, 대조군도 사전에 AI 관련 질문을 받았다.

약한 AI 프레이밍

AI가 학습을 도울 수 있지만 부정한 사용도 있으며, 대학의 대응 방법이 명확하지 않다는 설명을 제시했다.

강한 AI 프레이밍

AI 에이전트가 학생의 과제와 시험 등 학업 활동을 대신할 수 있고, 대학이 이를 탐지하기 어렵다는 설명을 제시했다.

이 능력에 관한 서술은 실험 자극의 내용이지, 모든 대학 과제를 AI가 해결한다고 검증된 사실이 아니다.

해석 주의 두 문구는 보완 대 대체만이 아니라 언론·성적 인플레이션·탐지 문제 등 여러 요소에서 달라, 효과를 어느 한 문장이나 요소에 귀속할 수 없다.

표본

  • 미국 거주, 영리 부문 전일제 재직
  • 현 직장 근속 1년 이상
  • 채용 의사결정 책임 보유
  • Prolific 모집, 완료 응답자 1,750명

전국 고용주를 확률 추출한 대표 표본이 아니라, 플랫폼에서 자발적으로 참여한 재직자 집단이다.

가상 이력서

  • GPA 3.8/4.0 이력서와 2.7/4.0 이력서를 하나씩 평가 (순서 무작위)
  • 이름으로 백인·흑인, 남성·여성을 시사하도록 무작위 배정
  • 경력·기술·동아리·봉사 경험은 유사하게 구성
  • 학교와 전공은 가림 (응답자가 통상 채용하는 학교·전공을 가정)
측정과 분석 방법 자세히 보기

결과 변수: 면접 초청 의향(7점 척도), 최초 제시 연봉보다 얼마나 더 지급할 의향이 있는지(추가 인상 의향).

주요 모형: 응답자 고정효과, 프레이밍·GPA·인종·성별의 상호작용, 이력서 제시 순서를 사용하고 표준오차를 응답자 수준에서 군집화했다.

주의: 동일 응답자의 두 평가를 이용하므로 프레이밍의 주효과는 고정효과에 흡수된다. 따라서 GPA에 따른 상대 평가와 프레이밍별 차이를 특히 주의해서 읽어야 한다.

다중검정: 주요 검정에는 Romano-Wolf 다중검정 보정을 적용했지만, 세부 집단 분석의 검정력과 우연한 유의성 문제는 남는다.

성격: 실제 지원자의 AI 사용 이력을 공개한 실험도, 실제 공고에 이력서를 보낸 현장 감사 실험도 아니다.

결과 1. 학업 자격 신뢰에 대한 우려가 높아졌다

학업 자격 신뢰 우려: 조정 평균 (Table 3)

각 막대에 마우스를 올리거나 탭하면 설명이 표시됩니다.

대조군
4.126
약한 프레이밍
4.374
강한 프레이밍
4.570
막대를 선택하면 해당 집단의 비교 결과가 여기에 표시됩니다.
+0.248
약한 프레이밍 vs 대조군 유의
+0.444
강한 프레이밍 vs 대조군 유의
+0.196
강한 vs 약한 프레이밍 p=.025

막대 길이는 0을 기준으로 한 시각적 비교용이며, 이 우려 척도의 범위는 원고에 명시되어 있지 않다.

  • 이는 해당 정보가 응답자의 판단을 바꿀 수 있다는 증거이지, 모든 고용주가 이미 졸업장을 불신한다는 증거가 아니다.
  • 관측 수 불일치: 이 표의 관측 수는 1,754로, 본문의 완료 응답자 1,750명과 다르다. 표본 수가 모든 분석에서 같다고 보아서는 안 된다.

결과 2. 높은 GPA의 면접 평가 이점이 강한 프레이밍에서 작아졌다

예시: 백인 남성 이력서의 예측 면접 점수 (7점 척도)

5.22
높은 GPA 백인 남성 예측 점수
4.18
낮은 GPA 백인 남성 (고정효과 모형의 기준, 고정값)
1.04점
높은 GPA와의 격차

원고는 격차를 대조군 1.04점, 강한 프레이밍 0.62점으로 제시한다. 약한 프레이밍의 높은 GPA 점수(5.22)는 대조군과 같다.

  • 이 수치는 GPA 프리미엄 축소의 예이며, 실제 면접 확률이 40% 하락했다는 뜻이 아니다.
  • 본문은 주요 인종·성별 집단의 강한 프레이밍 면접 감소가 95% 수준에서 유의하지 않은 경우를 명시한다. 모든 지원자 집단의 면접 관심 감소가 통계적으로 유의한 것은 아니다.
  • 낮은 GPA 집단의 면접 의향에서는 처치 효과에 대한 증거가 더 약했다.

결과 3. 연봉 추가 인상 의향에서 차이가 더 뚜렷했다

높은 GPA 이력서: 최초 제시 연봉 위 추가 인상 의향(%)

대조군약한 프레이밍강한 프레이밍
  • 이 숫자는 최초 제시 연봉 위에 더 줄 의향이지, 전체 연봉 감소율이나 실제 협상 타결액이 아니다.
  • 약한 프레이밍과 대조군의 차이가 유의하지 않은 경우가 많으므로, AI 보조 사용을 설명하면 연봉이 오른다는 결론도 성립하지 않는다.

결과 4·5. 세부 집단과 우려를 줄이는 정보

결과 4. 인종·성별·산업별 세부 결과는 신중히

  • 높은 GPA 백인 여성에서 강한 프레이밍의 불이익이 작았던 패턴은 소매업 및 정보기술·소프트웨어 산업 응답자에 민감했다.
  • 그 산업을 제외하면 다른 높은 GPA 집단과 비슷한 음의 패턴이 나타났다.
  • AI 노출이 높은 산업이 반드시 가장 크게 반응한 것은 아니며, 중간 노출 산업에서 뚜렷한 패턴이 관찰됐다.

특정 집단이 AI 우려로부터 보호된다는 법칙으로 해석할 수 없다.

결과 5. 무엇이 우려를 줄이는가

  • 두 처치 집단 모두 대면 시험을 대조군보다 더 안심이 되는 정보로 평가했다.
  • 약한 프레이밍: 프로젝트·인턴십 등 다른 정보도 더 긍정적으로 평가하는 경향.
  • 강한 프레이밍: 이런 정보에 대한 낙관이 줄었다.
  • 온라인 마이크로 자격보다 대면 마이크로 자격이 더 안심이 된다는 응답도 관찰됐다.

이는 제시된 정보의 설득력에 대한 평가이며, 대면 시험의 학습 효과나 예측 타당도, 온라인 교육의 실제 품질을 측정한 결과가 아니다. 대면 시험 도입이 실제 채용이나 임금을 회복시키는지도 검증하지 않았다.

이렇게 읽으면 안 된다 카드를 눌러 확인

결론 및 교육적 함의

핵심 관점: 자격의 신뢰 문제

AI 시대의 신규 졸업생 문제는 생산성이나 일자리 수요만의 문제가 아니라, 졸업장과 학점이 개인 역량을 얼마나 믿을 만하게 보여 주는가라는 자격의 신뢰 문제이기도 하다. 학생이 높은 성적을 받더라도 고용주가 그 성적을 누구의 수행으로 이해하는지에 따라 평가가 달라질 수 있다.

아래 항목은 원고가 논문 결과에서 도출한 적용 제안 또는 가설이며, 그 효과는 이 연구에서 실험으로 검증되지 않았다.

대학 홍보와 학생 안내 교육적 가설
홍보 문구를 바꾸거나 AI 사용을 긍정적으로 포장하게 하는 것보다, 도구를 사용한 성과와 학생이 직접 할 수 있는 수행을 구분해 제시하는 방식이 중요하다는 가설이 나온다. 이 연구는 그런 제도를 시행한 실험이 아니므로 제도 효과는 별도의 검증 대상이다.
교육과정과 평가 설계 적용 제안
AI 활용 능력과 독립 수행 능력을 서로 대체할 지표가 아니라 함께 확인할 대상으로 설계할 수 있다. 예: 자료 분석 과제에서 AI가 제안한 코드를 사용한 결과물을 평가하되, 변수 선택 이유·오류 점검·결과 해석을 도구 없이 설명하게 한다. 글쓰기에서는 AI 보조 초안과 별개로 주장·근거의 연결을 구두로 방어하거나 새로운 반례에 대응하는 짧은 수행을 평가한다. 이 설계가 채용 평가를 높인다는 실험 결과는 없다.
대면 검증의 범위 적용 제안
제한시간 시험은 깊은 탐구나 협업 능력을 충분히 측정하지 못할 수 있고, 장애·언어·이동 조건에 따른 장벽도 고려해야 한다. 직무 관련성이 높은 짧은 실습, 구두 설명, 현장 과제, 적절한 편의 제공 등을 함께 검토할 수 있으나, 그 타당성과 형평성은 이 논문에서 검증되지 않았다. 온라인 프로그램을 일괄적으로 낮게 평가하거나 마이크로 자격을 무용하다고 결론 내리는 것도 근거를 넘어선다.
취업 지원과 포트폴리오 적용 제안
결과물, 학생의 기여, AI의 도움, 검증 과정, 독립 수행 사례를 구분해 설명하도록 훈련할 수 있다. 도구 사용 기록을 많이 붙이는 것만으로는 충분하지 않으며, 기록은 진짜 판단 능력을 보여 주는 증거와 연결되어야 한다. 지원자는 해당 기업의 실제 과제·공개 요구를 따라야 한다.
기업의 대응 규범적 함의
고성적 지원자를 일괄적으로 의심하기보다, 실제 직무와 관련된 수행 증거를 보완하고 허용 도구와 평가 기준을 일관되게 안내하는 방향이 바람직하다. 검증 기회가 자원 있는 학교와 학생에게만 제공되지 않도록 설계를 점검할 필요가 있다.
후속 연구 과제
실제 이력서와 직무 과제를 이용해 독립 수행 증거(AI 보조 결과물, 구두 방어, 검증된 실습 기록)의 효과를 검증하고, 실제 면접 요청·제안 연봉·채용 이후 성과를 추적할 필요가 있다. 프레이밍 요소 분리, 신념 변화의 지속성, 한국의 채용 관행 등 다른 환경에서의 재현도 확인해야 한다.

연구의 한계

비확률 표본전국 고용주의 확률 표본이 아니라 Prolific에서 자발적으로 참여한 민간 재직자 집단이다.
가상 이력서실제 면접 요청, 채용, 연봉 지급을 관찰한 결과가 아니라 가상 이력서에 대한 응답이다.
실제 채용이 아님현장 감사 실험이 아니며, 믿음에 관한 단기 실험과 노동시장의 장기 변화 사이에는 큰 경계가 있다.
학교·전공 가림응답자가 통상 채용하는 학교·전공을 가정했기 때문에 응답자마다 상상한 자격이 다를 수 있다.
복합적 처치 문구문구가 여러 요소에서 달라 효과를 한 요소에 귀속할 수 없고, 현실의 정보 노출은 더 다양하다. 대조군도 사전에 AI 관련 질문을 받았다.
주효과 식별 불가고정효과 모형에서는 프레이밍의 공통 주효과가 직접 식별되지 않아, 모든 지원자에게 동일하게 발생하는 평가 변화는 읽어낼 수 없다.
세부 집단 검정력Romano-Wolf 보정을 주요 검정에 적용했지만 세부 집단 분석의 검정력과 우연한 유의성 문제는 남는다.
관측 수 불일치Table 3 관측 수 1,754 vs 본문 완료 응답자 1,750명. 초록의 '명확한 감소' 요약보다 본문과 표의 비교 집단·유의성을 우선해야 한다.
워킹페이퍼2026년 10월 2일자로 작성된 워킹페이퍼이며, 동료심사 학술지 게재 논문이 아니다.