How I changed teaching after AI managed to do all my homework assignments
AI가 과제를 전부 해내자 수업 평가를 바꿨습니다
머신러닝 운영 수업에서 생성형 AI가 과제와 성찰문까지 작성하자, 교수자는 평가 방식을 대면 확인과 구술 대화 중심으로 바꿨습니다. 저부담 과제의 학습 효과를 일부 포기하는 대신 TA 채점 시간을 50~80% 줄이고, AI 에이전트가 한 번에 해결하기 어려운 대형 과제를 도입했습니다.
- 주제
AI 요약
미국 Carnegie Mellon University의 Machine Learning in Production 수업은 2021년 GPT-3가 읽기 퀴즈를 통과한 뒤에도 한동안 기존 평가를 유지했습니다. 그러나 2025년 Claude Code가 과제 설명만 받고 코드와 보고서, 성찰문까지 완성하자 평가 체계를 크게 바꿨습니다. 수업 목표인 엔지니어링 절충, 위험 예측과 완화, 팀워크는 유지하되 집에서 하는 과제로 이해도를 확인하지 않고 TA와의 대화, 시험, 영상 시연에 무게를 둡니다. 시험과 구술 평가를 제외한 수업 활동에서는 AI 사용을 허용하고 장려합니다.
저부담 평가를 지키면서 확인 방식 변경
저자는 잦은 퀴즈와 과제처럼 부담이 낮고 피드백이 빠른 평가가 드문 고부담 시험보다 학습에 유리하다는 교육 연구를 알고 있습니다. 하지만 AI가 집에서 하는 연습을 대신하면서 시험 비중을 높이는 쪽으로 밀리고 있다고 설명합니다. AI가 만든 답을 먼저 제출한 뒤 채점에서 지적한 부분만 고쳐 재제출하는 사례도 생겼습니다. 이에 재제출에는 10% 감점을 적용합니다. 그래도 저자는 반복적인 저부담 학습 기회를 완전히 없애기보다 남겨두는 편을 택합니다. 독일에서 경험한 기말시험 하나가 성적 100%를 결정하는 방식은 실패·중도 탈락률이 50~80%에 달했다고 덧붙입니다.
글로 쓰던 성찰문은 과제마다 TA와 진행하는 15분 대화로 바꿨습니다. 학생은 과제의 어려움이나 팀워크 개선 방법을 질문받고, TA의 후속 질문에도 답해야 합니다. 대화는 과제 점수의 20%를 차지하며 통과·실패로 채점합니다. 실패해도 점수 감점 없이 다시 시도합니다. TA가 엄격하게 평가해 첫 시도에서 실패하는 학생도 적지 않습니다. 이 수업은 학생 대 TA 비율이 20대 1이고 TA 한 명이 주당 약 10시간 일하기 때문에 격주로 학생당 15분씩 대화하는 운영이 가능하다고 설명합니다. 읽기 퀴즈는 점수를 없애고 읽을 논문 수도 절반으로 줄였습니다. 읽기에서 얻을 내용을 수업 토론에 끌어오지만, 다수 학생이 여전히 AI에 의존한다고 적습니다.
대면 확인, 영상 시연과 시험 비중 확대
Kafka, Grafana, Docker, Weights and Biases를 다루는 주간 실습은 작은 과제라 코딩 에이전트가 쉽게 자동화합니다. 그래서 학생은 실습 시간에 TA에게 완료 증거를 보여주고 질문에 답해야 합니다. 과제에서도 TA와 기술 해법을 설명하는 확인 시간을 두고, 팀 프로젝트 단계마다 30~60분 디브리핑을 진행합니다. 팀원 누구에게든 구현을 설명하도록 하는 ‘beyond-the-comfort-zone’ 보너스 점수도 줍니다. 웹 애플리케이션 기능을 실제 사용자 흐름에서 시연한 짧은 영상은 구현이 작동하는지 확인하는 데 효과적이었다고 합니다.
수업 중 활동과 시험으로 옮긴 점수도 늘었습니다. 시험 비중은 15%에서 25%로 올렸고, 향후 더 올릴 가능성도 언급합니다. 숙제와 팀 과제 점수 가운데 10~20%는 디브리핑이 차지합니다. 다만 전체 점수의 대부분은 여전히 집에서 하는 과제와 팀 활동에 걸려 있으며, 학생 대다수는 그 점수에서 만점에 가깝게 받습니다. 실제 성적 차이는 주로 시험에서 나타납니다.
LLM 채점으로 TA 업무를 줄이고 과제 규모를 키움
코드와 보고서를 대상으로 한 채점에는 기관 승인을 받은 LLM 기반 자동 채점기를 도입했습니다. 학생은 PDF 하나 대신 저장소의 여러 Markdown 파일로 해답을 제출합니다. 채점기는 평가 기준별로 ‘통과’ 또는 ‘검토 필요’를 판정하고 TA에게 의견을 남깁니다. TA는 통과 답안 일부를 표본 확인하고, 주로 검토가 필요한 답안을 살핍니다. 최종 감점 전에는 사람이 반드시 답안을 검토합니다. 명확한 통과·실패 기준을 쓰는 specifications grading 방식이 자동 채점에 잘 맞지만, 그만큼 AI 에이전트에도 숙제를 해결할 구체적인 지침을 준다는 한계가 있습니다. 이 방식으로 TA의 채점 시간은 50~80% 줄고, 학생을 직접 만나는 시간이 늘었습니다.
수업 토론에도 비슷한 방식을 적용합니다. 학생들은 짝 토론 뒤 답을 Slack 채널에 올립니다. 맞춤형 Slack 봇이 강의에서 다룬 기준으로 답을 평가하고, 학생이 수정한 답에 다시 피드백을 제공합니다. 학생은 나중에 웹이나 Slack에서 시험 준비용으로도 피드백을 이용합니다. 모델이 특정 문제에 지나치게 민감하게 반응하지 않도록 프롬프트를 조정하는 보정 작업도 필요합니다.
코딩 에이전트가 예전의 작은 과제를 쉽게 풀자 과제 범위도 키웠습니다. 기존에는 약 1만2천 줄 규모의 Instagram 복제 애플리케이션 Albumy에 AI 기능 두 가지를 추가하도록 했습니다. 올바른 해법 자체는 약 20줄 코드였고, 본래 어려움은 코드베이스와 라이브러리를 이해하고 의존성 문제를 해결하는 데 있었습니다. 2025년 가을 Claude Code는 과제 설명만으로 구현과 보고서, 성찰문까지 끝냈습니다. 이를 50만 줄이 넘는 실제 팀 채팅 애플리케이션 Zulip에 기능 두 가지를 구현하는 과제로 교체했습니다. 에이전트가 작업은 할 수 있지만, 올바르게 끝내려면 학생이 개입해야 합니다. 새 과제는 백엔드와 프런트엔드를 함께 수정하고 수백 줄 코드를 작성하는 규모입니다.
학습 성과는 확인하기 어렵고, 평가 방식은 계속 바뀜
저자는 학생이 실제로 더 많이 배우는지는 측정하지 못했다고 밝힙니다. 성적 분포도 학습량을 보여주는 근거로 삼기 어렵습니다. 직접 대화한 학생들은 대체로 유연성, 대면 상호작용, TA의 질문을 긍정적으로 받아들였지만, 깊이 의견을 나눈 학생 상당수가 예비 TA라 대표성이 부족하다고 덧붙입니다.
현재 방식도 오래 유지된다고 장담하지 않습니다. Zoom 대화에서 AI를 쓰는 사례가 있어 대면 확인만 운영할 가능성을 검토합니다. 에이전트를 막던 질문이 새 모델에서는 더는 통하지 않기도 합니다. 따라서 매 학기 과제와 평가 방법을 최신 도구에 맞춰 점검해야 합니다. 반면 AI를 이용하면 과제와 자동 채점기를 고치는 비용도 줄어듭니다. 2021년에는 GPT-3가 퀴즈에 답하는 모습을 보고도 변화를 미뤘지만, 2026년에는 더는 미룰 수 없다고 말합니다.
Hacker News 반응
- @otabdeveloper4 — 결과가 아니라 과정을 채점하세요. 정말 간단합니다. AI는 그럴듯하게 말할 수 있지만 직접 해내지는 못합니다. “왜 이게 최선의 해법인지 설명해 보세요”라고 물으면 열 번 중 열 번은 망할 겁니다.
- @N_Lens — 공유해 주셔서 감사합니다. 교사들이 LLM에 어떻게 적응하는지 흥미롭습니다. AI 사용을 금지하려는 시도는 소용없다는 데 동의합니다.
- @nfrankel — 시행착오를 거쳐 저는 이 방법이 맞다고 생각하게 됐습니다. 두 시간 수업 안에서 이론과 실습을 번갈아 진행합니다. 평가는 실제 프로젝트 과제나, 수업 자료와 인터넷을 모두 쓸 수 있는 현장 시험으로 합니다. 지식을 알고 있는지가 아니라 주어진 과제에 적용할 수 있는지를 평가합니다. 구술시험은 몇 분 만에 학생이 개념을 이해했는지 알 수 있어 놀랐습니다. 다만 규모를 키우기 어렵다는 문제가 있습니다.
- @leoedin — 인공지능이 좋은 교육을 더 많은 노동이 필요한 일로 만들 거라는 점이 아이러니합니다. 일대일 지도로 자연스러운 게으름을 넘어서게 도와줄 형편이 되는 학생은 배우겠지만, 다른 학생은 생각을 전부 외주화할 겁니다. 소프트웨어를 배우며 겪는 디버깅, 아키텍처 결정, 데이터 구조화는 시행착오로 익힙니다. 모델이 좋아질수록 결과물을 꼼꼼히 살피지 않는 일이 더 쉬워집니다.
- @Propelloni — 수백 명을 대상으로 구술시험을 시작하기 어려운 건 맞습니다. 그러면 대면 필기시험을 보게 하면 됩니다. 독일 대학은 수십 년 전에도 그렇게 했습니다.
- @universa1 — 구술시험은 생각보다 운영할 만합니다. 답을 실제로 채점해야 하는 객관식이 아닌 시험이라면, 채점에 쓰는 시간을 구술시험에 쓸 수도 있습니다. 학부 수준은 보통 15~20분이고, 준비가 잘된 학생은 더 빨리 끝납니다. 몇 분이면 불합격할지 알 수 있고, 통과하는 학생은 합격권 안에서 어느 정도인지 확인하면 됩니다.
- @jdw64 — 저는 오픈북 시험은 잘 봤지만 책을 볼 수 없는 시험은 잘 보지 못했습니다. ADHD 때문인지 암기를 잘 못해서인지 모르겠습니다. 인터넷을 쓸 수 있는 면접은 잘했지만, 인터넷을 못 쓰는 면접은 못했습니다. 사람마다 잘 맞는 평가 방식이 다른데, 이런 차이를 어떻게 평가하는지 궁금합니다.
- @a57721 — 수학을 가르치는데 LLM이 기존 방식을 흔들어 놓아 어떻게 해야 할지 모르겠습니다. 대학은 숙제를 선택 사항으로 둘 수 없다고 하지만 숙제의 의미는 사라졌습니다. 집에서 풀어 보라고 견본 문제를 줬더니 많은 학생이 문서를 LLM에 넣어 시험 안내서를 만들고, 그걸 출력해 시험에 가져와서는 LLM 답이 무슨 뜻인지 물었습니다. 기초 수학의 목표는 스스로 생각하고 기본 개념을 소화하는 일입니다. LLM이 완벽한 답을 내더라도 의존하는 건 의미가 없습니다.
- @Honali — 여기서 가장 흥미로운 점은 AI가 학습 목표를 대체한 게 아니라, 강사가 목표 달성 여부를 측정하던 증거를 대체했다는 것입니다.
- @vjk800 — 사람들이 LLM 때문에 ‘가르치는 일’이 어려워졌다고 말하는 게 재미있습니다. 가르치는 일은 오히려 나아졌고, 새로운 교육 도구인 LLM을 쓰게 됐습니다. 어려워진 건 평가입니다. 학생들이 전통적인 평가 방식에서 같은 도구를 써 부정행위를 할 수 있으니까요. 학생을 가르치는 일과 평가하는 일을 같은 뜻으로 여긴다면 가르치지 말아야 합니다.
- @mantas — 평가 문제만은 아닙니다. 학생들은 과제를 하면서 기술을 익혔습니다. LLM으로 과제를 넘기면 기껏해야 복사해 붙여넣는 법을 배웁니다. 20년 전 위키백과 발표 자료를 그대로 베껴 넣던 일과 같습니다.
- @pks016 — 마음에 들지 않습니다. 이제 TA의 인지 부담이 큽니다. 예전에는 수업 내용을 알면 됐지만, 이제 AI 결과물을 살펴야 하고 새 모델 동향도 계속 따라가야 합니다.
- @egl2020 — 손 놓고 걱정만 하는 글보다 훨씬 낫습니다. 잘했습니다.
원문: The Last Software Engineer / 번역·요약: Trawling