Claude Fable 5.1 completed a frontier nine-loop particle-physics calculation experts had worked toward for years, with researchers mostly just telling it “keep going” while it built, debugged and ran the entire workflow
Claude Fable 5.1, 입자물리학 9루프 계산 수행 — 연구진은 대부분 “계속 진행해”라고 말했습니다
Claude Science의 Fable 5.1이 N=4 초대칭 Yang–Mills 이론의 9루프 산란 진폭을 계산했습니다. 연구진은 기존 부트스트랩 방법과 Python 코드를 사용했고, 독립 검증자는 결과를 확인했습니다. 새 물리 원리를 발견한 사례라기보다, 알려진 계산 절차를 AI가 끝까지 수행한 사례입니다.
- 주제
AI 요약
이론물리학자이자 과학 저술가인 Matt von Hippel은 AI가 학계 연구자가 쓸 만한 컴퓨팅 자원으로 입자물리학의 미해결 계산을 해낼 수 있는지 시험하고 싶었습니다. 그가 제시한 과제 가운데 Anthropic 연구진이 택한 문제는 planar N=4 초대칭 Yang–Mills 이론의 6입자 산란 진폭을 9루프까지 계산하는 일이었습니다.
산란 진폭은 입자들이 특정 방식으로 반응할 확률을 계산하는 공식입니다. 계산에 포함하는 루프 수가 늘수록 예측은 정밀해지지만 계산량도 커집니다. 실제 산란 진폭은 대개 2루프까지 계산되며, 일부는 3루프까지, 정밀도가 특히 높은 입자물리학 예측도 5루프까지 진행됐습니다. N=4 초대칭 Yang–Mills는 현실의 입자 이론은 아니지만, 계산 기법을 시험하는 장난감 모형으로 쓰입니다.
AI가 수행한 계산
Anthropic의 물리학자 Liam Fitzpatrick과 Siddharth Mishra-Sharma는 Claude Science에서 Fable 5.1을 사용했습니다. 처음에는 “planar N=4 SYM의 6입자 진폭을 9루프에서 계산하라”는 과제를 주고, 이후 몇 시간 간격으로 진행 상황을 보고하라고 요청하며 “계속 작업하라”고 지시했습니다. 외부 연구자가 세부 단계를 직접 안내하지 않은 채, 모델이 코드 작성과 디버깅, 실행을 이어갔습니다.
Claude는 두 가지 경로로 결과를 계산했습니다. 하나는 기존 부트스트랩 방법을 직접 적용한 경로이고, 다른 하나는 관련 대상인 form factor를 계산해 진폭을 얻는 간접 경로입니다. 부트스트랩은 가능한 답의 후보를 컴퓨터 파일에 기록한 뒤, 다른 계산법의 예측과 이론적 규칙 등 여러 조건을 적용해 후보를 걸러내는 방식입니다. 연구진은 Python과 SymPy를 사용했습니다. 부트스트랩 계산에는 96개 CPU를 일주일간 돌렸고, 컴퓨팅 비용은 약 100달러였습니다. Claude 사용료까지 포함하면 각 계산 경로의 비용은 약 1,000~2,000달러였습니다.
결과 검증과 연구진의 해석
SLAC 국립가속기연구소의 Lance Dixon은 결과를 독립적으로 검증했습니다. 그는 진폭에서 form factor를 구하는 방식으로 결과를 확인했고, 검증에는 약 2주가 걸렸습니다. Dixon의 연구팀은 2023년 form factor와 antipodal duality를 이용해 8루프 진폭을 계산하는 방법을 발표한 바 있습니다. Claude의 계산은 연구팀이 수년간 다듬은 방법을 직접 적용해 9루프 결과를 냈습니다. Dixon은 코드 구성과 계산 절차가 까다롭고 작은 오류에도 전체 계산이 실패하기 쉽다는 점을 강조했습니다.
비슷한 시기 중국과학원 Song He 연구팀도 9루프 진폭의 일부인 symbol을 계산했습니다. 이들은 GPT-6의 도움을 받아 제약 조건 일부를 계산했지만, 전체 계산 틀까지 AI에 맡기지는 않았습니다. 저자는 이번 결과가 계산 한계를 넘어선 새로운 방법을 보여주지는 않았다고 설명합니다. Claude는 알려진 방법을 사용했고, 인간 연구진이 시도한 것보다 더 많은 컴퓨팅 자원을 투입했습니다. 다만 연구진이 직접 개입하지 않고도 복잡한 계산 절차를 끝까지 수행했다는 점은 주목했습니다. 저자는 이를 통해 연구자가 예상한 것보다 더 많은 계산 진전이 남아 있을 수 있다고 봅니다. 이 결과만으로 초지능이나 AI의 미래 능력까지 판단하기는 어렵다고 선을 긋습니다.
Reddit 반응
- @u/michaelhoney — 이 글에 나온 사람들은 코딩을 꽤 진지하게 하는 연구자일 겁니다. 하지만 대부분의 학자는 겨우 필요한 만큼만 프로그래밍을 합니다. LLM을 쓰면 학술 코드의 품질과 재현성이 크게 좋아질 것 같습니다.
- @u/TwistedBrother — 통계에 능한 동료들이 수식을 R에 던져 넣으며 답이 말이 되는지 확인하는 걸 봤습니다. 하지만 Σxᵢ가 계산할 때 반드시 for문을 뜻하는 건 아닙니다. 자료 구조나 코드의 의도, 리팩터링도 신경 써야 하지만 그런 부분은 관심을 받지 못합니다.
- @u/taenyfan95 — 이론물리학 석사 학위가 있고, 논문 주제로 다중 루프 입자물리 산란 진폭 계산을 했습니다. 2023년에는 칠판에서 직접 계산했고, 실수하면 지우고 다시 시작해야 했습니다. 계산이 지적 작업이라기보다 육체노동처럼 느껴지기도 했습니다. 다중 루프 계산은 LLM이 들어가기 좋은 분야입니다. 기계는 사람보다 빠르게 계산하므로 물리학자가 반복 계산에서 벗어나 더 높은 수준의 문제에 집중하도록 도울 겁니다. 다만 어떤 문제가 가치 있고 실제로 풀 수 있는지 판단하는 일은 제 지도교수의 몫이었고, 아직 LLM이 대신하기 어렵다고 봅니다. 물리학에는 더 많은 AI 이론보다 실험 인프라와 검증 자금이 부족한 경우가 많습니다.
- @u/BearlyPosts — 기억하세요. 중요한 건 프롬프트 엔지니어링입니다. AI가 여러분을 대체하는 게 아니라, AI를 쓰는 사람이 여러분을 대체합니다.
- @u/AMBNNJ — “계속 진행해”가 꽤 잘 설계된 프롬프트 같네요.
- @u/sadacal — 언제 계속하라고 하고 언제 방향을 바꿔야 하는지 판단하는 데는 여전히 사람의 판단이 필요합니다. 어떤 목표를 추구할지, 애초에 가능한지, 시도할 가치가 있는지도 알아야 합니다.
- @u/CrowdGoesWildWoooo — 에이전트형 LLM이 내놓는 결과의 수준을 고려하면, 요약을 보고 엉뚱한 방향으로 가는 걸 알아채지 않는 한 작업을 따라가며 검토하기 어렵습니다.
- @u/AMBNNJ — 그래도 우리는 열렬히 응원하는 역할은 계속할 수 있겠네요.
- @u/ontologicalDilemma — AI 에이전트가 그 일까지 빼앗기기 전에 AI 응원단 지원서를 만들고 있습니다.
- @u/AlbatrossNew3633 — 실수하지 마세요.
- @u/slackermannn — 파일을 삭제하지 마세요.
원문: Anthropic / 번역·요약: Trawling