Reddit

I Used OpenAI Dots as an agent swarm to break a 47 year old math record, for free (with Lean verification of the proof)

OpenAI Dots 에이전트 군집으로 47년 된 수학 하한을 높이다 — Lean으로 증명 검증

작성자는 OpenAI Dots의 에이전트 7개를 약 3일간 운용해 덮개수 문제 C(24,14,4)의 하한을 19에서 20으로 높였다고 보고합니다. 여러 에이전트의 교차 검토와 Lean 기계 검증을 거쳤지만, 수학자의 동료 검토는 아직 진행 중입니다.

AI 요약

작성자는 OpenAI Dots에서 GPT-6 Astra 에이전트 7개를 운용해 조합론의 덮개수(covering number) 문제를 풀었다고 보고합니다. 에이전트 군집은 약 3일 동안 작업했고, 그 결과 C(24,14,4)의 기존 하한 19를 20으로 높였습니다. 같은 논증으로 C(25,15,5)의 하한도 32에서 34로 올렸다고 합니다. 다만 논문은 아직 동료 검토를 받지 않았으며, 작성자는 수학자들의 검토 결과를 기다리고 있습니다.

문제와 결과

C(24,14,4)는 24개 원소에서 뽑을 수 있는 모든 4원소 부분집합을, 크기 14인 블록 몇 개로 덮어야 하는지 묻는 문제입니다. 복권에 비유하면 24개 숫자 중 당첨 숫자 4개를 뽑을 때, 어느 조합이 나와도 한 장에 네 숫자가 모두 들어가는 14개 숫자짜리 표를 몇 장 준비해야 하는지 묻습니다. 작성자에 따르면 Schönheim과 Mills가 세운 기존 하한은 19였습니다. 에이전트들은 크기 14인 블록 19개로 모든 4원소 부분집합을 덮을 수 있다고 가정하면 모순이 생긴다는 증명을 찾았고, 따라서 필요한 블록 수는 적어도 20개라고 결론 내렸습니다.

작성자는 이 결과가 더 큰 사례의 하한에도 영향을 준다고 설명합니다. C(25,15,5)의 하한은 32에서 34로 올라갑니다. 결과가 유지된다면 C(26,16,6), C(27,17,7), C(28,18,8)의 하한도 각각 56, 89, 139로 바뀔 수 있다고 합니다. 다만 이 후속 수치는 증명이 수학자 검토를 통과하는 경우를 전제로 합니다.

에이전트 군집 운영

Dots 에이전트는 AMD Epyc CPU 코어 9개, 메모리 10GB, 저장 공간 32GB가 배정된 가상 머신(VM)에서 실행됐습니다. 작성자는 주 에이전트와 하위 에이전트 6개를 사용했고, 각 에이전트는 수학 연구, Lean 형식화, 구성 탐색과 계산 검색, 반대 검토, 전체 조정 같은 역할을 맡았습니다. 처음에는 역할을 고정했지만, 에이전트들이 다음 작업을 기다리며 놀게 되자 공유 작업 풀 방식으로 바꿨습니다. 에이전트가 후속 작업을 제안하면 주 에이전트가 범위와 의존성, 우선순위를 확인하고 다른 에이전트가 맡도록 했습니다.

작업 풀은 우선순위만 따라가는 엄격한 대기열이 아니었습니다. 에이전트마다 이전 작업의 맥락을 유지하는 KV 캐시가 있었기 때문에, 우선순위가 가장 높은 일이 아니더라도 앞서 하던 작업과 연관된 항목을 먼저 맡을 수 있었습니다. 반면 증명 작성, 독립 검토, 형식화, 계산 검증은 서로 다른 에이전트가 맡도록 했습니다. 작성자는 에이전트 한 개의 주장을 곧바로 증명으로 받아들이지 않았습니다. 다른 에이전트의 검토와 Lean 형식화가 뒤따라야 신뢰할 수 있는 결과로 취급했습니다.

검색과 검증

작성자는 처음에 수학적으로 더 우아한 증명을 찾으려 했지만, 일부 경우는 현대 컴퓨터로 1초 안에 전수 확인할 수 있다는 점을 깨달았습니다. 그래서 무차별 대입 검색을 맡는 역할을 추가했습니다. 에이전트들은 계수 경계를 이용해 점의 차수와 쌍별 발생 횟수의 탐색 범위를 줄였고, 작은 검색은 직접 실행하도록 했습니다. 작성자는 5분 미만으로 끝나는 검색은 별도 허가 없이 진행하게 했으며, 더 긴 검색에는 추가 축약이나 계획을 요구했습니다. 성공한 계산 결과는 Lean 커널로 다시 확인하도록 했습니다. 처음 예상한 약 20초짜리 검색은 실제로 약 0.6초 걸렸다고 덧붙입니다.

증명은 계수 계산, 랭크 논증, 경직된 설계(rigid design), 피터슨 그래프(Petersen graph)를 이용하며, 사람이 읽는 논증은 몇 쪽 분량이라고 합니다. 반면 Lean 형식화는 80개 파일, 약 8,800줄입니다. 형식화는 Palomar Registry의 기계 검사를 통과했으며, 작성자는 코드와 대화형 설명 웹사이트도 공개했습니다. 다만 기계 검증은 형식화한 명제와 증명의 일관성을 확인하는 절차이지, 수학자들의 검토를 대신하지 않습니다. 작성자는 아직 arXiv에 올리지 않았고, Covering Repository의 수학자들과 검토를 진행 중이라고 밝혔습니다.

작성자가 얻은 교훈

작성자는 에이전트가 반복 작업을 잘하지만, 언제 멈출지 판단하는 데는 서툴렀다고 말합니다. 컴퓨터로 바로 확인할 수 있는 사례를 두고 에이전트들이 오랫동안 우아한 논증을 찾기도 했습니다. 또 에이전트의 확신과 실제 정확성은 별개였으며, 작업 로그에는 잘못된 방향으로 간 사례도 많았습니다. 그래서 단일 에이전트의 답을 믿기보다 독립 검토, 계산 재현, Lean 검사까지 이어지는 검증 절차에 의존했다고 설명합니다. 작업 중 공유 작업 공간이 삭제됐을 때도 남은 파일과 에이전트 간 메시지를 바탕으로 자료를 재구성했다고 합니다.

원문은 결과를 확정된 수학적 기록 경신으로 단정하지 않습니다. Lean 증명은 기계 검사를 통과했지만, 작성자는 수학자 검토가 끝날 때까지 arXiv 공개를 미루고 있습니다.

Reddit 반응

  • @u/br_k_nt_eth — 멋집니다! 축하합니다. 설정은 얼마나 어려웠나요?
    • @u/jaxchang — 글 후반부에 흥미로운 에이전트 구성 이야기가 나옵니다. 대부분은 진행하면서 조금씩 조정했습니다. VM과 Git 저장소를 처음 설정하는 일은 일반적인 Codex 작업입니다.
    • @u/Spunge14 — 글에는 실제로 뭘 했는지가 그다지 자세히 설명되지 않은 것 같습니다.
    • @u/jaxchang — Git 저장소를 설정하고, 역할별로 일반적인 에이전트 오케스트레이션 명령을 내리면 됩니다. 아직 보지 않았다면 OpenAI 가이드부터 확인해 보세요. Dots에서는 이 전략을 권하지 않습니다. 토큰 효율은 높지만, 저는 토큰을 아끼려던 게 아니었습니다. 그래서 글에서 언급한 전략 변경이 필요했습니다.
    • @u/Spunge14 — 군집 설정과 프롬프트를 정식으로 오픈소스 공개하면 커뮤니티에 큰 도움이 될 것 같습니다. 물론 공개할 의무는 전혀 없습니다.
    • @u/jaxchang — 엉망이라서요. 프롬프트 하나로 되는 일이 아닙니다. 제가 즉흥적으로 진행하면서 에이전트에게 수정 지시를 하고 절차를 바꿨습니다. 그래서 사람들이 참고할 만한 훌륭한 사례처럼 내놓고 싶지 않습니다. 군집을 띄우는 일 자체는 아주 쉽습니다. Dots에 “내 드라이브의 압축 파일에 있는 프롬프트를 각각 따르는 GPT-6 Astra 하위 에이전트 6개를 실행해”라고 말하면 됩니다. 문제는 임시 변경을 여러 번 거치고 나면 에이전트들이 처음 프롬프트를 더는 따르지 않는다는 점입니다.
    • @u/OnlineParacosm — 대체로 어떤 조정이 필요했고, 증명 검증에는 토큰이 얼마나 들었나요?
    • @u/jaxchang — 설정 프로필을 보면 하루에 약 20억~30억 토큰을 쓴 것 같습니다. Dots는 토큰을 무제한으로 줍니다.
    • @u/Undeity — 이메일 확인이 필요해질 때까지는요.
    • @u/ginger_beer — 시스템을 영리하게 악용하는 일을 자랑하려고 쓴 글이군요. 부끄러워해야 할 일입니다. 이해하지도 못하는 수학 증명을 이야기하는 게 무슨 성과인가요? 글을 내리시길 권합니다.
  • @u/StateoftheeArt — Dots는 사용량이나 크레딧을 차감하지 않나요? 아직 안 써봤는데 정말 대단하네요.
    • @u/EquilibriumProtocol — 첫 달에만 사용량을 차감하지 않는 것 같습니다. 익숙해지면 크레딧을 쓰게 하겠죠.
    • @u/jaxchang — 아닙니다. Astra 에이전트 6개로 약 3일 작업했는데 Codex 사용량은 들지 않았습니다.
    • @u/LittleLordFuckleroy1 — 보조금이 지급되는 동안 즐기세요. 이 비용 구조는 말이 안 됩니다.
    • @u/jaxchang — 네. API 요금으로는 약 5만 달러입니다.
    • @u/Ok_Zookeepergame8714 — 어떤 Pro 구독 요금제를 쓰시나요?
    • @u/jaxchang — 100달러 요금제입니다.
    • @u/Ok_Zookeepergame8714 — 이 Dots 에이전트에 GitHub 저장소 링크를 주고 무료로 작업시켜도 되나요?
  • @u/LittleLordFuckleroy1 — Dots와 관련 있는 건 “GPT-6 Astra 에이전트에 무료로 무제한 접근할 수 있다”는 점뿐입니다.
  • @u/MrSnowden — 자원 제약이 있을 때 흥미로운 전략입니다.
  • @u/bugra_sa — Lean 검증 덕분에 단순한 검색 시연을 넘어섭니다. 에이전트가 수천 개의 후보 논증을 뿌릴 수 있지만, 증명 검사기가 하나를 받아들여야 결과로 인정됩니다. 검색은 자유롭게 하되, 엄격하고 작은 관문을 두는 방식은 유용합니다.
  • @u/Old-Leadership7255 — 왜 사람들이 이런 일을 계속하는지 모르겠습니다. 이런 식으로 쓰면 결국 전부 제한됩니다. 원래 의도와 다르게 쓰지 마세요.
    • @u/crone66 — 사용량 무료는 일시적이라고 이미 했잖아요. 그러니 혜택이 있는 동안 최대한 쓰면 됩니다.

원문: Reddit 게시물 및 연결된 Substack 글 / 번역·요약: Trawling