Brood War Bench
Brood War Bench — 에이전트는 스타크래프트를 어디까지 플레이할 수 있나
Brood War를 에이전트만으로 플레이하게 만든 환경에서 19개 모델·추론 설정을 라운드 로빈 방식으로 대결시켰습니다. Codex Astra가 18승 무패로 1위를 차지했지만, 모든 모델은 여전히 초보자 수준을 넘지 못했습니다.
- 주제
AI 요약
Brood War Bench는 에이전트가 사람의 직접 조작 없이 StarCraft: Brood War를 플레이할 수 있도록 만든 환경과 그 대결 결과를 공개한 벤치마크입니다. 제작자는 친구들과 함께 에이전트 기반 Brood War를 시험하던 중, 실제로 게임을 거의 해보지 않은 친구들도 에이전트에게 공격을 지시하면 소규모 병력을 만들고 공격 전체를 수행하게 할 수 있다는 점을 관찰했습니다. 이 에이전트들이 사람의 도움 없이 어디까지 나아갈 수 있는지 확인하기 위해 이번 실험을 구성했습니다.
■ 결과: Codex Astra가 선두를 차지했습니다
총 19개 모델·추론 설정을 비교한 결과, Codex Astra / xhigh가 18승 0패, 승률 100.0%로 1위를 기록했습니다. 평균 행동 빈도(APM)는 12.6이었고 게임당 비용은 10.54달러였습니다. Codex Astra / medium은 16승 2패, 승률 88.9%, APM 17.2, 게임당 비용 15.11달러로 2위였습니다. 3위는 Claude Fable로 15승 3패, 승률 83.3%, APM 12.6, 게임당 비용 12.24달러를 기록했습니다. Codex Astra / low도 14승 4패로 승률 77.8%를 기록했습니다.
그 뒤를 Codex 5.6 Sol / medium이 13승 5패, 승률 72.2%로 이었고, Codex 5.6 Sol / low와 Claude Opus 5는 각각 12승 6패, 승률 66.7%였습니다. Codex 5.6 Sol / xhigh는 11승 7패, 승률 61.1%를 기록했습니다. Codex 5.6 Luna / low와 Codex 5.6 Terra / xhigh는 각각 9승 9패로 승률 50.0%를 기록했습니다. Claude Sonnet은 7승 11패, 승률 38.9%였고, Claude Haiku는 16경기에서 한 번도 이기지 못했습니다. Grok 4.6은 xhigh가 2승 15패, medium이 1승 16패, low가 0승 16패로 모두 하위권에 머물렀습니다.
비용과 추론 강도가 승률에 단순하게 비례하지도 않았습니다. 예를 들어 Codex 5.6 Luna / xhigh는 승률 38.9%였지만 게임당 비용은 0.16달러였고, Luna / low는 50.0%의 승률과 0.42달러의 비용을 기록했습니다. 반면 Codex Astra / medium은 Astra / xhigh보다 낮은 승률을 기록하면서도 게임당 비용은 15.11달러로 더 높았습니다. 원문은 일부 낮은 effort 설정이 더 나은 결과를 낸 이유로, 모델이 생각하는 동안 게임이 진행되어 병력이 파괴되는 상황을 들었습니다. 다만 전반적으로 최신 모델일수록 사고에 드는 시간과 비용을 더 의식하는 모습을 보였다고 설명합니다.
■ Codex는 거시 운영보다 초반 기습에 강했습니다
Codex 계열에서 가장 반복적으로 나타난 강점은 경제를 키우고 지속적으로 병력을 생산하는 운영보다 상대를 방해하는 전략이었습니다. Protoss로 플레이할 때 Probe 하나를 맵 반대편으로 보내 일꾼이나 건물을 공격하는 경우가 많았고, 상대 에이전트가 Probe 하나에 대응할 방법을 수십 초 동안 생각하느라 다른 행동을 하지 못하는 장면이 자주 나타났습니다.
하지만 같은 시스템은 지속적인 생산과 기술 발전에는 훨씬 약했습니다. 기술 업그레이드를 늦추고, 방어된 기지로 기본 유닛 한두 기를 조금씩 보내며, 일꾼을 사실상 마지막 저항에 투입하는 식의 플레이를 보였습니다. 또한 Codex는 경제, 병력 생산, 병력 조작을 각각 담당하는 별도 subagent를 만드는 경우가 많았지만, 이 subagent들이 서로 충분히 소통하지 않았습니다. 그 결과 병력 담당 subagent가 다른 subagent가 더 큰 병력을 준비하고 있다는 사실을 모른 채 새로 생산된 유닛을 하나씩 공격에 보내기도 했습니다.
제작자는 이것이 한 번에 충분한 병력을 모아 계획된 공격 타이밍을 만드는 대신 유닛을 한 기씩 보내는 전형적인 초보자 실수라고 설명합니다. Codex의 플레이에 사람이 방향을 제시했을 때는 공격 시점을 더 잘 계획했고 subagent 간 협업도 개선됐습니다. 또 G009에서는 Codex 5.6 Terra / medium이 병력과 본진을 모두 잃은 뒤 마지막 Command Center를 띄워 맵 반대편 구석으로 이동했고, 이후 6분 동안 더 생존했습니다. 이 장면은 전략적 완성도와 별개로, 불리한 상황에서도 게임을 계속하려는 지속성을 보여준 사례로 소개됩니다.
■ Grok은 관찰과 행동의 반복 고리를 만들지 못했습니다
Grok 4.6은 긴 추론 구간에 비해 실제 명령 묶음(command batch)을 거의 내리지 않는 문제가 두드러졌습니다. G043의 Grok 4.6 / xhigh 실행은 43분 동안 추론 토큰 11,138개를 기록했지만 명령 묶음은 단 6번만 발행했고, 전투 유닛을 한 기도 배치하지 못했습니다. 실행한 행동도 지속적인 관찰과 행동의 control loop로 이어지지 않았습니다.
G003에서는 Grok / xhigh가 Marine 세 기를 만들었지만 적 기지에 도달하지 못했고, G002에서는 Grok / medium이 Zealot 두 기를 만들었지만 역시 맵을 가로질러 공격하지 못했습니다. 제작자는 이를 단순히 나쁜 전략이라기보다, 게임 상태를 계속 확인하고 그에 맞춰 행동하는 과정 자체가 끊긴 사례로 봅니다.
■ Claude Fable은 가장 성실하게 게임을 진행했습니다
Claude Fable은 첫 유닛을 만든 뒤 멈추기보다 경제를 확장하고 기술 트리를 올라가려는 경향을 보였습니다. G007에서는 Lair, Spire, Mutalisk까지 도달한 뒤 승리했고, G027에서는 Robotics Facility, Citadel of Adun, Observatory, Templar Archives를 추가한 뒤 승리했습니다. 다만 높은 수준의 기술 발전이 항상 실행력으로 이어진 것은 아닙니다. G036에서는 Factory와 Academy까지 건설했지만 Claude Opus 5의 공격에 밀려 패배했습니다.
■ 아직 모든 모델이 초보자 수준입니다
이번 결과에서 가장 중요한 제한은 선두 모델조차 복잡한 병력을 구성하거나 단순한 공격을 방어하거나 구체적인 전략을 안정적으로 실행하지 못했다는 점입니다. 원문은 초보자가 Photon Rush를 사용해도 이번 대결의 모든 에이전트를 이길 수 있을 것이라고 설명합니다. 즉 Codex Astra의 18승 무패는 다른 모델과 비교했을 때의 우위이지, Brood War를 높은 수준으로 플레이한다는 의미는 아닙니다.
실험은 각 모델과 effort 설정을 서로 모두 대결시키는 19×19 round-robin 매트릭스로 진행했습니다. 대결은 Freestyle VM 여러 대에서 병렬로 실행했고, 각 경기마다 게임 엔진 데이터와 양쪽 에이전트의 harness log를 저장했습니다. 결과 표에서는 각 조합의 맞대결을 W, L, T로 표시하며, T는 벤치마크 시간 제한에 도달한 경기입니다. 이 구조 덕분에 단일 상대를 이겼는지만 보는 대신 각 시스템이 다른 18개 설정을 상대로 어떻게 성적을 냈는지 비교할 수 있습니다.
제작자는 이번 벤치마크가 아직 소진되지 않았다고 봅니다. 현재 에이전트들은 초보자 수준에 머물러 있지만, 플레이 과정을 지켜보는 것만으로도 앞으로 학습해야 할 요소와 벤치마크가 요구할 수 있는 과제가 많이 남아 있다는 점이 드러났다고 설명합니다.
■ Hacker News 반응
• @bee_rider — 게임에 관한 대화가 엄청나게 많이 학습 데이터에 들어 있을 것입니다. 플레이하는 방식만 보고도 사람들이 온라인에서 불평하거나 밈으로 만드는 전략을 선택하는 경향이 있는지 알아낼 방법이 있는지 궁금합니다.
• @stackghost — Brood War 리플레이 파일을 해석하는 라이브러리가 있는지 궁금합니다. 아마 에이전트가 리플레이를 보면서 학습하게 할 수도 있을 것입니다.
• @frutiger — SC:BW에 대해서는 확인하지 않았지만, Blizzard가 GitHub에서 SC2용 공식 parser와 replayer를 제공하고 있습니다.
• @benswerd — 만들기 어렵지 않습니다. 이렇게 빠르고 쉽게 구성할 수 있다는 점에 저도 놀랐습니다.
• @tekla — 높은 수준의 경기에서는 일반적으로 Zerg가 다른 종족보다 훨씬 강하다고 여겨집니다. 그래서 저는 AI가 Zerg를 선택하는 경향을 보일 것이라고 대체로 예상하겠습니다.
원문: bw.swerdlow.dev / 번역·요약: Trawling