Hacker News

Frontier AI on Your Own Hardware

내 하드웨어에서 실행하는 프런티어 AI

CMU의 Tim Dettmers는 연구의 단위를 논문에서 서로 연결된 오픈소스 생태계로 바꿔야 한다고 주장합니다. 작은 연구실의 GPU와 로컬 모델만으로 대규모 모델 추론, 장시간 에이전트 실행, 자율 연구를 구현한 사례와 수치를 Open Source Week에서 공개하겠다고 설명합니다.

AI 요약

CMU 조교수 Tim Dettmers는 졸업 뒤 일자리를 걱정하는 학생 150명 가운데 약 80%가 손을 들었다는 일화로 글을 시작합니다. 프런티어 연구소로 떠나려는 박사과정 학생들도 대학 연구가 무의미하다고 여긴다고 말합니다. 저자는 두 반응이 연구의 미래를 가장 많은 GPU를 가진 조직이 결정한다고 가정한 결과라고 봅니다. 오히려 에이전트가 연구 비용을 낮추면 대학 연구실이 대형 연구소가 관심을 두지 않는 문제를 맡을 여지가 커진다고 주장합니다.

논문의 단위에서 생태계의 단위로

저자는 에이전트 때문에 개별 프로젝트를 구현하고 실험하는 시간이 1년에서 수주 또는 수일로 줄었다고 설명합니다. 프로젝트 하나를 쉽게 만들 수 있게 되면 논문을 하나씩 발표하고 독자가 서로 연결하는 방식은 좋은 연구 형식이 아니게 됩니다. 어려움은 사라진 것이 아니라 이동했습니다. 논문을 내는 일보다 여러 구성 요소가 서로를 더 유용하게 만드는 일관된 생태계를 만드는 일이 어려워졌다는 주장입니다.

Open Source Week는 이 관점을 코드로 보여주기 위한 행사입니다. 저자와 학생들은 추론 서버 프레임워크, 에이전트 하네스, 자율 연구 시스템, 도메인별 강화학습 환경을 함께 만들고 있습니다. 목표는 모델을 로컬에서 더 싸게 실행하고, 로컬 모델의 성능을 높이며, 프런티어 연구소의 심층 연구와 자율 연구에 가까운 시스템을 개인 하드웨어에서 실행하는 것입니다. 오픈소스는 숙련된 연구자만 실행할 수 있으면 안 되므로, 하드웨어뿐 아니라 사용자가 알아야 할 전문 지식도 줄여야 한다고 설명합니다.

에이전트 하네스와 로컬 추론

저자가 가장 먼저 소개하는 구성 요소는 장시간 실행을 지원하는 에이전트 하네스입니다. 사용자는 CUDA 커널이 포함된 추론 프레임워크 같은 저장소를 지정하고 최적화 작업을 한 줄의 명령으로 맡깁니다. 에이전트는 진행 중 피드백을 받지 않아도 불확실한 부분을 스스로 처리하며 수시간, 수일, 수주 동안 작업을 이어갑니다.

저자 연구실은 이 방식으로 Mac과 Metal용 추론 구현을 개선했습니다. 그 결과 Qwen 3.6 35B-A3B 모델을 1.5 bits per weight로 양자화해 초당 450토큰으로 실행했다고 말합니다. 16비트 가중치를 사용하는 half-precision 모델과 비교하면 메모리 사용량이 약 10분의 1이며, 원격 서비스가 아니라 로컬 프로세스처럼 느낄 정도의 속도라고 설명합니다.

추가로 자체 프레임워크에서는 Qwen 3.8 27B의 상위 모델인 Qwen 3.8 Flash Next 125B를 24GB 단일 GPU에서 실행한다고 주장합니다. AMD Strix, NVIDIA DGX Spark, 128GB 메모리의 MacBook에서는 DeepSeek V4.1 550B도 실행할 수 있다고 합니다. 컨텍스트 압축과 길이 관리를 자동화해 긴 컨텍스트에서도 추론 속도를 유지한다는 설명입니다.

로컬 자율 연구 시스템

저자와 학생들은 추론 구성 요소와 에이전트 하네스를 결합해 인터넷 연결 없이 작동하는 자율 연구 시스템도 만들었습니다. 저자는 새로운 정보 검색 기법이 프런티어 연구소의 심층 연구 시스템, Sakana AI의 시스템, Google ScientistOne보다 높은 결과를 냈다고 주장합니다. 구체적인 비교 수치 대신 시스템이 실제 연구실에서 사용된 사례를 제시합니다.

저자가 진행한 실험에서 에이전트는 생물정보학 분야에서 연구할 만한 문제를 찾았습니다. 진행이 빠르고 기존 연구실 하드웨어에서 저렴하게 평가할 수 있어야 하며, 최근 4주 안에 연구가 발표된 미해결 문제여야 한다는 조건을 줬습니다. 에이전트는 세 가지 문제를 제안했고, 연구실은 첫 번째 문제를 선택했습니다. 약 두 시간 뒤 에이전트는 휴리스틱 방법의 새로운 하한을 세우고, 문헌상 가장 좋은 휴리스틱 방법을 구현하고 평가했으며, AI 모델로 학습한 고비용 방법에 가까운 결과를 냈다고 합니다. 동시에 해당 분야의 평가에 널리 쓰이는 데이터 소스의 문제도 발견했습니다. 전체 문제에서 최신 성능에는 도달하지 못했지만, 한 대의 연구실 장비에서 두 시간 동안 네 가지 결과를 얻었고 그중 하나가 분야 전체의 평가 데이터를 의심하게 만들었다는 사례입니다.

이 시스템은 블로그용 시연물이 아니라 학생들이 매일 쓰는 도구라고 설명합니다. 과거에는 Slack 봇으로 제공했으며, 회의 녹음에서 연구 질문을 만들고 문헌과 비교해 유망한 아이디어와 그렇지 않은 아이디어를 분류한 뒤 Google Docs로 정리했습니다. 수작업으로 두 단계를 복사해 연결해야 해서 사용을 중단했지만, 학생들이 다시 사용하고 싶다고 요청했다는 일화를 덧붙입니다.

CliffCompaction과 테스트 시점 확장

장시간 에이전트 세션을 유지하는 또 다른 구성 요소는 자동 컨텍스트 압축 기법인 CliffCompaction입니다. 저자는 연구실에서 수개월 사용했으며, 일부 세션은 수백만 토큰을 처리했고 1억 토큰을 넘긴 세션도 있었다고 말합니다. Claude Code와 Codex의 자동 압축보다 강력하며 전체 비용을 약 50% 줄였다는 주장입니다. 한 파트너 기업의 배포 사례에서는 전체 AI 예산이 45% 감소했다고 설명합니다.

KernelBench에서는 AlphaEvolve 방식이나 계층형 메모리 시스템처럼 더 복잡한 방법을 큰 차이로 앞서며 최고 수준의 결과를 냈다고 합니다. 강한 버전을 공개할 예정이고 다음 자동 압축 기법도 일부 구현했으며 더 나은 결과를 얻었다고 덧붙입니다. 컨텍스트를 덜 잊는 동시에 에이전트 운영 비용도 줄이는 방식이라는 설명입니다.

비용 절감분은 테스트 시점 확장에도 재투자할 수 있습니다. 한 번의 실행 대신 같은 예산으로 여러 실행을 병렬 수행하고, 그 결과를 결합해 성능을 높이는 방법을 찾았다고 합니다. 아직 일반적인 소프트웨어 개발에 실용적인 수준은 아니지만, 로컬 배포 환경에서 여러 에이전트를 하나의 문제에 병렬로 투입하는 방향이 가능하다고 주장합니다.

연구와 교육에 대한 주장

저자는 소프트웨어 엔지니어 수요가 사라지지 않고 오히려 증가했다고 주장합니다. 에이전트를 잘 다루는 엔지니어가 제품을 만들고 기존 시스템을 유지하며 확장하는 효율이 높아 기업이 한 명에게서 더 많은 가치를 얻는다는 논리입니다. 대신 소프트웨어 엔지니어라는 직무가 그대로 남는 것이 아니라 에이전트 활용 능력과 더 깊은 전문성이 결합된 형태로 바뀐다고 말합니다.

학생에게는 먼저 기초 지식과 기술을 모두 습득한 뒤 문제를 푸는 순서를 버리고, 문제를 먼저 붙잡은 뒤 필요한 지식과 직관을 익히는 도제식 학습을 제안합니다. 박사과정 학생은 하나의 프로젝트만 끝내기보다 여러 프로젝트를 병렬로 진행하고, 생태계를 작업 단위로 삼아야 한다고 설명합니다. 저자는 CMU에서 에이전트 연구 방법을 다루는 4주 단기 강좌와 다음 학기 정규 강좌를 준비하고 있으며, 전체 내용을 YouTube에 공개할 계획이라고 말합니다.

대학 연구실의 역할

대형 연구소가 수천 개의 GPU가 필요한 규모 경쟁에 집중하는 동안, 대학 연구실은 적은 자원으로 공격할 수 있지만 해결 가치는 큰 문제를 찾을 수 있다는 것이 글의 결론입니다. 저자 연구실은 소수의 GPU만 가진 작은 연구실이지만, Open Source Week에서 오픈소스 프로젝트 두 개와 논문 네 편을 하나의 패키지로 공개한다고 설명합니다. 여섯 개 릴리스가 서로를 더 유용하게 만드는 생태계를 구성하는 것이 목표입니다.

본문의 성능과 비용 수치는 저자가 자신의 시스템과 파트너 배포 사례를 설명하며 제시한 주장입니다. Hacker News에서는 해당 결과의 검증 방법과 논문 공개를 기다려야 한다는 반응이 많았고, 에이전트 활용에 따른 고용 변화와 교육 순서에 대해서도 의견이 갈렸습니다.

Hacker News 반응

  • @SwellJoe — 증거가 없다면 이 글은 AI 망상처럼 읽힙니다.
    • @twoWhlsGud — 큰 주장에는 근거가 필요하지만, 그는 CMU 조교수라서 일반적인 AI 망상 사례와는 다릅니다. 설명한 Open Source Week 결과물도 곧 나올 것으로 보입니다. 무엇이 나오는지 흥미롭게 지켜볼 만합니다.
    • @ryankrage77 — 망상이라는 표현은 강할 수 있지만, 적어도 LLM이 썼거나 강하게 편집한 글처럼 보입니다. Claude의 문체라고 추측합니다.
    • @SwellJoe — 사람이 쓴 글입니다. 오타가 많습니다. 다만 근거 없이 혁명적인 발견을 장황하게 주장하는 점은 의문을 낳습니다. 사실일 수도 있고 그렇다면 큰 일입니다. 하지만 아직은 그렇습니다.
  • @emulbasaka — 현재 ML 시스템 연구실의 대학원생으로서 글이 묘사한 분위기는 분명히 사실입니다. 하지만 원인이 대학의 GPU 부족이라고 보기는 어렵습니다. 중요한 혁신이 지금은 산업계에서 더 많이 나오기 때문입니다. LLM 추론 서빙을 연구하려면 프런티어 연구소나 하이퍼스케일러가 문제를 풀 동기가 가장 큽니다. TPOT를 1% 개선해도 막대한 비용을 줄일 수 있기 때문입니다. 산업계에 있으면 내부자들과 대화하며 빠르게 성장하는 분야를 따라가기도 쉽습니다.
    • @genxy — 누구든 쉽게 구할 수 있는 자원으로 추론 서빙 스택을 연구할 수 있습니다.
    • @bobmarleybiceps — 전기공학과 칩 설계에서는 실제로 산업에 유용한 연구를 하려면 칩 제작 비용이 너무 큽니다. LLM 개선 연구도 비슷한 방향으로 갈 것 같습니다. 저는 LLM이나 컴퓨터 비전과 무관한 ML 분야의 논문을 거의 읽지 않게 됐습니다. NeurIPS 논문도 실제로 쓸 만한 결과가 드뭅니다. GPU 사용 시간에 충분한 자금을 주지 않으면서 AI 연구만 지원하는 기관도 답답합니다.
  • @JSavageOne — 소프트웨어 엔지니어 수요가 어느 때보다 높다는 주장은 믿기 어렵습니다. 2022년 이후 거의 모든 지표에서 소프트웨어 엔지니어 채용 시장은 악화됐고, 특히 신입과 중간 경력에서 그렇습니다. 최근 졸업생 가운데 컴퓨터공학과 컴퓨터과학 전공자의 실업률은 각각 2위와 4위입니다. 학생들이 미래를 조심스럽게 보는 것은 합리적입니다. 데이터를 제시하지 않고 이런 걱정을 가볍게 일축하는 태도가 불쾌합니다.
    • @smokel — 졸업생 수가 훨씬 더 빠르게 늘었다면 두 주장이 모두 맞을 수 있습니다. 시장이 나빠진 것이 아니라 졸업생 증가를 따라가지 못했을 수도 있습니다.
    • @sakopov — 시장 반등은 주로 시니어 직무에 나타나고 다른 직급, 특히 신입은 밀려나는 것으로 보입니다. 따라서 어느 때보다 수요가 높다는 주장은 의심스럽습니다. Indeed의 채용 공고 데이터도 좋은 측정 단위인지는 모르겠습니다.
    • @api — AI 이전에도 모든 분야에서 신입 직무가 줄어드는 경제로 가고 있었습니다. AI는 그 흐름을 가속합니다. 전문가가 아닌 사람에게 좋은 일자리가 거의 없는 미래를 상상할 수 있습니다. 그렇다면 다음 세대의 시니어 전문가는 어떻게 길러야 하는지가 문명 규모의 문제가 됩니다.
  • @jdw64 — AI가 미치는 가장 큰 영향 중 하나는 고소득 전문직도 자리를 잃을 수 있다는 사실을 사람들이 깨닫게 만드는 일입니다. 이미 잘 아는 분야에서는 LLM이 매우 높은 품질의 결과를 내지만, 모르는 분야에서는 결과가 나쁘고 그 나쁨을 판단하지 못할 수도 있습니다. AI가 일자리 수를 줄이겠지만 사람의 필요까지 없애지는 않을 것이라고 봅니다. 교육에서는 암기 가치가 낮아지고 도메인 모델링, 문제 정의, 도구 선택과 활용이 더 중요해질 수 있습니다.

AI가 생산성을 높여도 기업은 그만큼 인원을 줄일 수 있습니다. 소비자의 구매력이 소수에게 집중되면 제품 개발도 그들의 취향에 치우칠 수 있습니다. 대학이 저렴하게 검증할 수 있는 중요한 문제를 선택하면 된다는 주장도 쉽지 않습니다. 검증 자체가 AI에 의존하고 대학이 충분한 GPU를 살 수 없다면, 연구 문제의 선택은 대형 AI 기업에 계속 종속됩니다. 동시에 대학은 앞으로 더 중요해질 수 있습니다. 고용에서는 능력만큼 학위와 신뢰, 문화적 친숙함이 작동하며 대학 네트워크가 이를 제공합니다. 다만 글의 낙관론은 지나치게 강합니다.

  • @vedmakk — 먼저 기술과 기초 지식을 습득한 뒤 문제를 풀어야 한다는 생각을 버리라는 부분에 동의합니다.
    • @jimbooonooo — 2+2를 더하는 법을 배우기 전에 답이 4라는 것을 알아야 한다고 말하는 셈입니다. 그렇게 들리면 어떤가요?
    • @autoexec — 사람들이 스스로 생각하지 못하게 하고, 답을 얻기 위해 여러분에게 의존하게 만들며, 거짓말을 알아채지 못하게 하려면 답을 이해보다 앞세우는 방식이 아주 좋습니다.
    • @wombatpm — 덧셈이 무엇인지 알고 2+2가 4라는 데 합리적인 확신이 있어야 2+3을 시도할 수 있습니다.
    • @marcus_holmes — 하지만 실제로 우리는 그렇게 배웁니다. 아이는 덧셈을 배우기 전에 4가 무엇인지 압니다. 구슬 두 개와 구슬 두 개를 세어 네 개가 되는 것을 먼저 배운 뒤 + 기호를 배웁니다. 2와 4의 의미를 알아야 +의 의미도 배울 수 있습니다.
  • @fghorow — Cliff Compaction에 대해 아는 사람이 있나요? 지금 당장 필요합니다. 현재는 OSS 버전의 headroom을 쓰고 있습니다. 로컬 전용으로 설정하기가 정말 고통스러웠지만, 이제는 어느 정도 작동하는 것 같습니다. 그런데 Cliff Compaction은 무엇인가요?
    • @hedgehog — 여러분은 곧 이 궤적을 절벽으로 몰고 갈 예정입니다. 뒤에 있는 에이전트에게 경고할 시간이 한순간뿐이라면 뭐라고 외치겠습니까?
  • @wrs — 논문을 성취의 단위로 삼는 것을 버리고 다른 사람이 이어서 만들 수 있는 생태계를 더 높이 평가해야 한다는 주장에 공감합니다. 수십 년 전 CMU에 다닐 때도 결과물을 만드는 일을 성취의 기준으로 삼는 분위기가 좋았습니다. 지금 세대의 교수도 같은 생각을 표현한다니 기쁩니다.
  • @agosz — 글은 LLM이 쓴 티가 나는 문장으로 가득합니다. 그래도 뒤에 가치 있는 내용이 있을지 궁금해서 읽었습니다. 하지만 소프트웨어 엔지니어라는 직업이 사라지고 에이전트로 깊은 전문성을 빠르게 얻을 수 있다는 주장은 제 컴파일러 백엔드 팀의 경험과 정반대입니다. 신입이 도메인을 이해하고 전체 시스템과 다른 시스템의 연결, 실제 사용 사례를 파악하는 데는 여전히 긴 시간이 걸립니다. 에이전트가 속도를 높일 수는 있지만 지식과 맥락을 빠르게 습득하게 하지는 않습니다.
  • @blastingrock — 대학 교수가 AI가 생성한 글을 발표하는 모습은 보기 좋지 않습니다.

원문: Tim Dettmers / 번역·요약: Trawling