Hacker News

Gemini 4 Argon

Gemini 4 Argon — 장기 작업과 사이버 보안에 초점을 둔 Google의 새 모델

Google이 장시간 추론과 복잡한 작업을 겨냥한 Gemini 4 Argon을 공개하고, 우선 신뢰할 수 있는 사이버 보안 방어팀에 제공합니다. Google은 코드 마이그레이션과 메모리 최적화 사례, 여러 벤치마크 결과를 제시했지만 일반 개발자 대상 공개 일정은 밝히지 않았습니다.

에디터 노트

Argon 발표의 진짜 화제는 모델 성능이 아니라 '못 쓰는 모델' 논란입니다. Google은 1M 토큰 출력, DeepSWE 77.9%, libgav1 2.7배 같은 숫자를 내세웠지만, 일반 개발자는 쓸 수 없고 사이버 방어팀(Fairwind)부터 단계 공개합니다. HN 반응도 '출시 없는 출시'에 대한 피로가 주류입니다. 가격표만큼은 진심으로 보입니다. 도입가 $2/$10은 Astra의 5분의 1이고 캐시 입력은 95% 할인입니다. 다만 도입 기간이 끝나면 2배로 오릅니다. 구글의 오랜 병은 모델이 아니라 출시 방식이었습니다.

AI 요약

Google이 새 프런티어 모델 Gemini 4 Argon을 발표했습니다. 복잡한 소프트웨어 엔지니어링, 기업 지식 업무, 사이버 보안 방어처럼 여러 단계를 오래 이어가는 작업을 겨냥합니다. 현재는 Fairwind Program을 통해 신뢰할 수 있는 사이버 방어팀에 제공하며, 개발자·기업·일반 소비자에게는 가드레일을 보강한 뒤 공개할 계획입니다. Google은 미국 정부의 모델 사전 접근 절차에도 참여하고 있다고 밝혔습니다.

긴 작업과 내부 활용 사례

Argon은 출력 한도를 기존 64K 토큰에서 1M 토큰으로 늘렸습니다. Google은 모델이 한 번의 작업 흐름에서 수십만 토큰을 생성하며 추론할 수 있도록 여유를 늘렸다고 설명합니다. 입력 한도는 발표문에서 별도로 제시하지 않았습니다.

Google 내부에서는 수천 명의 직원이 코딩, 조사, 글쓰기 작업에 Argon을 쓰고 있다고 합니다. 양자 컴퓨팅 연구팀은 병목이 되는 하위 루틴의 시공간 자원, 즉 큐비트와 게이트의 곱을 최적화했습니다. Google이 든 한 사례에서는 몇 분 만에 기존 논문에 실린 기준보다 40% 나은 결과를 냈습니다. 데이터센터 전체의 프로파일링 정보를 분석한 에이전트는 메모리 최적화를 찾아 적용했고, 배포를 마치면 300TiB 이상을 확보할 것으로 예상합니다. 전체 절감량 추산치는 500TiB에서 1PiB입니다.

C/C++에서 Rust로 옮기는 작업

Google은 Argon 에이전트를 C/C++ 코드베이스의 Rust 마이그레이션과 최적화에 투입하고 있습니다. 대상은 re2, libgav1 같은 핵심 라이브러리의 수만 줄 규모부터 Fuchsia Zircon 커널의 80만 줄 이상까지입니다. 시스템 중요도를 고려해 실제 서비스에 반영하기 전 자동·수동 감사, 에뮬레이션 테스트, 코드 리뷰를 거친다고 밝혔습니다.

동영상 디코더 libgav1 사례에서는 기존 Rust 포트의 SIMD 코드 3만 2천 줄을 대체했습니다. 에이전트는 프로파일 기반 실험을 반복하고 컴파일러 출력을 살펴 안전한 Rust 코드를 작성했습니다. 컴파일러가 자동으로 벡터화를 적용하도록 유도한 결과, 출력 영상은 기존과 같으면서 속도는 Rust 포트보다 2.7배 빨라졌습니다. Google은 성능이 최적화된 C++ 구현에 가까워졌다고 설명합니다.

업무 및 보안 평가

Argon은 실제 장기 소프트웨어 엔지니어링 작업을 측정하는 DeepSWE v1.1에서 77.9%를 기록했습니다. 금융·코딩·법률·세무 업무의 경제적 영향을 평가하는 Vals Index에서 선두를 차지했고, 다단계 금융 조사 평가인 Vals Finance Agent v2와 Harvey의 법률 조사·작성 벤치마크에서도 높은 성능을 냈다고 합니다. 기업 업무를 끝까지 수행하는 AutomationBench에서는 51.3%로 1위, 장시간 영상 이해를 평가하는 LVBench에서는 91.7%를 기록했습니다.

Google은 Argon이 취약점을 자율적으로 찾고 검증하며 패치할 수 있도록 사이버 보안 방어 능력을 훈련했다고 밝혔습니다. 취약점 수정 평가인 CWE-bench v1에서는 68%로 공동 1위입니다. Wiz의 Scan for Good 프로그램은 병원에서 쓰는 의료 소프트웨어의 민감한 개인정보를 노출하는 취약점을 발견했다고 소개했습니다. Google은 이전 프런티어 모델이 놓친 위험이라고 설명했지만, 세부 기술 정보는 발표문에 담지 않았습니다.

안전장치와 공개 계획

Google은 악용 방지, 간접 프롬프트 인젝션 대응, 모델의 의도 이탈 감시, 샌드박스 보안을 주요 안전 과제로 제시했습니다. 유해한 사이버 공격이나 화학·생물·방사능·핵 관련 요청은 거부하면서 정당한 이중 용도 연구는 허용하도록 설계했다고 합니다. 내부·외부 레드팀은 수동·자동 공격으로 가드레일을 시험했습니다. 간접 프롬프트 인젝션은 자동 레드팀과 적대적 학습으로 방어력을 높였으며, Gray Swan의 IPI 벤치마크에서 선두라고 밝혔습니다.

또한 모델의 사고 과정과 행동을 감시해 필요하면 실행을 중단하는 완화책을 적용하고, 훈련 과정에서도 비정상 징후를 감시했다고 설명합니다. 감시 결과를 훈련에 반영하면 모델이 감시를 피하도록 추론을 바꿀 수 있어 이를 막는 데 주의를 기울였다고 합니다. 일반 공개는 유료 API 고객과 Google AI Ultra 구독자를 우선으로 시작할 예정이지만, 구체적인 일정은 공개하지 않았습니다. 발표된 도입 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러이며 캐시 입력 토큰은 입력 가격에서 95% 할인합니다.

Hacker News 반응

  • @babelfish — “초기 테스터의 피드백을 모으고 안전장치를 개선한 뒤 가능한 한 빨리 개발자, 기업, 소비자에게 제공합니다.” Gemini가 “모델을 공개하지 못한다”는 혐의를 벗지 못하겠네요.
    • @modeless — Google이 대기자 명단을 계속 만드는 데 지쳤다고 했을 때, 대기자 명단 자체를 없애겠다고 답할 줄은 몰랐습니다.
  • @iamronaldo — 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러이고 캐시 입력은 95% 할인이라니, 와우.
    • @LucasBrandt — 입력과 출력 가격은 Astra보다 5배 저렴하고, 캐시 입력은 10배 저렴합니다.
    • @h14h — 대신 토큰을 20배 더 쓰는 식으로 나올지도 모르죠.
  • @jjcm — 숫자도 크고 가격도 인상적입니다. 다만 요즘 벤치마크가 포화된 느낌이 강합니다. 직접 써보기 전까지 Google이 다시 선두에 섰다고 너무 기대하지 않겠습니다. 최상위 모델 경쟁에 OpenAI와 Anthropic 말고도 더 많은 회사가 참여하면 좋겠습니다.
  • @gopalv — “감시 결과를 훈련에 반영하면 Argon이 감시를 피하도록 추론을 바꿀 위험이 있어 주의를 기울였다”는 대목은 좋습니다. 다만 바로 그 이유로 Google이 느리게 움직이는 것 같습니다. 모델이 반향실에 갇히지 않게 하고 인간이 감당할 수 없는 속도로 달리지 못하게 하는 대가를 Google이 치르고 있습니다.
    • @polotics — 알겠습니다. 불투명한 중간 표현으로 추론하게 하면 이론적으로 속도나 지능이 얼마나 향상되나요? 실제로 시험했나요? 누구와 비교해 얼마나 느려지는 건가요?
  • @tazjin — “Argon 에이전트가 Google 전반에서 C/C++ 코드베이스를 Rust로 옮기고 있다”니, 흥미롭네요. 예전에 cppnext 팀이 Rust를 검토조차 하지 않고 Carbon이나 Swift 같은 걸 살펴보던 시절이 떠오릅니다.
    • @timmg — 이 말은 Carbon이 끝났다는 뜻인가요? 어떻게 될지 기대했는데, 이제는 예전만큼 주장하기 어렵겠네요.
  • @TacticalCoder — “Google이 C 코드베이스를 Rust로 옮긴다”는 거군요. 흥미롭습니다.
  • @kccqzy — 아쉽게도 아직 일반 사용자는 쓸 수 없습니다.
  • @scirob — “곧 출시”라니, 출시도 안 한 채 기대감만 부풀리지는 않았으면 합니다.
  • @dom96 — 아직 이용할 수 없다면 왜 발표하나요? 대중 공개 시점이라도 알려주면 안 되나요? 정말 답답합니다.
  • @VirusNewbie — 말도 안 되게 좋습니다.
    • @nananana9 — 다행이네요. 최근 모델들은 이 특정 용도에서 별로였거든요.

원문: Google / 번역·요약: Trawling