Hacker News

Grok 4.7

Grok 4.7 — 장시간 코딩과 안전성 개선을 내세운 새 모델

xAI가 코딩과 지식 작업을 겨냥한 Grok 4.7을 출시했습니다. 더 큰 기반 모델과 장시간 강화학습으로 긴 작업, 자기 검증, 문서·프레젠테이션 생성을 개선했으며 입력 100만 토큰당 2달러, 출력 6달러부터 제공합니다.

AI 요약

xAI가 Grok 4.7을 Grok 4.6과 같은 가격과 속도로 공개했습니다. 새 모델은 장시간 이어지는 코딩 작업과 일반 지식 작업을 겨냥하며, Cursor, Grok Build, Grok API, 서드파티 코딩 harness, model router, 클라우드 플랫폼에서 사용할 수 있습니다.

더 큰 모델과 장시간 강화학습

Grok 4.7은 Grok 4.6보다 큰 base model을 사용합니다. 여러 시간에 걸리는 문제의 비중을 높인 더 어려운 작업 조합으로 강화학습을 오래 진행했습니다. xAI는 그 결과로 모델이 작업 결과를 더 꼼꼼히 검증하고 긴 context를 관리하는 능력이 좋아졌다고 설명합니다. Grok Bot harness를 기본적으로 이해하도록 학습해 대화와 일반 지식 작업에도 맞췄습니다.

문서와 프레젠테이션 생성도 개선했다고 합니다. 전문직 업무를 다루는 GDPval과 AA Briefcase에서 변호사, 간호사, 금융 분석가가 수행하는 작업을 평가했고, 두 벤치마크 모두 Grok 4.6보다 나은 결과를 냈으며 다른 frontier model과 비슷한 수준이라고 밝혔습니다.

코딩 성능과 안전장치

장시간 코딩 작업을 평가하는 CursorBench 4.0에서 가격 대비 성능이 frontier 수준이라고 주장합니다. 다만 발표문에는 구체적인 점수나 작업당 비용을 공개하지 않았습니다.

Grok 4.7에는 새 safeguard stack을 적용했습니다. xAI 자체 평가에서 거부 동작과 jailbreak 저항성이 가장 강한 모델이라고 설명합니다. 사이버보안과 생물학처럼 정상적인 활용과 위험한 활용이 맞물리는 영역에서는 유용한 작업을 수행하면서도 위험한 요청을 거부하도록 조정했습니다. LatchBio biosafety benchmark에서는 62.4%로 가장 높은 결과를 냈다고 밝혔습니다.

HackerBench v0.3에서는 위험하거나 악의적인 사이버 작업 요청 중 허용된 비율이 3.3%에 그쳤고, 정상적인 보안 작업은 거의 차단하지 않았다고 합니다. 방어 연구를 위해 일부 사이버보안 파트너에게만 red-team 기능을 초대 방식으로 제공하기 시작했습니다.

제공 범위와 가격

기본 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러입니다. 출력 속도를 두 배로 높인 fast variant도 제공하며 가격은 두 배입니다. Cursor와 Grok Build에서 바로 사용할 수 있고, API와 여러 코딩 도구 및 클라우드 플랫폼에서도 호출할 수 있습니다.

Hacker News 반응

커뮤니티에서는 Grok 4.7의 실제 코딩 성능을 긍정적으로 평가하는 의견과, 벤치마크 비교 방식과 토큰 효율을 비판하는 의견이 맞섰습니다. 특히 Grok 4.7의 xhigh 추론 결과를 Grok 4.6의 high 결과와 비교한 점, CursorBench에서 Astra를 제외한 점, 긴 agent 작업에서 cache read 비용이 커지는 점이 반복해서 지적됐습니다.

  • @ls1911 — 몇 달 동안 Cursor의 Grok과 Trae.ai를 사용해 왔는데, Grok Cursor가 Trae.ai보다 결과가 훨씬 뛰어납니다.
  • @sidgtm — 제 경험상 특히 Grok Build 안의 Grok은 꽤 탄탄한 선택입니다. 군더더기 없이 한 방향을 유지합니다. Grok Bot도 정말 즐겁게 사용하는 또 다른 인터페이스입니다.
    • @guywithahat — Grok 4.6과 Grok Build를 사용하면서 좋은 경험을 했습니다. tscircuit으로 작업할 때 공간 추론을 이해하고 코드를 작성했으며, 여러 파일 형식의 CAD 부품을 TSX로 가져올 수 있었습니다. 세 프로젝트에서 Claude를 사용해 오류를 찾아보게 했지만 지금까지 개선할 부분을 찾지 못했습니다. 4.7이 기대되지만 가격을 올리지 않았으니 크게 좋아졌는지는 다른 사용자들처럼 의문입니다.
  • @sourcecodeplz — Intelligence Index의 출력 토큰 수는 다음과 같습니다. Grok 4.6 xhigh는 점수 44에 9,700만 토큰을 사용했고, Grok 4.7 xhigh는 점수 46에 2억 4,000만 토큰을 사용했습니다.
  • @MuffinFlavored — CursorBench 점수가 이번 발표의 핵심이라면, Grok 4.7 xhigh가 Fable 5.1 low와 거의 같은 수준으로 읽힙니다. 두 모델을 비교할 때 걸린 시간 같은 지표도 있나요? Fable 5.1이 low에서 더 빨리 끝내고, Grok 4.7이 두 배의 시간 동안 헤매면서 지저분한 주석과 불필요한 단위 테스트를 남긴다면 정말 비슷한 모델인가요? 해결됐다는 것과 유지보수하기 어렵고 지저분하며 임시방편인 해법은 다릅니다.
  • @kristofferR — 위쪽의 기만적인 그래프는 무엇인가요? Astra를 포함하지 않은 건 실수일 수 없습니다. 모델이 Astra보다 낮게 비교된 건가요?
    • @Jcampuzano2 — CursorBench는 Cursor를 harness로 사용합니다. OpenAI가 Cursor 안에서 Astra를 제공하는 것을 허용하지 않기 때문에 실제 harness로 Astra를 평가할 수 없습니다.
    • @kristofferR — 정확하지 않습니다. OpenAI는 Cursor가 Astra 접근 권한을 재판매하는 것을 허용하지 않을 뿐이고, 다른 harness로 벤치마크를 실행하는 것까지 막지는 않습니다. Cursor가 Astra를 CursorBench에 넣고 싶었다면 OpenAI API key 지원을 추가하면 됐습니다.
  • @GodelNumbering — Grok은 매번 cache 가격을 숨기면서 입력과 출력 가격만 강조합니다. 발표의 비교표에서는 Grok이 100만 토큰당 2달러와 6달러이고 Fable은 10달러와 50달러입니다. 하지만 Grok의 cache read는 100만 토큰당 0.50달러이고 Fable은 0.25달러입니다. 장시간 agent workflow는 cache read가 대부분을 차지합니다. 사용자가 비용 구조를 잘 모른다는 점에 기대는 것처럼 보여 불쾌합니다.
  • @Saline9515 — Omp에서 써 봤는데 지금까지는 문제가 많습니다. thinking mode에서 ‘수정 1, 수정 2, 수정 3’을 반복하면서 계속 순환하고, AGENTS.md 지시를 무시하고, plan 파일을 망가뜨립니다. 5.6 Sol을 조언자이자 감시자로 두었는데 매번 작업을 막습니다. 이런 일은 한 번도 보지 못했습니다. 4.6은 그 정도로 나쁘지 않았습니다.
    • @marwatk — Omp를 시험한 이유는 한 세션에서 role별로 다른 모델을 사용할 수 있고, 제 경험상 grep보다 LSP를 사용해 코드 구조를 파악하는 일이 많기 때문입니다. 다만 시작 context가 2만 토큰을 넘는 점은 과합니다. 실제로 사람들이 어떤 harness로 생산성을 내는지 알기 어렵습니다.
  • @qwerpy — 4.6을 일회성 게임 모드와 유틸리티에 사용했는데 매우 잘했습니다. ‘Moonlander라는 특이한 키보드와 이 특이한 우주 시뮬레이션 게임에 맞는 SVG 키보드 치트시트를 만들어 달라’고 요청했습니다. 키보드의 keymap.c와 게임의 inputmap.xml을 가져오게 한 뒤 한동안 작업했고, SVG와 함께 생성용 Python script도 내놓았습니다. 한 시간 더 대화하면서 script를 다듬었고, 이제 키보드 firmware와 게임 binding이 바뀌어도 좋은 다이어그램을 생성합니다. 4.6에서 보였던 ‘X가 아니라 Y입니다’ 식의 표현도 고쳤기를 바랍니다.
    • @Theodores — 인상적이지만 SVG 파일을 살펴보면 겉보기와 달리 이상한 부분이 있습니다. AI는 DRY 원칙을 아직 이해하지 못하는 것 같습니다. 키 모양에 둥근 사각형을 쓰고, 텍스트가 넘치지 않게 하려고 clip path에도 같은 둥근 사각형을 또 씁니다. 똑같은 사각형 144개가 들어가는데 defs에 하나만 두고 복제하면 됩니다.
  • @jjcm — Grok 4.7은 image-to-HTML 작업에서 확실히 좋아졌습니다. Astra와 비교해 이미지에서 디자인을 읽고 HTML을 생성하게 했습니다. 두 모델 모두 조각상에 마우스 위치에 따른 동적 조명을 넣었지만 Astra의 최종 결과가 더 다듬어졌고 대비와 페이지 사이 애니메이션도 좋았습니다. Grok은 배경 요소까지 모두 조명해 조금 과했습니다. 그래도 가격을 생각하면 좋은 출발점입니다. Grok 4.7에는 cache read 약 2,000만 토큰, input 100만 토큰, output 10만 토큰을 사용했고 비용은 12.60달러였습니다. Astra는 35달러였습니다.
  • @pampas — Grok 4.7을 Redactle LLM benchmark에 넣었습니다. 퍼즐 게임이라 다소 단순한 평가지만 지식 범위를 잘 시험합니다. Grok 4.7은 순위 상단에 있으며 Grok 4.6보다 크게 좋아졌습니다. 그래도 매우 저렴하고 빠른 Gemini 3.8 Flash보다는 낮습니다.
  • @mchusma — 4.6은 제가 시도한 어떤 용도에서도 충분하지 않았습니다. 코딩과 여러 agent workflow에서 Sol과 Opus가 넘는 지능 수준이 있습니다. 4.7은 확실히 더 느리고 비쌉니다. 벤치마크 점수를 올리려고 토큰을 태운 것처럼 느껴집니다. 제 기준선을 넘었는지는 아직 명확하지 않습니다. 느려서 오늘 빠르게 테스트하기도 어렵습니다.
    • @mchusma — 코딩, 계정에 로그인해 데이터를 수집하는 agent flow, Grok Bot에서 4.6은 Sol이나 Opus보다 실수가 많았고 자주 포기했습니다. 4.7이 더 나을 수는 있지만 Sol이나 Opus 수준을 명확히 넘기를 기대했는데 지금까지는 그렇지 않습니다.
  • @puszczyk — Cursor와 Grok Build에서 agentic coding, terminal, Unix, Bash 작업에는 잘 맞습니다. token efficient하고 GPT 5.6보다 저렴합니다. Fable만큼 좋지는 않지만 제 backend, Go, infra 작업에는 비용과 성능이 균형 잡혀 있습니다. 다만 이 평가는 Grok 4.6에 대한 것이며 4.7은 아직 테스트하지 않았습니다.
  • @c0rruptbytes — 회사에서 Amazon Bedrock만 사용할 수 있는데 Grok은 사실상 유일한 저렴한 모델 선택지입니다. Sol과 Opus는 너무 비싸서 이번 업데이트가 반갑습니다.
  • @simonw — 기본 reasoning level로 SVG를 생성해 보고 high reasoning level에서도 실행했습니다. low와 medium은 비슷한 토큰 수를 사용했고, xhigh는 high보다 적게 사용했습니다. OpenRouter를 거치지 않고 다시 실행해야 할 것 같습니다. xAI API로 직접 실행하니 reasoning level 사이의 차이가 크지 않았고, 이번에는 xhigh와 low가 같은 reasoning token 수를 사용했습니다.
  • @johnfahey — xAI가 빠르게 발전한 것은 분명하지만 몇 달 동안 OpenAI와 Anthropic보다 ‘조금 뒤처진’ 상태입니다. 1년 전보다 frontier 바로 뒤와 frontier를 밀어붙이는 수준 사이의 간격이 훨씬 크다는 점이 드러난 것 같습니다. 그래서 frontier model 시장의 확실한 세 번째 경쟁자가 아직 나오지 않았습니다.

원문: xAI News / 번역·요약: Trawling