Hacker News

Strands Harness

Strands Harness 공개 — 여러 모델과 클라우드에서 실행하는 에이전트 하네스

AWS의 Strands 팀이 범용 에이전트 하네스 Strands Harness를 Apache 2.0 라이선스로 공개했습니다. 자체 벤치마크에서 같은 Claude·GPT 모델을 썼을 때 다른 하네스보다 비용을 28% 줄였다고 밝혔으며, 비교 대상 선정과 벤치마크의 신뢰성을 두고 Hacker News에서 논쟁이 이어졌습니다.

AI 요약

Strands 팀이 코딩 에이전트가 아닌 범용 에이전트를 위한 오픈소스 하네스 Strands Harness를 공개했습니다. Python 또는 TypeScript에서 한 줄로 시작할 수 있고, 모델을 선택해 로컬에서 실행하거나 원하는 클라우드에 배포할 수 있습니다. Apache 2.0 라이선스를 적용했습니다.

비용과 정확도를 비교한 자체 벤치마크

팀은 EC2에서 Harbor를 이용해 6개 벤치마크를 분산 실행했습니다. 같은 Claude 또는 GPT 모델을 썼을 때 Strands Harness가 다른 하네스보다 비용을 28% 줄였으며, 토큰 효율은 높이고 벤치마크 점수는 비슷하거나 더 높았다고 설명합니다. Deepseek Harness는 전체적으로 토큰을 가장 적게 썼지만 정확도 점수는 대체로 가장 낮았습니다.

Fable 5를 쓴 Terminal Bench 2.1 비교에서는 Strands Harness가 Claude Code보다 비용을 77% 줄이면서 더 높은 점수를 기록했습니다. Strands 팀원이 댓글에서 밝힌 점수는 Strands Harness 69.7%, Claude Code 61.8%입니다. 팀은 추가 하네스를 포함한 벤치마크 분석 글을 후속 공개하겠다고 했습니다.

기본 설정이 줄이는 토큰 사용량

Strands Harness는 프롬프트 캐싱과 컨텍스트 관리를 기본 제공합니다. 도구 결과가 약 1,500토큰을 넘으면 잘라내고, 컨텍스트 창 사용량이 85%를 넘으면 요약(compaction)을 시작합니다. 컨텍스트 오버플로가 발생하면 작업 루프 안에서 복구를 시도합니다. 팀은 이런 기본 설정이 토큰 효율과 정확도에 크게 기여했다고 설명합니다.

기본 에이전트에는 셸, 파일 읽기·쓰기·편집, 웹 도구가 포함됩니다. 도구 결과가 길면 파일로 옮기고, 여러 요청에서 재사용하는 내용을 캐시합니다. 실행 간 장기 메모리를 유지하고 세션 ID로 이전 대화를 이어갑니다. 하위 에이전트에 개방형 작업을 맡기고 체크리스트로 여러 단계 작업을 추적하며, 스킬이 있으면 불러옵니다. Amazon Bedrock, Anthropic, OpenAI, Google, Ollama, LiteLLM 모델을 지원합니다.

Linux 컨테이너를 실행하는 Modal, Cloudflare Containers, Azure Container Apps, Google Cloud Run, Amazon ECS, Amazon Bedrock AgentCore 등에 배포할 수 있습니다. Strands CLI에서 자연어로 에이전트를 시제품화한 뒤 /export 명령으로 Python 또는 TypeScript 코드를 내보내는 흐름도 제공합니다. 하네스는 기본 설정을 바꾸거나 모델·도구를 교체하고, 구성 요소를 Strands Harness SDK 수준까지 점진적으로 대체할 수 있습니다.

비교 대상과 측정 결과를 둘러싼 질문

댓글에서 가장 큰 쟁점은 벤치마크에 Pi 기본 설정이 빠지고 Oh My Pi가 포함된 이유였습니다. 일부 이용자는 기본 Pi가 더 가벼워 토큰 효율과 성공률 비교에 적합할 수 있다고 지적했습니다. Strands 팀원은 Pi 실행을 추가 검토하겠다고 답했습니다. 반면 Strands에 기본 제공되는 MCP 서버, 하위 에이전트, 웹 도구와 기능을 맞추려면 Pi에 어떤 플러그인을 추가할지 정해야 하므로 비교 조건이 모호해진다는 의견도 나왔습니다.

Terminal Bench 2.1이 포화된 벤치마크라는 비판도 제기됐습니다. 이에 Strands 팀원은 Fable 5의 점수 차이를 공개했고, 다른 댓글 이용자는 Artificial Analysis의 점수는 같은 하네스를 쓰지 않아 직접 비교할 수 없다고 설명했습니다. 같은 모델로 하네스만 바꾼 비교는 비용과 점수 차이를 보여준다는 반론도 있었지만, 벤치마크 결과만으로 각자의 실제 작업에서 성능을 판단하기 어렵다는 우려는 남았습니다.

그 밖에 일부 이용자는 모델 제공업체의 네이티브 하네스가 해당 모델에 더 잘 맞도록 학습될 가능성을 걱정했습니다. 반대로 오픈소스 하네스가 모델과 무관하게 발전하면 좋겠다는 의견도 나왔습니다. AWS 팀의 제품 홍보라는 점을 경계하는 반응에 Strands 팀원은 AWS 밖에서도 배포할 수 있다고 답했습니다.

Hacker News 반응

  • @tontinton — 비교 그래프에 https://maki.sh 도 넣어주실 수 있나요? 경쟁 상대가 될 것 같습니다.
  • @fxwin — 왜 oh-my-pi는 비교에 넣고 기본 Pi는 빼셨나요?
    • @c0rruptbytes — OMP에는 기본 Pi보다 토큰 비용을 높이는 잡다한 기능이 많이 들어 있습니다.
    • @jbellis — 기본 Pi는 중요한 기능을 기본 제공하지 않아서, 어떤 확장 기능을 추가할지 따지는 문제를 열고 싶지 않았기 때문입니다.
    • @strandstan — Pi 실행을 살펴보겠습니다. 연구원이 벤치마크 심층 분석을 준비 중이라 다른 하네스도 테스트할 여력이 있습니다.
  • @theturtletalks — 벤치마크에 Pi가 없는 이유가 뭔가요? Deepseek은 Strands보다 앞서고 Pi를 기반으로 하니, 그것만으로도 제겐 충분합니다.
    • @techscruggs — Deepseek은 더 저렴했지만 정확도는 낮았습니다. ‘앞선다’고 말하는 건 공정하지 않습니다.
  • @seizethecheese — Terminal Bench 2.1은 포화 상태입니다. Fable 5를 돌리면 많은 토큰 절약 기법이 비용을 줄이면서 점수는 거의 그대로 유지할 겁니다. 점수가 얼마나 더 높았는지는 말하지 않았고, 통계적으로 유의미한 차이가 아닐 거라고 봅니다.
    • @strandstan — Terminal Bench 2.1에서 Fable 5를 쓴 Strands Harness는 69.7점, Claude Code는 61.8점입니다. 높은 추론 강도 설정 결과입니다. 포화 문제를 지적한 점은 이해합니다. Terminal Bench 4.0도 살펴볼 수 있습니다.
    • @stefan_lec — Artificial Analysis는 여기서 다른 하네스를 비교하지 않습니다. “e2b 샌드박스에서 Terminus 2 하네스로 Terminal-Bench 2.1을 실행하고, 작업별 pass@1을 3회 반복해 평균을 냈다”고 합니다. Strands가 비교한 하네스와 다르고 통과 기준도 같다고 보장할 수 없습니다.
  • @samusiam — 하네스를 맞춤 설정하기 어렵다고 주장하면서 새 하네스의 필요성을 설명하는 게 의아합니다. 비용을 줄이려면 강한 모델이 명확히 정의된 작업을 약한 모델에 위임하면 됩니다. 이런 패턴은 연결하기 어렵지 않습니다.
    • @seizethecheese — 맞습니다. 저도 별 생각 없이 취미 프로젝트용 하네스를 만들었는데, 프로젝트에서 가장 어려운 부분은 하네스가 아니었습니다.
  • @agentdev001 — 이런 용도로 쓸 수 있는 네이티브 통합이 있는지 에이전트에게 물어보면 OpenAI와 Anthropic 모두 여러 선택지를 알려줍니다. Claude Agent SDK, Claude managed agents, Codex exec, Codex SDK, Codex app server, OpenAI Agents SDK와 Agents API가 있습니다.
  • @johnmlussier — 모델 제공업체가 자기 하네스에서 쓰도록 에이전트를 학습시키기 시작하는 것 같아, 네이티브가 아닌 하네스를 쓰는 일이 점점 망설여집니다. 모델이 새로 나올 때마다 하네스별로 제대로 작동하는지 확인하고 싶지는 않습니다.
    • @CharlieDigital — 모델이 같고 벤치마크가 같은데 하네스에 따라 정확도와 비용이 크게 달라졌다는 그래프가 있습니다. 결과를 믿는다면 하네스도 중요합니다.
  • @llmslave — Amazon은 AI에서 한참 뒤처졌습니다. 클라우드 인프라 외에 제대로 된 결과물을 내놓지 못합니다. 에이전트는 복잡한 인프라 대신 원시 서버 같은 낮은 수준의 요소를 쓰면 되므로 AWS의 큰 위협이 될 겁니다.
    • @strandstan — Strands Harness는 AWS 밖에도 배포하도록 만들었습니다. 공개 전에 Cloudflare Containers와 Modal에서 실행해 봤습니다.
  • @__alexs — 맞춤 하네스를 어떻게 비용 효율적으로 쓰나요? Anthropic 대신 OpenAI 구독 요금제나 오픈 웨이트 모델을 쓰나요?
    • @everforward — 저는 Pi와 오픈 웨이트 모델을 주로 씁니다. Ollama 월 20달러 요금제로 Deepseek과 GLM을 사용하는데 한도에 걸린 적은 없습니다. 특정 작업을 요청하는 편이지, 한 번에 기능 전체를 만들라고 하지는 않습니다.
  • @quincepie — 지금까지는 제공업체 하네스와 비슷한 품질을 더 낮은 비용으로 내는 하네스를 많이 봤습니다. 품질과 일관성을 우선하는 프로젝트도 있나요?
  • @RomanKornev — 도구 결과가 1,500토큰보다 길면 링크로 바뀌고, 컨텍스트를 85%에서 강제로 요약하면서 최근 4개 메시지를 제외한 과거 대화를 없애는 건가요? 벤치마크에서는 좋아 보이겠지만, 이런 방식이 긴 작업에도 통할지는 의문입니다.

원문: Strands Agents / 번역·요약: Trawling