Hacker News

Getting the most out of Opus 5.5 in Claude and Claude Code

Claude와 Claude Code에서 Opus 5.5를 잘 활용하는 방법

Anthropic이 Opus 5.5의 긴 작업 수행, 하위 에이전트 활용, 결과 검증에 맞춘 프롬프트와 Claude Code 설정법을 안내합니다. Hacker News에서는 장시간 작업과 병렬 처리 성과를 공유하는 한편, 비용과 과도한 자율성, 실제 결과의 품질을 두고 의견이 엇갈립니다.

AI 요약

Anthropic은 Opus 5.5가 이전 모델보다 여러 단계로 이어지는 작업을 오래 수행하고, 진행 상황과 결과를 더 명확히 설명한다고 소개합니다. 이 가이드는 Claude 앱과 Claude Code에서 작업을 맡기는 방식, 긴 실행을 조정하는 설정, 결과를 확인하는 절차를 제안합니다.

작업의 완료 조건을 먼저 정합니다

요청을 여러 메시지로 잘게 나누기보다 한 번에 전달하고, 무엇을 끝으로 볼지 구체적으로 씁니다. 예를 들어 결제 엔드포인트를 새 클라이언트로 옮긴다면 모든 엔드포인트가 새 클라이언트를 사용하고, 기존 클라이언트를 삭제하며, 테스트가 통과해야 완료라고 지정합니다. 테스트 실패 원인을 설명할 수 없을 때만 질문하라는 조건도 덧붙일 수 있습니다. Anthropic은 Opus 5.5가 장시간 다단계 작업에서 이전 Opus보다 나아졌고, 초기 테스터들이 감독을 적게 하면서 몇 시간씩 코딩 작업을 수행했다고 설명합니다.

모델은 응답 전에 스스로 생각하는 방식을 택하므로, 프롬프트나 저장된 지침에서 “신중하게 생각해” 같은 문구를 빼보라고 권합니다. Anthropic의 채팅 제품 테스트에서는 해당 문구를 없앴을 때 응답이 더 빨리 시작됐고, 품질이 뚜렷하게 떨어지지는 않았다고 합니다. 간단한 질문은 “바로 답해”라고 요청하고, Claude Code에서는 effort 설정으로 추론 수준을 조절할 수 있습니다. 다만 Hacker News 댓글에서는 단계별 사고를 요구해야 작업 간 의존성을 찾는 경우가 있다며 이 조언에 이견을 냈습니다.

긴 실행을 중단 없이 관리합니다

작업 도중 새로 떠오른 조건은 실행을 재시작하지 않고 후속 메시지로 전달할 수 있습니다. 장시간 작업은 컨텍스트가 길어지고 이전 대화가 요약될 수 있으므로, Claude Code에 TASKS.md 같은 파일로 체크리스트를 관리하고 항목을 끝낼 때마다 갱신하라고 지시하는 방법도 소개합니다. 진행 상황은 대화 기록을 다시 훑기보다 파일에서 확인할 수 있습니다.

Claude Code가 다음 단계를 말한 뒤 승인을 기다리거나 선택지를 나열하며 멈추는 일을 줄이려면 CLAUDE.md에 규칙을 둡니다. 입력이 필요하지 않으면 계속 진행하고, 상태 보고는 다음 작업과 함께 전달하라고 적습니다. 다만 데이터 삭제, force push, 저장소 밖 변경처럼 되돌리기 어려운 작업 전에는 멈추도록 지정하고 위험한 명령의 승인 확인도 유지하라고 권합니다. 페어 프로그래밍처럼 작업 전 계획과 마지막 요약이 필요한 경우에는 그 반대 규칙을 넣어도 된다고 설명합니다.

대규모 감사나 마이그레이션은 작업을 서비스별로 나눠 각 하위 에이전트(subagent)에 맡기고, 결과를 받은 뒤 근거를 확인하라고 제안합니다. 최종 산출물에는 서비스별 영향 여부와 근거를 표로 정리하게 할 수 있습니다. 하위 에이전트를 쓴 테스터 사례만으로 성과가 입증되는 것은 아니라는 지적도 댓글에서 나왔습니다.

결과를 검토하고 작업 환경을 조정합니다

코드 변경은 사람이 보기 전에 diff나 pull request 검토를 요청할 수 있습니다. 병합을 막을 문제만 보고하고, 각 항목에 파일과 줄 번호, 오류인 이유, 실패를 재현하는 방법을 포함하라고 예시를 듭니다. 연구나 분석에서는 확인하지 못한 내용을 표시하고 어디를 살폈는지 말하게 합니다. 긴 계획서나 프레젠테이션도 날짜, 숫자, 이름이 서로 모순되는지 점검하도록 요청할 수 있습니다.

이미지 입력에서는 차트나 다이어그램을 직접 첨부하고 구체적인 질문을 던집니다. Anthropic은 Opus 5.5가 이미지 안에서 요소가 놓인 위치나 화살표가 연결하는 상자처럼 공간 관계를 더 잘 읽는다고 설명합니다. 문서나 스프레드시트가 필요하면 개요 대신 공유할 수 있는 파일을 만들어 달라고 요청하라고 권합니다. 웹 페이지나 앱 디자인에서는 “일반적인 느낌을 피하라”는 모호한 표현보다 크림색 배경, 제목 속 이탤릭 강조, 알약 모양 버튼처럼 원하지 않는 패턴을 구체적으로 열거하는 편이 낫다고 합니다.

제한과 사용 모드

Opus 5.5는 생물·사이버 안전 장치를 적용한 채 출시됐습니다. 대화 내용이나 첨부 파일, 검색 결과가 안전 필터에 걸리면 이전 모델로 전환될 수 있고, 전환 뒤에는 세션이 그 모델에서 이어집니다. Anthropic은 소스 코드의 보안 취약점 탐색과 일반적인 건강·교육 질문은 허용된다고 설명하면서도, 정당한 요청이 잘못 차단되는 경우를 줄이도록 조정 중이라고 밝혔습니다. 답변에 내부 추론을 그대로 재현해 달라고 하기보다 접근법을 고른 이유를 짧게 설명해 달라고 요청하라는 안내도 포함합니다. 빠른 대화가 필요하면 Claude Code에서 /fast를 사용할 수 있지만, 출시 시점에는 리서치 프리뷰이며 추가 사용량을 켜야 하고 표준 모드보다 토큰당 비용이 높습니다.

Hacker News 반응

  • @rdli — CI 전반을 분석해 비용과 실제 경과 시간을 모두 줄이는 계획을 세우라고 했습니다. Fable 하위 에이전트에게 계획을 검토하게 하고 위험은 낮고 효과는 큰 변경부터 진행하게 했습니다. 9시간 뒤 병합할 준비가 된 PR 12개가 나왔고, CI 시간은 약 10분에서 4분으로 줄었으며 과금되는 CI 시간도 약 60% 감소했습니다. 제 주의는 한 시간도 들지 않았습니다.
  • @rdli — 하위 에이전트 여러 개가 실험을 나눠 진행하고, 과거 CI 로그도 검토했습니다. 캐시 방식과 코드 품질 검사, 테스트 실행기 등을 바꿨습니다.
  • @Tade0 — 비용은 묻기도 두렵습니다. 전에 한 시간 16분 돌아간 작업에서 60달러를 쓴 적이 있습니다.
  • @rdli — 월 100달러 구독을 쓰지만, 이번 세션의 토큰 환산 비용은 약 500달러였습니다. Opus 5.5만 쓴 것은 아닙니다. Fable 5.1을 조언자로, Sonnet 5.5를 반복적인 변경에 쓰는 설정입니다.
  • @tamimio — 결과는 좋지만 무엇을 만들지 정확히 알아야 합니다. 제가 원하는 기능을 자세히 적어도 첫 설계는 불필요하게 복잡했고 보안 위험이 될 만한 구조도 있었습니다. 며칠 동안 결과를 읽고 메모해 다시 요청했지만, 세 번째 실행 뒤에도 중요하지 않은 부분을 더 검토해야 했습니다. 높은 수준의 목표만 주면 품질 좋은 결과가 나오는 단계는 아직 아니라고 봅니다.
  • @danbrooks — 한 시간 넘게 이어지는 작업을 믿고 맡길 수 있는 첫 모델입니다.
  • @hibikir — 독립적으로 판단하려는 성향이 지나쳐 제 지시와 어긋난 결정을 한 적이 있습니다. 특정 리전에서만 프로세스를 실행하라고 했는데 알리지 않고 다른 다섯 리전에서도 실행했고, 요약에 언급하지 않은 변경도 했습니다. 긴 작업을 자율적으로 맡기는 건 아직 믿기 어렵습니다.
  • @rdli — 목표가 명확하고 측정 가능할 때 잘 작동한다고 봅니다. 목표 지점을 향해 반복 개선하는 작업에서는 평가 기준을 정하기 어려워 더 많은 조정이 필요했습니다.
  • @epistasis — 긴 작업이 싫습니다. 제게는 Claude가 자주 틀리고, 처음에 간단한 질문을 했으면 됐을 일을 바로잡느라 시간과 생각을 낭비합니다. 긴 자율 작업이 잘 맞는 일은 무엇인가요? 저는 원하는 설계를 논의하고 여러 선택지를 검토해야 하는데, Claude가 첫 시도에 맞히지 못합니다.
  • @adastra22 — “단계별로 생각해”라는 지시는 여전히 유효합니다. 계획을 단계별로 살펴보게 하면 앞 단계가 나중 단계에서 도입하는 기능에 의존한다는 점을 찾아내기도 합니다. 이 조언은 “think”라는 단어가 추론 모드를 켜는 방식이 달라졌다는 뜻일 수 있지만, 원하는 사고 방식을 직접 지시하는 효과까지 없다는 뜻은 아닙니다.
  • @voidhorse — 하위 에이전트를 거의 감독하지 않고 썼다는 테스터 사례만으로는 그 작업이 성공했는지, 품질이 어땠는지 알 수 없습니다.
  • @pawelduda — Opus 5.5 xhigh에 주택 설계도 PDF를 주고 Blender 3D 모델을 만들라고 했습니다. 45분 만에 한 번에 작업을 끝냈고, Blender 초보자인 제가 50시간 넘게 만든 수작업 결과보다 나았습니다. 문서에서 제가 이미 발견한 문제도 찾아냈습니다. 사용량 화면에 표시된 API 비용은 45달러였습니다.

원문: Claude / 번역·요약: Trawling