dev.to

We All Have a "Serious Work" AI and a "Just Vibing" AI. When Did That Happen?

우리 모두에게 ‘진지한 작업용 AI’와 ‘그냥 써보는 AI’가 생겼습니다 — 언제부터였을까요?

작성자는 AI 모델을 의식적으로 역할 분담하지 않았지만, 작업의 난이도와 도구 사용량, 응답 신뢰도에 따라 자연스럽게 선택 기준이 생겼다고 말합니다. 더 똑똑한 모델보다 작업 형태에 맞고 덜 귀찮은 도구를 고르는 과정이 개인별 AI 계층을 만든다는 이야기입니다.

AI 요약

작성자는 어떤 AI를 어떤 일에 쓸지 처음부터 정하지 않았지만, 작은 선택이 쌓이면서 자신만의 모델 계층이 생겼다고 설명합니다. 같은 AI라도 작업 종류와 사용 환경에 따라 신뢰도가 달라지고, 사용량 제한이나 응답 속도까지 실제 선택에 영향을 줍니다.

IDE 안의 역할 분담

작성자는 현재 AI IDE로 Antigravity를 사용합니다. GitHub Copilot이 유료화되면서 선택지에서 빠졌고, Antigravity 안에서는 모델 하나가 아니라 두 모델을 작업에 따라 나눠 씁니다.

Claude Opus는 계획 수립과 원인을 바로 찾기 어려운 UI 버그처럼 난도가 높은 작업을 맡깁니다. Gemini 3.1 Pro는 반복 작업과 작은 변경을 담당합니다. 작성자는 Gemini 3.1 Pro가 같은 상황에서 Claude Opus보다 환각을 더 자주 일으킨다는 점을 알고 있지만, Antigravity 안에서 사용할 수 있는 여유량이 더 많기 때문에 일상적인 코딩 대부분을 Gemini에 맡깁니다. 가장 신뢰하는 모델이 아니라, 충분히 믿을 수 있고 더 자주 실행할 여유가 있는 모델을 주력으로 쓰는 셈입니다.

챗봇 서비스마다 달라지는 용도

IDE 밖의 일반 챗봇에서는 역할이 다시 나뉩니다.

  • ChatGPT는 ‘이게 가능한가?’를 확인하는 도구입니다. 문법 확인, 러버덕 디버깅, 짧은 질문처럼 10초 안에 답을 얻으면 되는 일에 무료 요금제와 작은 모델을 사용합니다.
  • Claude는 빠른 초안 작성에 씁니다. 이름을 정하거나 아이디어를 잡고, 2분 안에 문서 문장을 다듬어야 할 때 선택합니다.
  • Gemini는 PYQ(previous year question)와 계산량이 많은 문제에 고정적으로 사용합니다. 작성자는 이 영역에서 Gemini가 틀린 답을 내는 경우를 한 번도 보지 못했다고 말합니다. 반면 코드나 일반 지식 질문에서는 틀릴 수 있지만, 계산 과정을 추적하는 문제라면 더 이상 답을 다시 확인하지 않는다고 설명합니다. Gemini에 대한 전반적인 신뢰가 아니라 특정 작업 영역에서만 쌓인 신뢰입니다.

과도한 에이전트가 만든 비용

자신에게 AI 라우팅 규칙이 있다는 사실을 깨달은 계기는 간단한 검수 작업이었습니다. 게시 직전 글에서 정렬, 굵은 글씨 위치, 태그만 확인해 달라고 Antigravity 에이전트에 요청했는데, 에이전트는 브라우저를 열고 화면을 캡처한 뒤 URL을 입력하고 다시 캡처했습니다. 커서를 움직여 클릭을 시도하는 과정도 이어졌습니다. 몇 초면 끝날 확인 작업에 여러 단계의 행동과 토큰을 사용한 셈입니다.

작성자는 실행을 중단하고 평소처럼 ChatGPT에 초안을 확인해 달라고 요청했습니다. 답은 한 번에 나왔습니다. 여기서 모델의 지능 순위보다 도구의 형태와 작업의 형태를 맞추는 일이 더 중요하다는 결론에 도달합니다. 실제 세계에서 행동할 수 있는 에이전트도 단순히 페이지를 읽는 일에는 과했고, 기능이 많아진 만큼 실수 비용만 커졌습니다.

코드 밖에서도 이어지는 선택 기준

크리켓 경기와 관련한 같은 한 줄 질문도 모델별 경험이 다릅니다. 작성자가 별다른 맥락 없이 특정 팀이 오늘 이기지 못할 것 같다고 말하면 Gemini는 실제 경기와 선수단, 최근 경기력을 확인하고 승리 가능성을 설명합니다. 경기가 진행 중이면 실시간 점수도 가져옵니다. 반면 ChatGPT는 같은 질문에 현재 점수를 먼저 알려 달라고 묻습니다.

작성자는 이것이 Gemini가 더 똑똑하다는 뜻은 아니라고 선을 긋습니다. 해당 상황에서 Gemini가 사용자의 추가 설명을 덜 요구한다는 점이 선택을 반복하게 만든다는 설명입니다. 결국 모델 선택은 의식적인 규칙보다 특정 작업에서 덜 불편했던 도구를 계속 찾는 과정에서 굳어집니다.

dev.to 반응

  • @dj29 — 이제 정말 궁금합니다 😂 저도 의식적으로 만든 적 없는 AI 계층을 분명히 가지고 있습니다. 여러분도 그런 계층이 있나요? 진지한 작업은 어떤 AI에 맡기고, 사소한 질문은 어떤 AI에 맡기나요? 아무 논리도 없는데 유난히 특정한 한 가지 일에만 믿는 AI도 있나요? 👀
  • @yug_vasava — 돌아와서 반갑습니다, 친구! 좋은 글이고 GIF도 좋습니다!
    • @dj29 — 고맙습니다! 그건 친구들이 만든 거예요. 그런데 여러분은 모르겠네요 😂
    • @yug_vasava — 하하. 쓸데없는 이야기는 말고 글 이야기나 합시다! 그래도 좋네요. 우리는 빠르다는 이유만으로 결국 ChatGPT를 기본값처럼 쓰게 되니까요.
    • @dj29 — 시험 노트에는 그렇습니다. 해커톤 작업에는 아닙니다. 그런 데서 누가 Antigravity를 쓰겠어요? 😂
  • @ranjancse — 정말 큰 LLM 하나를 빠뜨린 것 같습니다. 바로 진짜 자연 인간 두뇌입니다 😁 안타깝게도 AI 도구를 지나치게 사용하거나 활용하는 사람들은 생각하는 일을 외주 주고, 자신이 살아 있다는 사실까지 잊는 경우가 있습니다 🤣
    • @dj29 — 솔직히 이제는 별로 놀랍지도 않습니다. 안타깝게도 AI 도구를 지나치게 사용하거나 활용하는 사람들은 생각하는 일을 외주 주고, 자신이 살아 있다는 사실까지 잊는 경우가 있습니다 🤣 최근 온라인에서 어떤 사람이 AI 플랫폼을 열 수 없는 상황에 대비해 자기 뇌 안에 AI를 만들었다고 설명하는 걸 봤습니다. 그래서 뇌 속 AI에게 어떻게 해야 하는지 묻는다고 하더군요. 저는 ‘방금 생각하는 법을 배운 건가?’ 싶었습니다 🤣
  • @technogamerz — GIF 웃기네요 xD 좋은 글입니다, Dhruv :D
    • @dj29 — 고마워요 😄
  • @francistrdev — 저는 그냥 여러 AI 모델을 오갑니다. 특정 작업에 특정 모델을 고정해 두지는 않았습니다. 코드를 작성하기보다는 필요한 정보를 찾는 좋은 검색 도구로 AI를 쓰는 편입니다. AI에 코딩을 너무 의존하면 문제를 풀 때 비판적으로 생각하는 능력이 줄어들기 때문입니다. 무엇이든 너무 많이 하지도, 너무 적게 하지도 않는 방식이 좋은 방법이라고 생각합니다.
    • @dj29 — 네, 저희도 그렇습니다. 캠퍼스 채용 시즌이 시작됐기 때문에 코딩에는 AI를 쓰지 않습니다. 다만 학생으로서 해킹 대회에서는 사용합니다. 그곳의 목표는 전반적으로 좋은 결과를 내는 일이니까요. 자세한 글 고맙습니다. 그런데 좋은 GIF와 이미지는 어디서 찾으시나요? 그냥 궁금합니다 😅
    • @francistrdev — 별말씀을요! 이미지와 GIF는 인터넷, 정확히는 Google에서 검색합니다. 특별한 방법은 없습니다 :)
  • @sizzlebop — 정말 공감합니다. 저도 의식적으로 정하지 않았는데 분명히 ‘진지한 작업용’ AI와 ‘그냥 써보는’ AI가 있습니다. 복잡한 계획을 세우거나 이상한 문제를 디버깅하거나, 추론과 세부 사항이 정말 중요한 작업에서는 보통 Claude Opus를 진지한 작업용 모델로 씁니다. 작은 변경, 실험, 빠른 아이디어, 대충 어떤 일이 일어나는지 찔러보는 작업에는 Antigravity와 Gemini 3.8 Flash를 사용합니다. 문서 작성이나 자주 반복하는 작은 수정처럼 유난히 특정한 작업에는 Codex와 GPT-5.6 Sol을 씁니다. 제 경험상 그런 종류의 작업에서는 Codex의 기억력이 가장 좋습니다. 같은 문제가 다시 생기면 이미 무슨 뜻인지 알고 있는 것처럼 고쳐 달라고 요청할 수 있습니다. 반복 작업에는 정말 유용합니다. 이런 일이 생기는 이유도 잘 짚었다고 생각합니다. 항상 기술적으로 가장 좋은 모델을 고르는 것은 아닙니다. 어떤 모델을 어떤 작업에서 믿을 수 있는지, 어느 정도로 빠른지, 사용량이 충분한지, 솔직히 특정 작업에서 어느 모델이 가장 덜 귀찮은지를 배우게 됩니다. 어느 순간 자신도 모르게 자기만의 AI 라우터가 됩니다.
  • @kyisaiah47 — Gemini가 계산 문제의 답을 내놓았을 때 이제 다시 확인하지 않는다고 했는데, 그때 어떤 검증 기준을 사용하나요?
  • @unitbuilds — 사소한 질문에는 Gemini를 씁니다. 웹 인터페이스가 예전 질문을 다시 찾기에 좋습니다. 대량 작업에는 Qwen 3.8 Flash(qoder efficient)를 쓰고, 진지한 사고에는 Qwen 3.8 Max를 씁니다. Qwen의 작업을 다시 확인할 때는 Gemini Pro를 사용하고, 정말 망치지 않았는지 확실히 확인해야 할 때는 Claude Opus를 씁니다. 다만 대부분의 경우 저는 Opus보다 Qwen을 더 믿습니다. 이유는 모르겠지만 제게는 3.8 Flash가 더 ‘똑똑하게’ 생각하는 것처럼 느껴집니다. Opus보다 먼저 추가 최적화를 하고, 제 생각에는 더 나은 설계 원칙을 고수합니다.

원문: dev.to / 번역·요약: Trawling