Show HN: Giving Opus 5.5 a simulated paint canvas
Show HN: Opus 5.5에 유화 시뮬레이션 캔버스를 맡겼습니다
AI 모델이 유화 물감과 붓을 흉내 내는 시뮬레이터에서 직접 그림을 그리는 실험입니다. 이미지 생성 모델 대신 프로그램을 작성하게 하고, 캔버스를 확인하며 여러 차례 작업하도록 구성했습니다. 여러 모델이 반복해서 비슷한 소재와 구도를 고르는 현상도 관찰했습니다.
- 주제
AI 요약
Trawling의 프로젝트는 AI 모델에 그림을 한 번에 생성하게 하지 않습니다. 모델이 유화 물감 시뮬레이터를 조작하는 프로그램을 작성해 캔버스에 붓질합니다. 별도의 이미지 생성 모델은 쓰지 않습니다. 시뮬레이터는 아마씨유 물감이 린넨 캔버스 위에서 번지고 마르는 과정, 붓털에 묻은 젖은 물감, 여러 겹의 글레이즈를 구현합니다. 물감은 이름이 붙은 튜브에서 팔레트로 덜어 섞습니다.
가상 이젤에서 한 번씩 그리기
작업 가운데 75점 중 46점은 가상 이젤에서 그렸습니다. 모델은 그림을 한 번에 완성하는 대신 조금씩 그린 뒤 결과를 살펴보고 다음 작업을 이어갑니다. 모델마다 그림을 확인할 때 쓸 수 있는 도구가 있으며, 작업 일지를 쓰고 스튜디오 노트를 읽을 수도 있습니다. 초기 라운드에는 명령줄도 있었지만 Gemini 3.8 Flash가 이를 이용해 실행 중인 프로그램을 살펴본 뒤로, 19라운드부터는 이젤 도구만 제공합니다.
대부분의 모델은 카스파르 다비트 프리드리히(Caspar David Friedrich)에 관한 글을 읽고 그림을 그렸습니다. 그의 작품 이미지는 보여주지 않았습니다. 일부 라운드에서는 자유 주제를 줬습니다. 모델마다 전체 그림을 만드는 프로그램을 한 번에 작성하거나, 이젤 앞에서 여러 차례 작업하는 방식이 달랐습니다.
반복해서 고른 소재와 장면
자유 주제를 고르게 한 실험에서는 클로드 오퍼스(Claude Opus)가 그림 작업 계획만 요청받고도 여섯 번 모두 주전자와 레몬을 골랐습니다. 16라운드 마지막까지 작업을 마친 모델 중에는 Claude Opus 한 개와 Gemini 두 개가 모두 선반 위 주전자를 그렸습니다. 18라운드에서는 여섯 모델 중 세 모델이 주전자나 병을 레몬 옆에 놓았습니다.
프리드리히를 주제로 한 19라운드에서는 모델 여섯 개가 각각 혼자, 최대 네 번의 작업으로 그림을 그렸습니다. 여섯 그림 모두에 앙상한 나무가 등장했습니다. 제목이 있는 그림 65점 가운데 31점에는 ‘저녁’, ‘황혼’, ‘땅거미’, ‘일몰’을 뜻하는 단어가 들어갔습니다. 프리드리히의 작품에는 대낮 풍경도 있지만, 모델들은 저녁 장면을 자주 선택했습니다.
서로의 그림이나 주제 메모를 보지 않은 모델들이 비슷한 장면을 고르기도 했습니다. 여섯 시간 간격으로 작업한 두 모델은 모두 여성이 물가에 서 있고 낚싯대와 바위, 배가 놓인 발트해 풍경을 그렸습니다. 한 그림은 해 질 무렵, 다른 그림은 동틀 무렵이었습니다. 16라운드의 겨울 풍경 두 점에는 ‘눈 내린 저녁의 고인돌’이라는 같은 제목이 붙었습니다.
관찰 도구의 오류와 실험 조건
미모(MiMo) v2.6 Pro에는 한 대화에 이미지가 다섯 장 이상 들어가면 최신 이미지 대신 이전 이미지 내용을 답하는 버그가 있습니다. 18라운드에서 모델은 캔버스 확인 이미지를 158장 남겼고, 그중 147장은 다섯 번째 확인 이후에 나왔습니다. 따라서 작업 대부분에서 최신 그림이 아니라 예전 상태를 보고 판단했을 가능성이 있습니다. 프로젝트는 이후 모델이 볼 수 있는 이미지를 가장 최근 네 장으로 제한했습니다.
커뮤니티에서는 모델이 어떻게 그림을 그리는지, 시뮬레이터와 이미지 확인 도구가 결과에 어떤 영향을 주는지 질문이 나왔습니다. 제작자는 모델이 붓과 물감 도구를 프로그램으로 조작하고, 작업 중 캔버스를 확인한다고 설명합니다. 일부 댓글은 결과물이 모델의 능력만 보여주는지, 사람의 프롬프트와 선별 기준도 함께 반영하는지 짚었습니다. 작품의 완성도와 AI 미술의 노동·윤리 문제를 둘러싼 의견도 엇갈렸습니다.
Hacker News 반응
- @BobbyTables2 — Opus는 실제로 어떻게 그림을 그리나요? 텍스트만 생성하는 줄 알았습니다.
- @llagerlof — 마우스를 움직이고 그림 도구를 쓰도록 명령과 좌표를 생성합니다.
- @vunderba — LOGO 프로그래밍 언어의 터틀 그래픽을 떠올리면 됩니다. LLM에 가상 캔버스와 펜을 움직이는 명령을 주는 방식입니다.
- @qlte — 이미지 모델은 쓰지 않고 프리드리히 그림도 모델에게 보여주지 않았습니다. 그림은 전부 AI 모델이 작성한 프로그램입니다. 물리적인 유화 시뮬레이터는 Rust로 만들었고, 붓털이 젖은 물감을 바탕칠한 린넨 위로 옮깁니다. 물감은 시간이 지나며 평평해지고 마르며, 층은 Kubelka–Munk 광학으로 합쳐집니다.
- @davidcollantes — 캔버스가 마음에 듭니다. 이 결과에 도달하려고 제작자가 사용한 구체적인 과정을 더 알고 싶습니다. Surya의 ‘Training AI to Paint with Code’는 읽었는데 Alice의 방식은 어떤가요?
- @cronin101 — 정말 인상적이면서도 묘하게 불편합니다. 풍경 대부분이 서로 말이 안 될 정도로 가까이 모여 있는 교회 무리 때문에 망가집니다.
- @bel8 — 예술이라면 꼭 말이 되어야 하는 건 아닙니다.
- @dcre — 사이트만 보면 모델이 작업 중 이미지를 보는지 분명하지 않습니다. 코드에는 모델이 호출할 수 있는 ‘look’ 도구가 있습니다. 이미지도 보지 않고 이 정도로 그린다면 놀랐을 것 같습니다.
- @SwellJoe — SVG를 요청하면 이미지를 보지 않고도 그립니다. 요청한 대상과 비슷하게 나올 때도 있습니다. 하지만 claude-paint를 써보니 그리는 중간에 결과를 살펴보고 이어서 작업하면서 점점 나아지는 게 보입니다.
- @threethirtytwo — 붓질로 사람처럼 그림을 만드는 훈련 데이터가 직접 있었다고 보기는 어렵습니다. 관련 없는 훈련 데이터에서 그림 능력이 나타났다면 LLM이 실제로 지능적이라는 점을 보여주는 꽤 설득력 있는 증거 같습니다.
- @hdjrudni — 사람이 그림을 그리는 영상은 훈련 데이터에 들어갔을 수 있습니다. 붓질 장면은 영상으로 많이 접했을 테니까요.
- @threethirtytwo — 영상의 픽셀 정보를 실제 붓질로 바꾸는 일은 간단하지 않습니다. 밥 로스 영상을 300번 본다고 그림 그리는 법을 배우는 건 아니니까요.
- @dangoodmanUT — 정말 좋은 아이디어입니다. 벤치마크로 만드는 방법은 모르겠지만, 만들어야 합니다. 실시간 방송도 좋겠습니다.
- @mvkel — 정말 훌륭합니다. 20년 동안 취미로 그림을 그렸는데 캔버스를 망칠 걱정 없이 새로운 기법을 시도하고 싶었습니다. 이 방식이면 위험 부담을 줄이고 무언가 배울 수 있겠습니다.
- @Individuum — 모델들이 작업하는 모습을 실시간으로 보는 재미가 있습니다. 그림 한 점마다 토큰 비용이 얼마나 드나요?
원문: Hacker News / 번역·요약: Trawling