Sai — The autonomous computer fleet at your command
Sai — 명령대로 움직이는 자율 컴퓨터 fleet
Sai는 웹 브라우저뿐 아니라 레거시 데스크톱 앱과 사내 포털까지 실제 컴퓨터 화면으로 조작하는 AI 비서입니다. 여러 클라우드 컴퓨터를 동시에 실행하고 작업을 저장·예약하며, OSWorld 2.0에서 73%의 점수와 작업당 15.70달러 비용을 기록했다고 소개합니다.
- 주제
AI 요약
Simular의 Sai는 여러 대의 자율 컴퓨터를 묶어 반복적인 화면 작업을 맡기는 robosecretary입니다. 채팅창에서 답만 생성하는 방식이 아니라 실제 데스크톱을 열고 화면을 읽은 뒤 버튼을 클릭하고 입력란에 값을 입력합니다. API가 없는 레거시 데스크톱 앱, 사내 포털, 로그인 뒤에 있는 서비스도 인터페이스 계층에서 다룹니다. Windows, macOS, Linux를 지원한다고 소개하며, 작업 중에는 사용자가 실행 화면을 확인하거나 마우스를 직접 되찾을 수 있습니다.
작업 저장과 컴퓨터 fleet 운영
사용자가 작업을 맡기면 필요한 수만큼 클라우드 컴퓨터를 깨워 앱을 실행합니다. 완료한 작업은 skill로 저장해 다시 실행하거나 예약하고 이벤트로 호출할 수 있습니다. Simular의 엔지니어링 리드에 따르면 지난 6개월은 컴퓨터가 절전 상태에 들어가거나 재시작·업데이트되는 상황에서도 작업을 이어 가는 fleet 운영에 집중했습니다. 작업 중간에 컴퓨터를 복구하고, 두 agent가 같은 컴퓨터를 동시에 점유하지 않도록 조정하는 방식입니다.
화면을 매번 원본 스크린샷 그대로 모델에 보내지 않도록 Smart Snapshot을 사용합니다. 화면에 있는 정보를 더 적은 token으로 읽으면서 정확도를 유지하는 방법이며, 회사는 비용 절감의 대부분이 여기서 나온다고 설명합니다. 비밀번호와 인증 코드는 암호화된 입력으로 처리해 모델이 평문을 보지 않게 하고, 승인 단계를 나누거나 특정 작업에 한해 신뢰하도록 설정할 수 있습니다.
화면 변경에 대한 적응
Sai는 고정된 화면 좌표를 그대로 재생하지 않습니다. 현재 화면을 관찰해 UI 요소를 역할과 주변 맥락으로 식별하고, 각 동작 뒤에 화면을 다시 확인합니다. 앱 업데이트로 버튼 위치가 조금 바뀌면 새 화면을 읽어 계속 진행하고, 흐름이 크게 달라졌다면 새 계획을 세웁니다. 확신이 부족한 상태에서는 임의로 클릭하지 않고 멈춰 사용자에게 도움을 요청한다고 합니다.
작업 전체를 결정적으로 고정하는 방식도 아닙니다. 안정적인 단계는 재생하고, 각 동작의 의도를 기록해 양식에 새 필드가 생기면 현재 페이지에 맞춰 대응합니다. 작업 맥락에 없는 정보를 요구하면 추측하지 않고 멈춥니다. 제출 결과도 다시 확인해 반복 실행의 속도와 agent 판단을 함께 사용한다고 설명합니다.
성능과 비용
Simular가 제시한 공개 지표는 OSWorld 2.0 73%입니다. 댓글에서 회사는 Claude Opus 5의 70.6%, GPT-5.6 Sol의 62.6%보다 높은 점수라고 밝혔습니다. 작업당 비용은 Sai 15.70달러, Claude Opus 5 23.70달러, GPT-5.6 Sol 26.62달러로 제시했습니다. 회사는 이 비용 수준까지 낮춘 덕분에 무료 요금제를 제공할 수 있었다고 설명합니다. 다만 예약이나 양식 입력처럼 특정 작업 유형별 정확도는 아직 공개하지 않았으며, 웹사이트와 작업에 제공된 정보량에 따라 결과가 달라진다고 답했습니다.
사용 중 보고된 제한
한 체험자는 처음에는 macOS만 지원하는 점에 실망했고, 이후 클라우드 컴퓨터에서 자율 실행을 시험했습니다. 논리적인 문제 해결 과정은 관찰했지만 검색창에 중국어를 입력하지 못했고 Google 검색의 사람 인증 CAPTCHA도 처리하지 못했다고 전했습니다. 본문에는 동작별 편집 가능한 결정적 코드가 투명성과 사용자 지정을 돕지만, 비기술 사용자에게는 코드 중심 편집 화면이 어렵게 느껴질 수 있다는 평가도 있습니다. 코드 화면과 함께 시각적인 drag-and-drop 편집기를 제공하자는 제안이 나왔습니다.
Product Hunt 반응
- @agidude — Product Hunt 여러분, 안녕하세요. 저는 Ang이고 Simular에서 Sai를 만들고 있습니다. Sai는 끝없는 화면 작업을 처리하는 자율 컴퓨터 fleet와 함께 작동하는 세계 최초의 robosecretary입니다. 미래의 업무는 컴퓨터 한 대가 아니라 여러 대의 컴퓨터라고 생각합니다. 각 컴퓨터는 사람이 하듯 소프트웨어를 탐색합니다. 화면을 읽고, 버튼을 클릭하고, 양식에 입력합니다. 이것이 Sai의 전부입니다. Sai는 인터페이스 계층에서 작동하므로 API가 없고 앞으로도 생기지 않을 레거시 데스크톱 앱, 사내 포털, 로그인 뒤의 모든 것을 자동화합니다. Windows, macOS, Linux를 지원합니다. OSWorld 점수는 73%입니다. 실제로 얻는 것은 다음과 같습니다. 채팅창이 아니라 실제 컴퓨터입니다. 작업을 맡기면 실제 데스크톱에서 실행하고, 언제든 workspace를 열어 지켜보거나 실행 중간에 마우스를 되찾을 수 있습니다. 한 번 작업 경로를 학습하면 완료한 작업을 skill로 저장하고 예약하거나 이벤트로 실행할 수 있습니다. 그래서 열 번째 실행은 첫 번째 실행보다 빠르고 저렴합니다. 안전장치가 있는 자율성도 제공합니다. 승인 단계를 나누고, 특정 작업에 신뢰를 부여하며, 비밀번호와 코드는 암호화해 입력합니다. 모델은 평문을 보지 않습니다. 우리가 실제로 최적화하는 대상은 열 번째로 요청했을 때도 유용하고 감당 가능한가입니다. 일주일을 잡아먹는 화면 작업을 알려주시면 Sai가 맡을 수 있는지 솔직하게 말씀드리겠습니다.
- @new_user___2622026ae45f6a6f9a320ac — 앱 업데이트 뒤 화면 배치가 바뀌면 Sai는 workflow를 어떻게 처리하나요?
- @chenchen_sun1 — 좋은 질문입니다. Sai는 고정된 화면 좌표에 의존하지 않습니다. 현재 화면을 관찰하고 관련 UI 요소를 식별한 뒤 각 동작 이후 이해를 갱신합니다. 그래서 작은 배치 변경은 보통 workflow를 깨뜨리지 않습니다. 크게 개편되면 새 화면에서 다시 계획을 세우려고 합니다. 확신을 갖고 계속할 수 없으면 무작정 클릭하지 않고 멈춰 도움을 요청합니다.
- @chenchen_sun1 — 저는 Simular에서 Sai의 engineering lead를 맡고 있는 Chenchen입니다. 제 일은 데모가 끝난 뒤에도 Sai가 계속 작동하게 만드는 것입니다. 지금까지 본 AI agent 대부분은 한 대의 컴퓨터에서, 순조로운 하나의 경로로, 영상 속에서만 실행됩니다. Sai는 실제 클라우드 컴퓨터 fleet에서 실행됩니다. 작업 다섯 개를 맡기면 컴퓨터 다섯 대가 깨어나 앱을 열고 화면을 읽고 클릭하고 입력한 뒤 결과를 확인합니다. 이것이 제품입니다. 동시에 가장 어려운 부분이기도 합니다. 지난 6개월 동안 실제로 집중한 일은 fleet 규모의 안정성이었습니다. 컴퓨터는 절전 상태에 들어가고 재시작하며 업데이트됩니다. 모든 것이 정상일 때만 작동하는 agent는 쓸모가 없습니다. Sai는 필요할 때 컴퓨터를 깨우고, 작업 중간에 복구하며, 두 agent가 같은 컴퓨터를 잡지 않도록 해야 합니다. 화면을 효율적으로 보는 일도 필요합니다. Sai는 Smart Snapshot을 사용합니다. 원본 스크린샷보다 훨씬 적은 token으로 화면을 읽으면서 정확도를 잃지 않습니다. 비용 절감의 대부분이 여기서 나옵니다. 화면 조작 agent는 기본적으로 비쌉니다. 무료 요금제를 제공할 수 있을 정도로 비용을 낮췄습니다. 제가 중요하게 보는 수치는 OSWorld 2.0입니다. Sai는 73%를 기록했고 Claude Opus 5의 70.6%, GPT-5.6 Sol의 62.6%보다 높았습니다. 작업당 비용은 각각 15.70달러, 23.70달러, 26.62달러입니다. 공개 benchmark이며, 무료 요금제를 가능하게 만든 요소는 비용입니다. Sai는 정식 출시 전 6개월 동안 실제 사용자 환경에서 운영됐습니다. 대규모 agent 운영에 관해 무엇이든 질문해 주세요. 오늘 하루 여기 있겠습니다.
- @vshashkov — 축하합니다, Simular 팀. form이 바뀌어 다른 값을 입력해야 할 때도 생각하는 부분을 유지하면서 모든 실행을 어떻게 결정적으로 보장하나요? 매일 수백 개의 웹사이트 form을 작성해야 하고 form은 매달 바뀌는 상황을 생각하고 있습니다.
- @chenchen_sun1 — 감사합니다. 전체 실행을 결정적으로 고정하지는 않습니다. Sai는 가능한 경우 안정적인 단계를 재생하지만, 고정 좌표가 아니라 각 동작의 의도를 기록합니다. form이 바뀌면 현재 페이지를 읽고 적응합니다. 예를 들어 새 필수 필드를 식별하고 현재 작업 맥락에서 얻을 수 있는 값으로 채울 수 있습니다. 새 필드에 Sai가 갖고 있지 않은 정보가 필요하면 추측하지 않고 멈춰 질문합니다. 제출 결과도 확인합니다. 필요한 곳에서만 agent의 판단을 사용하면서 재생 속도를 얻는 방식입니다.
- @lihautan — 저는 Simular의 엔지니어 Li Hau입니다. 사람 한 명이 앉아 클릭할 것이라고 가정하는 앱을 만드는 일을 수년간 했습니다. 그러다 사람들이 실제로 일하는 모습을 봤습니다. 열두 개의 탭과 세 개의 앱을 오가며 하루 종일 한 곳의 값을 다른 곳으로 복사합니다. 인터페이스가 제품이었던 적은 없습니다. 작업이 제품이었습니다. 그래서 robosecretary인 Sai를 만들었고, 자율 컴퓨터 fleet를 제공했습니다. 각 컴퓨터는 명령을 실행하고 앱을 탐색하며 자기 작업을 확인합니다. 컴퓨터에서 할 수 있는 일은 Sai의 컴퓨터에서도 할 수 있습니다. 가장 어렵고 흥미로운 부분은 agent 하나가 아니었습니다. 여러 자율 컴퓨터를 병렬로 실행하면서 서로 조율하고 복구하며 실제로 무엇을 했는지 정직하게 기록하는 일이 대부분의 엔지니어링을 차지했습니다. 하루 종일 여기 있겠습니다. 특히 실패 사례에 관해 이야기하고 싶습니다.
- @agidude — 출발합니다!
- @peng_wood — 흥미롭습니다. Codex나 Manus와는 어떻게 다른가요?
- @agidude — Codex는 사용자의 컴퓨터에서 실행되고 Manus는 클라우드 브라우저에서 실행됩니다. Sai는 전체 데스크톱을 갖춘 클라우드 컴퓨터 fleet에서 실행됩니다. 그 안에서 Codex를 직접 실행할 수도 있습니다.
- @boyuan_deng1 — 앱이 업데이트되어 버튼 위치가 바뀌면 어떻게 되나요? 깨지나요, 아니면 적응하나요?
- @chenchen_sun1 — 보통은 적응합니다. Sai는 고정 좌표가 아니라 역할과 맥락으로 버튼을 식별하면서 현재 화면을 읽습니다. 각 동작 뒤에 화면도 다시 확인합니다. 업데이트가 흐름을 완전히 바꾸거나 모호한 상황을 만들면 다시 계획을 세우거나 도움을 요청하며 무작정 클릭하지 않습니다.
- @mikkellarsen — booking이나 form 작성처럼 일반적인 작업의 정확도 benchmark가 있나요?
- @chenchen_sun1 — 현재 공개한 주요 benchmark는 OSWorld 2.0이며 실제 computer-use 작업 전반에서 Sai는 73%를 기록했습니다. booking이나 form 작성만 따로 분리한 정확도 수치는 아직 공개하지 않았습니다. 결과는 웹사이트와 작업에 제공된 정보의 양에 크게 좌우됩니다. category별 데이터를 수집하고 있으며 더 자세한 benchmark를 공유할 계획입니다.
- @jiachenyang — 좋은 답변 감사합니다. 전통적인 drag-and-drop 시각 편집기도 작동하지 않을 수 있습니다. Simular Pro가 API 연동이 없는 UI 작업의 긴 꼬리까지 다루기 때문에 선택지의 집합이 제한되지 않기 때문입니다. 다만 미래 버전의 Simular Pro에서는 사용자가 자연어로만 지시하면서도 코드가 주는 신뢰성과 반복성을 유지하는 방식은 가능하다고 봅니다. 그 단계까지 가겠습니다.
원문: Product Hunt / 번역·요약: Trawling