GitHub

trycua/cua — Scale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.

trycua/cua — 오픈소스 드라이버, 크로스 OS Fleet, 벤치마크로 Computer-Use 2.0 확장하기

Cua는 AI 에이전트가 Linux·macOS·Windows의 데스크톱 애플리케이션과 브라우저를 조작하도록 하는 오픈소스 도구 모음입니다. 격리된 클라우드 데스크톱, 로컬 macOS VM, 에이전트 평가·학습용 Cua-Bench를 함께 제공합니다.

주제
AI개발 도구시스템

AI 요약

Cua는 AI 에이전트가 코드와 API뿐 아니라 그래픽 사용자 인터페이스(GUI)까지 하나의 작업 흐름 안에서 다루도록 컴퓨터와 자동화 도구를 제공하는 오픈소스 프로젝트입니다. 프로젝트가 말하는 “Computer-Use 2.0”은 에이전트가 동일한 작업에서 코드, API, 그래픽 인터페이스 사이를 오가는 사용 방식을 가리킵니다. 사용자는 에이전트와 모델을 준비하고, Cua는 에이전트가 실제로 조작할 컴퓨터와 실행·검증·스크린샷 수집 수단을 제공합니다.

■ Cua Fleets와 Sandbox SDK

Cua Fleets는 격리된 클라우드 데스크톱을 미리 확보해 두는 방식입니다. 사용자의 코드가 풀(pool)에서 데스크톱을 가져온 뒤 Sandbox SDK를 통해 내부에서 명령을 실행하고, 스크린샷을 저장하며, 애플리케이션과 상호작용할 수 있습니다. 가장 간단한 시작 흐름은 Linux 데스크톱을 프로비저닝하고, `uname -a`를 실행하고, 결과 스크린샷을 저장한 다음 클라우드 리소스를 삭제하는 것입니다. 첫 튜토리얼은 Fleet 인증 정보, 의존성 설치, 정리(cleanup) 절차를 다룹니다.

Fleet은 클레임이 끝난 뒤에도 유료 용량을 유지할 수 있으므로, 문서에 안내된 정리 단계를 따라야 합니다. 로컬 샌드박스와 Fleet은 같은 Sandbox SDK를 공유하지만, 인증 정보·이미지·지원 작업·런타임 요구 사항은 서로 다릅니다. 따라서 프로젝트는 환경을 선택할 때 runtime support reference를 확인하고, 자체 하드웨어를 사용할 경우 local sandbox lifecycle 관리 문서를 참고하도록 안내합니다.

■ Cua Driver로 네이티브 앱과 브라우저 조작

Cua Driver는 macOS, Windows, Linux에서 네이티브 데스크톱 애플리케이션과 브라우저를 검사하고 조작할 수 있는 에이전트 도구를 제공합니다. CLI, MCP(Model Context Protocol), typed SDK를 통해 연결할 수 있으며, 애플리케이션과 플랫폼이 지원하는 경우 에이전트가 포인터를 움직이거나 현재 포커스를 빼앗지 않고 작업하도록 하는 background delivery도 제공합니다. 다만 이 기능의 지원 범위와 제약은 플랫폼별로 다르므로 platform support 문서를 확인해야 합니다.

제공된 첫 실습은 Calculator를 열고 에이전트에게 `6 × 7`을 계산하게 한 다음, 애플리케이션에 `42`가 표시되는지 검증하는 과정입니다. 실습에는 플랫폼 설정, 권한 승인, 에이전트 연결이 포함됩니다. 설치 명령은 macOS와 Linux에서 `curl`을 이용한 셸 스크립트 방식이며, Windows에서는 PowerShell의 `irm ... | iex` 명령을 사용합니다. 프로젝트 데모에서는 Omarchy 데스크톱에서 두 개의 Cua Driver 세션이 LibreOffice Calc의 셀과 Inkscape의 객체를 선택하고, 터미널은 전경에 유지합니다. 해당 데모의 길이는 50초입니다.

■ Lume로 로컬 macOS·Linux VM 관리

Lume은 Apple Silicon에서 Apple의 Virtualization.Framework를 사용해 로컬 macOS와 Linux VM을 생성하고 관리하는 도구입니다. 문서의 첫 실습에서는 Apple restore image로 기본 macOS Tahoe VM을 만들고 시작한 뒤 SSH로 연결합니다. 이 과정은 Lume CLI를 직접 사용하며, unattended setup의 기본값도 설명합니다. 설치는 별도의 `cua.ai/lume/install.sh` 스크립트로 진행합니다. 즉 Cua는 클라우드 Fleet만 제공하는 것이 아니라, 지원되는 자체 하드웨어에서 실행할 수 있는 로컬 VM 경로도 함께 제공합니다.

■ Cua-Bench로 작업·평가·학습 데이터 구성

Cua-Bench는 컴퓨터 사용 작업을 만들고 에이전트를 평가하며, 학습에 활용할 수 있는 trajectory를 내보내기 위한 구성 요소입니다. 첫 단계에서는 VM, Docker, 모델 API key 없이 실행할 수 있는 simulated task를 사용합니다. Python 3.12 또는 3.13과 `uv`가 설치된 환경에서 `uv tool install 'cua-bench[browser]'`를 실행하고, 이어 `uv tool run --from 'cua-bench[browser]' playwright install chromium`으로 Chromium을 설치합니다.

이후 작은 작업을 만들고 reference solution을 실행한 뒤 evaluator가 reward `1.0`을 보고하는지 확인합니다. 같은 작업을 직접 실행해 결과를 비교할 수도 있습니다. 따라서 Cua-Bench의 시작점은 실제 VM이나 특정 모델에 의존하지 않는 시뮬레이션이며, 작업 정의·정답 실행·평가 결과 확인·trajectory 내보내기라는 흐름으로 구성됩니다.

■ 통합·라이선스·재현성

프로젝트는 Claude Code, Codex, Cursor, OpenClaw 등 다른 에이전트와의 통합 안내를 제공하며, 소스 문서와 아키텍처 설명은 `libs/cua-driver/README.md`에서 확인할 수 있다고 안내합니다. 연구에 Cua를 사용한 경우에는 Cua AI, Inc.를 저자로 하는 2025년 소프트웨어 인용 정보를 사용하고, 재현성을 위해 사용한 Cua release 또는 commit을 함께 기록하도록 요구합니다. 프로젝트 자체는 MIT License를 따르지만, 서드파티 구성 요소는 별도 라이선스를 가집니다. 예를 들어 Kasm은 MIT, OmniParser는 CC-BY-4.0이며, 선택적 `cua-agent[omni]`에는 AGPL-3.0인 ultralytics가 포함될 수 있습니다.

원문: GitHub / 번역·요약: Trawling