테마 전환

Computer-Use Agent: AI가 컴퓨터를 직접 조작하는 시대

Easton editorial illustration: durable queue station

Claude 3.5 Sonnet은 Computer Use 기능을 제공한 최초의 최첨단 모델입니다. OSWorld 벤치마크에서 14.9%를 기록해 2위보다 두 배 가까이 높은 성능을 보였습니다. 화면을 보고 마우스를 움직이며 버튼을 클릭하고 양식을 작성하는 등 사람이 컴퓨터를 다루듯 작업할 수 있습니다. 미리 정해진 스크립트를 실행하는 RPA와 달리, AI가 화면 내용을 이해한 뒤 동적으로 판단하므로 UI가 바뀌어도 스스로 대응합니다.

Computer-Use Agent는 세 가지 핵심 도구로 작동합니다. Computer Tool은 마우스와 키보드를 제어하고, Text Editor는 파일을 다루며, Bash Tool은 시스템 명령을 실행합니다. 이 글에서는 작동 원리부터 실전까지 Docker 배포 방법, 코드 예제, 경쟁 제품 분석, 보안 모범 사례를 모두 살펴봅니다. 핵심 원칙은 분명합니다. 반드시 샌드박스 환경에서 실행하고, AI가 주로 사용하는 컴퓨터를 직접 조작하게 해서는 안 됩니다.

Computer-Use Agent란 무엇인가

간단히 말해 Computer-Use Agent는 컴퓨터를 직접 조작할 수 있는 AI입니다.

기존 AI는 ‘말’만 할 수 있었습니다. 질문하면 답을 주는 방식이었습니다. 하지만 Computer-Use Agent는 ‘행동’할 수 있습니다. 작업을 지시하면 화면을 보고 키보드와 마우스를 조작해 실제로 일을 마칩니다.

예를 들어 “이 Excel 스프레드시트의 데이터를 저 웹 양식에 입력해 줘”라고 요청하면 다음과 같이 작업합니다.

  1. Excel을 열어 데이터를 읽습니다.
  2. 브라우저에서 대상 웹페이지를 엽니다.
  3. 각 필드에 내용을 입력합니다.
  4. 제출 버튼을 클릭합니다.

사용자가 전 과정에 개입할 필요도, 개발자가 소프트웨어마다 별도의 통합 코드를 작성할 필요도 없습니다.

기존 자동화와의 차이점

이쯤에서 “그렇다면 RPA(Robotic Process Automation)와 같은 것 아닌가?”라는 의문이 들 수 있습니다.

비슷한 면은 있지만 본질은 다릅니다.

RPA는 ‘스크립트’입니다. 작업 순서를 녹화해 두면 그대로 반복합니다. 웹페이지 레이아웃이 바뀌거나 버튼 위치가 달라지면 스크립트가 작동하지 않을 수 있습니다.

Computer-Use Agent는 ‘에이전트’입니다. 화면을 이해하고 현재 상태를 파악하며 변화가 생기면 스스로 대응합니다. 버튼이 왼쪽에서 오른쪽으로 옮겨져도 사람은 눈으로 확인하고 찾을 수 있습니다. Claude도 같은 방식으로 대응합니다.

더 중요한 차이는 RPA에서는 모든 단계를 명확히 작성해야 한다는 점입니다. 반면 Computer-Use Agent에는 ‘무엇을 해야 하는지’만 알려 주면 ‘어떻게 할지’는 스스로 결정합니다.

Claude Computer Use 기술 분석

2024년 10월, Anthropic은 Claude 3.5 Sonnet이 Computer Use 기능을 지원한다고 발표했습니다. 이 기능을 제공한 최초의 최첨단 AI 모델입니다.

작동 원리

전체 흐름은 사람이 컴퓨터를 조작하는 방식과 매우 비슷합니다.

화면 보기 → 내용 분석 → 동작 결정 → 작업 실행 → 피드백에 따라 조정

구체적인 과정은 다음과 같습니다.

  1. 스크린샷 분석: Claude는 현재 화면을 캡처하고 시각 인식 능력으로 텍스트, 버튼, 입력 필드 등의 요소를 식별합니다.

  2. 좌표 매핑: 가장 핵심적인 기술적 진전입니다. 모델은 화면의 시각 요소를 구체적인 픽셀 좌표에 연결하는 법을 학습해야 합니다. 예를 들어 ‘제출 버튼이 좌표 (320, 450)에 있다’고 판단합니다.

  3. 동작 실행: 작업에 따라 Claude가 실행할 동작을 결정합니다. 마우스를 특정 위치로 옮기거나 클릭하고, 텍스트를 입력하거나 페이지를 스크롤합니다.

  4. 피드백 루프: 하나의 동작을 실행한 뒤 다시 화면을 캡처해 무엇이 달라졌는지 확인하고 다음 동작을 결정합니다.

이러한 ‘관찰-결정-행동-피드백’ 순환이 Computer-Use Agent의 핵심 패턴입니다.

세 가지 핵심 도구

Claude의 Computer Use는 세 가지 도구로 구현됩니다.

Computer Tool: 마우스와 키보드 제어

  • 마우스 이동, 클릭, 더블 클릭, 오른쪽 클릭
  • 키보드 입력, 단축키
  • 화면 스크롤

Text Editor Tool: 파일 작업

  • 파일 내용 조회
  • 파일 편집 및 생성
  • 검색 및 바꾸기

Bash Tool: 시스템 명령 실행

  • shell 스크립트 실행
  • 소프트웨어 패키지 설치
  • 시스템 관리 작업

이 세 가지 도구를 함께 사용하면 사람이 컴퓨터에서 수행하는 작업 대부분을 처리할 수 있습니다.

성능

Anthropic이 공개한 데이터에 따르면, AI의 컴퓨터 조작 능력을 평가하는 OSWorld 벤치마크에서 Claude 3.5 Sonnet은 14.9%를 기록했습니다. 수치가 낮아 보일 수 있지만 2위는 7.8%에 불과해 거의 두 배 가까운 차이가 납니다.

웹 자동화 테스트인 WebArena에서도 Claude는 업계 최고 수준의 성능을 달성했습니다.

다만 솔직히 말하면 이 기능은 아직 초기 단계입니다. Anthropic도 조작 속도가 비교적 느리고 때로는 실수하며, 드래그나 확대·축소 같은 정밀 작업을 아직 수행하지 못한다고 인정합니다. 따라서 현재는 샌드박스 환경에서 테스트하는 용도로만 적합합니다.

빠르게 시작하기

이제 이론을 실제 사용으로 옮겨 보겠습니다.

환경 준비

가장 간단한 시작 방법은 공식 Docker 데모를 사용하는 것입니다.

1단계: API Key 발급

  • Anthropic Console에서 계정을 등록합니다.
  • API Key를 생성합니다.
  • 테스트에 사용할 소액의 잔액을 충전합니다.

2단계: Docker 컨테이너 실행

# 환경 변수 설정
export ANTHROPIC_API_KEY="your_key_here"

# 공식 데모 실행
docker run \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -v $HOME/.anthropic:/home/computeruse/.anthropic \
  -p 5900:5900 \
  -p 8501:8501 \
  -p 6080:6080 \
  -p 8080:8080 \
  -it ghcr.io/anthropics/anthropic-quickstarts:computer-use-demo-latest

이 명령은 Ubuntu 데스크톱 환경이 포함된 컨테이너를 실행하고 다음 포트를 노출합니다.

  • 6080: Web VNC(브라우저에서 데스크톱 보기)
  • 5900: VNC
  • 8080: API 인터페이스
  • 8501: Streamlit 인터페이스

3단계: 데스크톱 접속

브라우저에서 http://localhost:6080에 접속하면 Ubuntu 데스크톱 환경이 나타납니다. 이 환경이 Claude가 조작할 ‘컴퓨터’입니다.

첫 번째 작업: 양식 자동 입력

Claude가 양식을 대신 작성하도록 해 보겠습니다.

고객 정보가 담긴 CSV 파일의 내용을 웹 양식에 입력해야 한다고 가정해 보겠습니다. 기존에는 스크립트를 작성하거나 직접 복사해 붙여 넣어야 했지만 이제 Claude에게 맡길 수 있습니다.

Streamlit 인터페이스(http://localhost:8501)를 열고 다음 작업을 입력합니다.

~/data/customers.csv 파일을 열고 그 안의 데이터를 https://example.com/form 양식에 입력해 주세요.
각 레코드에는 이름, 이메일, 전화번호 필드를 입력해야 합니다.

Claude가 작업을 시작하면 VNC 인터페이스에서 진행 과정을 볼 수 있습니다.

  • 먼저 파일 관리자를 엽니다.
  • CSV 파일을 찾습니다.
  • 텍스트 편집기로 파일을 열어 내용을 확인합니다.
  • 브라우저에서 대상 웹페이지에 접속합니다.
  • 각 필드에 내용을 입력합니다.
  • 제출 버튼을 클릭합니다.

전체 과정에는 몇 분이 걸릴 수 있습니다. 사람보다 느린 것은 사실이지만 사용자가 개입할 필요는 없습니다.

고급 활용: 여러 단계로 구성된 워크플로

‘데이터베이스에서 데이터를 내보내고 보고서를 생성한 뒤 이메일로 전송하기’처럼 더 복잡한 작업도 수행할 수 있습니다.

# 개념 예제이며 실제로 사용하려면 구체적인 환경에 맞춰야 합니다.
import anthropic

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-3-5-sonnet-20241022",
    max_tokens=1024,
    tools=[
        {
            "type": "computer_20241022",
            "name": "computer"
        },
        {
            "type": "text_editor_20241022",
            "name": "text_editor"
        },
        {
            "type": "bash_20241022",
            "name": "bash"
        }
    ],
    messages=[
        {
            "role": "user",
            "content": """
            다음 작업을 수행해 주세요.
            1. PostgreSQL 데이터베이스에서 이번 달 판매 데이터를 내보냅니다.
            2. Python으로 막대그래프 보고서를 생성합니다.
            3. 보고서를 PDF로 저장합니다.
            4. [email protected]으로 이메일을 보냅니다.
            """
        }
    ]
)

# Claude 응답 처리
for block in message.content:
    if block.type == "tool_use":
        # 도구 호출 실행
        result = execute_tool(block.name, block.input)
        # 결과를 Claude에 반환
        # ...

이 예제는 API를 통해 Computer Use를 호출하는 방법을 보여 줍니다. 실제 배포에서는 권한 제어, 오류 처리, 보안 경계 등 많은 세부 사항을 추가로 다뤄야 합니다.

경쟁 제품 분석: Anthropic만 개발하는 것은 아니다

Computer-Use Agent는 주목받는 분야로, 여러 기업이 관련 기술을 개발하고 있습니다.

Google Gemini Mariner

Google의 솔루션은 자사 생태계와 긴밀하게 통합되어 있습니다. Gemini는 Chrome 브라우저를 조작하고 Google 서비스(Gmail, Docs, Sheets 등)에 접근할 수 있습니다. Google Workspace와 긴밀하게 연동된다는 장점이 있지만 현재는 비공개 테스트 단계입니다.

Microsoft Copilot Studio

Microsoft는 엔터프라이즈 자동화 분야에서 타고난 강점을 지니고 있습니다. Copilot Studio는 비개발자도 자동화 프로세스를 설정할 수 있는 로우 코드 인터페이스를 제공합니다. 또한 Microsoft가 관리하는 인프라에서 실행되므로 기업이 직접 서버를 구축할 필요가 없습니다.

Amazon Nova Act

Amazon은 Bedrock 플랫폼을 통해 유사한 기능을 제공하며 AWS 생태계와 긴밀하게 통합되어 있습니다. 이미 AWS를 사용하고 있다면 좋은 선택이 될 수 있습니다.

오픈 소스 솔루션

Agent S2와 Open Interpreter 같은 오픈 소스 프로젝트도 이 분야를 탐구하고 있습니다. 제어하기 쉽고 직접 배포할 수 있다는 장점이 있지만 더 많은 기술 역량이 필요합니다.

보안: 가장 중요한 부분

솔직히 AI가 컴퓨터를 조작하도록 허용하는 일에는 상당한 위험이 따릅니다. 파일에 접근하고 시스템 명령을 실행하며, 실수로 중요한 데이터를 삭제할 수도 있습니다. 따라서 보안을 가장 먼저 고려해야 합니다.

반드시 샌드박스 환경에서 실행하기

Claude가 주로 사용하는 컴퓨터를 직접 조작하게 해서는 절대 안 됩니다. Docker 컨테이너나 가상 머신으로 격리해야 합니다.

공식 데모는 기본적으로 컨테이너 안에서 실행되므로 좋은 출발점입니다. 하지만 프로덕션 환경에 연결하려면 다음과 같은 보호 조치가 더 필요합니다.

  • 네트워크 격리(필요한 웹사이트에만 접근 허용)
  • 파일 시스템 제한(지정한 디렉터리에만 접근 허용)
  • API 호출 감사(모든 작업 기록)

권한 제어

모든 작업에 컴퓨터 전체를 제어할 권한이 필요한 것은 아닙니다. 예를 들면 다음과 같습니다.

  • 문서만 처리하는 작업이라면 네트워크 접근을 비활성화할 수 있습니다.
  • 데이터를 읽기만 하는 작업이라면 읽기 전용 모드로 설정할 수 있습니다.

시스템을 설계할 때는 ‘최소 권한 원칙’을 따라야 합니다. Claude가 작업을 완료하는 데 꼭 필요한 최소한의 권한만 부여합니다.

민감한 데이터 처리

Claude가 고객 정보나 재무 데이터 같은 민감한 정보를 처리해야 한다면 특히 주의해야 합니다.

  • API Key를 코드에 직접 작성하지 말고 환경 변수를 사용합니다.
  • 민감한 데이터는 암호화해 저장합니다.
  • 작업 로그에서는 민감한 정보를 제거합니다.
  • 접근 기록을 정기적으로 감사합니다.

Anthropic의 보안 조치

Anthropic은 이 분야에서 여러 안전 조치를 마련했습니다.

  • Computer Use 모델에 안전성 훈련을 적용했습니다.
  • 명시적으로 활성화해야 하는 beta header 방식을 제공합니다.
  • 샌드박스 환경에서 테스트할 것을 권장합니다.
  • 안전성 연구 방법을 공개했습니다.

하지만 최종적인 보안 책임은 사용자에게 있습니다. 자동차 제조사가 에어백을 제공해도 운전자는 안전벨트를 매고 교통법규를 지켜야 하는 것과 같습니다.

향후 전망

Computer-Use Agent는 아직 초기 단계이지만 발전 방향은 분명합니다.

기술은 계속 발전한다

현재의 한계인 느린 조작 속도, 부족한 정확도, 드래그 미지원 문제는 점차 개선될 것입니다. 모델은 더 빠르고 정확해지며 더 복잡한 작업을 처리할 수 있게 될 것입니다.

활용 범위가 넓어진다

간단한 양식 입력에서 복잡한 애플리케이션 간 워크플로까지, 개발 테스트에서 기업 운영까지, 개인 생산성 도구에서 엔터프라이즈 자동화 플랫폼까지 활용 범위는 매우 넓습니다.

개발자에게 미치는 영향

개발자라면 이 흐름을 주목할 필요가 있습니다.

  • RPA 개발자는 스크립트 작성에서 Agent 동작 설계로 역할을 전환해야 할 수 있습니다.
  • 테스트 엔지니어는 AI로 UI 자동화 테스트를 수행할 수 있습니다.
  • 운영 엔지니어는 AI에 점검과 장애 진단을 맡길 수 있습니다.
  • 제품 관리자는 프로세스 자동화 아이디어를 빠르게 검증할 수 있습니다.

산업의 변화

장기적으로 Computer-Use Agent는 우리가 소프트웨어와 상호작용하는 방식을 바꿀 수 있습니다.

  • 소프트웨어마다 조작법을 배울 필요 없이 AI에게 원하는 것을 말하면 됩니다.
  • 프로세스마다 통합 코드를 작성할 필요 없이 AI가 직접 조작합니다.
  • 컴퓨터 앞에 앉아 반복 작업을 할 필요 없이 AI에게 맡길 수 있습니다.

물론 시간이 필요합니다. 하지만 변화는 이미 시작됐습니다.

마무리

Computer-Use Agent는 AI가 ‘대화형 도우미’에서 ‘행동하는 주체’로 진화하고 있음을 보여 줍니다. 화면을 이해하고 인터페이스를 조작해 작업을 완료하는 모습은 사람이 컴퓨터를 사용하는 방식과 비슷합니다.

개발자라면 깊이 탐구할 가치가 있는 분야입니다.

  • 기술 측면에서는 작동 원리와 구현 방식을 이해해야 합니다.
  • 실무 측면에서는 안전한 환경에서 테스트하고 검증해야 합니다.
  • 활용 측면에서는 어떤 상황에 적용할 수 있고 어떻게 사용할지 고민해야 합니다.

두 가지를 기억하세요.

  1. 보안이 최우선입니다. 항상 샌드박스 환경에서 테스트하세요.
  2. 계속 주목하세요. 이 분야는 빠르게 변하고 있습니다.

더 자세히 알아보고 싶다면 다음 자료를 참고하세요.

다음에 또 반복적인 컴퓨터 작업으로 지칠 때 떠올려 보세요. 어쩌면 AI에게 맡길 수 있을지도 모릅니다.

FAQ

Computer-Use Agent와 기존 RPA의 차이점은 무엇인가요?
핵심 차이는 유연성과 적응성입니다.

• RPA는 미리 작성된 스크립트이므로 UI가 바뀌면 작동하지 않을 수 있습니다.
• Computer-Use Agent는 화면을 이해하고 변화에 자동으로 적응할 수 있습니다.
• RPA는 모든 단계를 정의해야 하지만 Claude에는 목표만 알려 주면 됩니다.
• Computer Use는 표준화하기 어려운 복잡한 상황에 더 적합합니다.
Claude Computer Use의 성능은 어느 정도인가요?
OSWorld 벤치마크에서 14.9%를 기록해 2위보다 두 배 가까이 높은 성능을 보였습니다. 다만 아직 초기 단계라 조작이 느리고 드래그나 확대·축소 같은 정밀 작업은 지원하지 않습니다. 샌드박스 테스트에는 적합하지만 프로덕션 환경에서 직접 사용하는 것은 권장하지 않습니다.
Computer Use를 안전하게 사용하려면 어떻게 해야 하나요?
세 가지 핵심 원칙이 있습니다.

• 반드시 Docker 컨테이너나 가상 머신의 격리 환경에서 실행합니다.
• 최소 권한 원칙을 지켜 꼭 필요한 권한만 부여합니다.
• 민감한 데이터는 암호화하고 작업 로그를 감사할 수 있게 관리합니다.

주로 사용하는 컴퓨터에서 직접 실행해서는 안 됩니다.
Computer Use는 어떤 작업을 지원하나요?
세 가지 도구로 대부분의 데스크톱 작업을 처리할 수 있습니다.

• Computer Tool: 마우스 클릭, 키보드 입력, 스크롤
• Text Editor: 파일 조회, 편집, 생성
• Bash Tool: 시스템 명령, 스크립트 실행

현재는 드래그나 확대·축소 같은 정밀 작업을 지원하지 않습니다.
Claude 외에 어떤 Computer-Use 솔루션이 있나요?
주요 경쟁 솔루션으로는 Google Gemini Mariner(브라우저 자동화), Microsoft Copilot Studio(엔터프라이즈), Amazon Nova Act(AWS 통합), 그리고 오픈 소스인 Agent S2와 Open Interpreter가 있습니다. 선택은 사용하는 기술 스택과 시나리오에 따라 달라집니다.
Computer Use의 대표적인 활용 사례는 무엇인가요?
주요 활용 사례는 세 가지입니다.

• 기업 자동화: 양식 입력, 데이터 마이그레이션, 시스템 간 워크플로
• 개발 및 테스트: UI 자동화 테스트, 환경 설정, 코드 배포
• 개인 생산성: 이메일 일괄 처리, 보고서 다운로드, 일정 관리

핵심은 규칙이 명확하고 반복적인 작업을 선택하는 것입니다.

2분 읽기 · 게시일: 2026년 3월 22일 · 수정일: 2026년 9월 4일

댓글

GitHub로 로그인하여 댓글을 남기세요

Easton BlogEaston Blog