Computer-Use Agent: deja que la IA opere tu ordenador

Claude 3.5 Sonnet fue el primer modelo frontier con Computer Use: 14,9% en OSWorld, el doble del segundo. Ve la pantalla, mueve el ratón, hace clic y rellena formularios como una persona. No es un script RPA fijo: la IA entiende la pantalla y decide dinámicamente; si la UI cambia, se ajusta.
Computer-Use Agent usa tres herramientas: Computer Tool (ratón/teclado), Text Editor (archivos) y Bash Tool (comandos). Este artículo cubre principio a práctica: Docker, código, competidores y seguridad. Regla central: solo en sandbox; nunca en tu máquina principal.
Qué es Computer-Use Agent
En pocas palabras: es IA que opera el ordenador directamente.
La IA tradicional solo «habla»: preguntas, responde. Computer-Use Agent «actúa»: le das una tarea, mira la pantalla, usa teclado y ratón y la completa.
Por ejemplo: «rellena este formulario web con los datos de esta hoja Excel». Hará:
- Abrir Excel y leer datos
- Abrir el navegador y la página
- Rellenar campo por campo
- Enviar el formulario
Sin tu intervención y sin integraciones específicas por software.
Diferencia con la automatización tradicional
¿No es RPA (Robotic Process Automation)?
Se parece, pero no es lo mismo.
RPA es «script»: grabas pasos y los repite. Si la web cambia el layout o mueve un botón, el script falla.
Computer-Use Agent es «agente»: lee la pantalla, entiende el estado y se adapta. Como una persona: si el botón pasa de izquierda a derecha, lo ves al instante; Claude también.
Además, RPA exige definir cada paso. Computer-Use Agent solo necesita el «qué»; decide el «cómo».
Claude Computer Use en detalle
En octubre de 2024, Anthropic anunció Computer Use en Claude 3.5 Sonnet, el primer modelo frontier con esta capacidad.
Cómo funciona
El flujo se parece al de un humano:
Ver pantalla → Analizar → Decidir acción → Ejecutar → Ajustar con feedback
En concreto:
-
Análisis de captura: Claude captura la pantalla y reconoce texto, botones, campos, etc.
-
Mapeo de coordenadas: avance clave. El modelo aprende a mapear elementos visuales a píxeles, por ejemplo «botón Enviar en (320, 450)».
-
Ejecución: según la tarea, mueve el ratón, hace clic, escribe, hace scroll.
-
Bucle de feedback: tras cada acción, nueva captura, observa cambios y decide el siguiente paso.
Ese ciclo observar-decidir-actuar-feedback es el núcleo del Computer-Use Agent.
Tres herramientas principales
Computer Tool: ratón y teclado
- Movimiento, clic, doble clic, clic derecho
- Escritura y atajos
- Scroll
Text Editor Tool: archivos
- Ver contenido
- Editar y crear
- Buscar y reemplazar
Bash Tool: comandos del sistema
- Scripts shell
- Instalar paquetes
- Tareas de administración
Juntas cubren la mayoría de lo que haces en el ordenador.
Rendimiento
Según Anthropic, en OSWorld (benchmark de operación de escritorio) Claude 3.5 Sonnet obtuvo 14,9%. Suena bajo, pero el segundo tuvo 7,8%, casi la mitad.
En WebArena (automatización web) también lidera.
Con honestidad: está en fase temprana. Anthropic admite que es lento, a veces falla y no hace arrastrar/zoom fino. Por ahora, solo pruebas en sandbox.
Primeros pasos
Preparar el entorno
La forma más simple: el demo Docker oficial.
Paso 1: API Key
- Registro en Anthropic Console
- Generar API Key
- Añadir saldo mínimo (las pruebas cuestan poco)
Paso 2: contenedor Docker
# Variables de entorno
export ANTHROPIC_API_KEY="your_key_here"
# Demo oficial
docker run \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-v $HOME/.anthropic:/home/computeruse/.anthropic \
-p 5900:5900 \
-p 8501:8501 \
-p 6080:6080 \
-p 8080:8080 \
-it ghcr.io/anthropics/anthropic-quickstarts:computer-use-demo-latest
Arranca un Ubuntu de escritorio en contenedor con puertos:
- 6080: Web VNC (ver escritorio en navegador)
- 5900: VNC
- 8080: API
- 8501: interfaz Streamlit
Paso 3: acceder al escritorio
Abre http://localhost:6080 y verás Ubuntu. Ese es el «ordenador» de Claude.
Primera tarea: formulario automático
Prueba rellenar un formulario con Claude.
Tienes un CSV de clientes y un formulario web. Antes: script o copiar-pegar manual. Ahora: Claude.
En Streamlit (http://localhost:8501), escribe la tarea:
Abre ~/data/customers.csv y rellena https://example.com/form con esos datos.
Cada registro: nombre, email y teléfono.
Claude trabajará; en VNC verás:
- Abrir gestor de archivos
- Localizar el CSV
- Abrirlo en editor
- Abrir navegador
- Rellenar campos
- Enviar
Puede tardar minutos (más lento que un humano), pero sin intervención.
Avanzado: flujo multipaso
Tarea más compleja: «exportar de base de datos, generar informe y enviar email»:
# Ejemplo conceptual; requiere entorno concreto
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-3-5-sonnet-20241022",
max_tokens=1024,
tools=[
{
"type": "computer_20241022",
"name": "computer"
},
{
"type": "text_editor_20241022",
"name": "text_editor"
},
{
"type": "bash_20241022",
"name": "bash"
}
],
messages=[
{
"role": "user",
"content": """
Ejecuta estas tareas:
1. Exportar datos de ventas del mes desde PostgreSQL
2. Generar gráfico de barras con Python
3. Guardar informe en PDF
4. Enviar email a [email protected]
"""
}
]
)
# Procesar respuesta de Claude
for block in message.content:
if block.type == "tool_use":
# Ejecutar herramienta
result = execute_tool(block.name, block.input)
# Devolver resultado a Claude
# ...
Muestra la API de Computer Use. En producción hay que gestionar permisos, errores y límites de seguridad.
Competidores: no solo Anthropic
Computer-Use Agent es tendencia; varias empresas compiten.
Google Gemini Mariner
Integrado con el ecosistema Google. Gemini opera Chrome y servicios (Gmail, Docs, Sheets). Ventaja: Workspace; aún en beta cerrada.
Microsoft Copilot Studio
Ventaja en automatización empresarial. Interfaz low-code para no técnicos. Infraestructura de Microsoft; sin montar servidores propios.
Amazon Nova Act
Capacidad similar vía Bedrock, integrada con AWS. Buena opción si ya usas AWS.
Open source
Agent S2, Open Interpreter y otros exploran la dirección. Más control y despliegue propio, pero más exigencia técnica.
Seguridad: lo más importante
Dejar que la IA opere tu PC tiene riesgo: archivos, comandos del sistema, borrados accidentales. La seguridad va primero.
Solo en sandbox
No, nunca en tu máquina principal. Docker o VM aislada.
El demo oficial ya corre en contenedor. En producción, más capas:
- Aislamiento de red (solo sitios necesarios)
- Límites de archivos (directorios permitidos)
- Auditoría de llamadas API
Control de permisos
No todas las tareas necesitan control total. Por ejemplo:
- Solo documentos: desactivar red
- Solo lectura: modo read-only
Diseña con mínimo privilegio: solo lo imprescindible para la tarea.
Datos sensibles
Si Claude procesa datos sensibles (clientes, finanzas):
- API Key en variables de entorno, no en código
- Cifrado de datos sensibles
- Logs con desenmascaramiento
- Auditoría periódica de accesos
Medidas de Anthropic
Anthropic ha invertido en seguridad:
- Entrenamiento de seguridad en el modelo
- Beta header para habilitación explícita
- Recomendación de sandbox para pruebas
- Investigación de seguridad publicada
La responsabilidad final es del usuario. Como conducir: el fabricante pone airbags, pero tú usas cinturón y respetas las normas.
Perspectivas
Computer-Use Agent está al inicio, pero la dirección es clara.
Tecnología más fuerte
Limitaciones actuales —lentitud, precisión, sin arrastrar— mejorarán. Modelos más rápidos y capaces de operaciones complejas.
Más escenarios
De formularios simples a flujos entre apps; de dev/test a ops empresarial; de productividad personal a plataformas de automatización.
Impacto en desarrolladores
Si desarrollas, conviene seguir la tendencia:
- RPA: de scripts a diseño de comportamiento de agentes
- QA: pruebas UI automatizadas con IA
- Ops: inspección y diagnóstico con IA
- Producto: validar ideas de automatización rápido
Cambio de industria
A largo plazo puede cambiar cómo usamos software:
- Sin aprender cada app: dices qué quieres
- Sin integraciones por flujo: la IA opera
- Sin trabajo repetitivo frente al PC: la IA lo hace
Tardará, pero la tendencia ya empezó.
Resumen
Computer-Use Agent marca el paso de la IA de «asistente conversacional» a «agente de acción». Lee pantalla, opera interfaz y completa tareas como una persona.
Para desarrolladores, vale explorar:
- Técnica: principio y implementación
- Práctica: pruebas en entorno seguro
- Aplicación: qué escenarios y cómo
Dos recordatorios:
- Seguridad primero — siempre en sandbox
- Mantente al día — el campo evoluciona rápido
Recursos útiles:
La próxima vez que te torture una tarea repetitiva en el PC, piensa: quizá la IA pueda hacerla.
FAQ
¿Diferencia entre Computer-Use Agent y RPA tradicional?
• RPA usa scripts que fallan si cambia la UI • Computer-Use entiende la pantalla y se adapta • RPA define cada paso; Claude solo necesita el objetivo • Computer Use encaja en escenarios complejos no estandarizados
¿Cómo rinde Claude Computer Use?
¿Cómo usar Computer Use con seguridad?
• Docker o VM aislada obligatorio • Mínimo privilegio • Cifrar datos sensibles y auditar logs
Nunca en la máquina principal.
¿Qué operaciones admite?
• Computer Tool: clics, teclado, scroll • Text Editor: ver, editar, crear archivos • Bash Tool: comandos y scripts
Sin arrastre ni zoom fino por ahora.
¿Otras soluciones además de Claude?
¿Casos de uso típicos?
• Automatización empresarial: formularios, migración, flujos entre sistemas • Dev y pruebas: UI, entornos, despliegue • Productividad personal: emails, informes, agenda
Ideal para tareas repetitivas con reglas claras.
7 min de lectura · Publicado el: 22 mar 2026 · Actualizado el: 21 ago 2026
Guía de ingeniería de AI Agents
Si llegaste desde búsqueda, lo más rápido es ir al artículo anterior o siguiente de esta misma serie.
Anterior
Invocación de herramientas en Agent: haz que la IA llame APIs y servicios externos
De Function Calling a MCP: mecanismos de invocación en Claude y OpenAI, ejemplos completos y buenas prácticas para construir agentes de IA con capacidad de llamar APIs
Parte 5 de 16
Siguiente
Colaboración multiagente en la práctica: guía de 4 patrones de arquitectura
Domina 4 patrones clave de sistemas multiagente, de Subagents a Router, con implementación en LangGraph y consejos de optimización para producción
Parte 7 de 16



Comentarios
Inicia sesión con GitHub para dejar un comentario