Gemini 3.5 Flash의 Computer Use 내장은 AI 에이전트 자동화가 챗봇 응답을 넘어 실제 화면 조작과 업무 실행으로 이동하고 있음을 보여줍니다.
이 글에서는 Computer Use가 무엇인지, 기존 RPA·API 자동화와 무엇이 다른지, 그리고 FLOWIT처럼 콘텐츠·업무 자동화 파이프라인을 운영하는 팀이 어떤 기준으로 도입해야 하는지 정리합니다.

핵심 요약
- Google DeepMind는 Gemini 3.5 Flash에 Computer Use 기능을 내장해 브라우저, 모바일, 데스크톱 환경을 다루는 에이전트 개발을 강화했습니다.
- Computer Use는 스크린샷으로 화면을 이해하고 클릭, 입력, 스크롤 같은 UI 액션을 생성하는 방식으로 동작합니다.
- 이 변화는 API가 없는 SaaS 관리자 화면, 레거시 백오피스, QA 테스트, 문서 점검 같은 업무를 AI 자동화 대상으로 확장합니다.
- 다만 화면 조작 에이전트는 프롬프트 인젝션, 권한 오남용, 잘못된 클릭, 비가역적 액션 같은 운영 리스크를 반드시 관리해야 합니다.
- FLOWIT 관점에서는 API 자동화와 화면 기반 자동화를 섞는 하이브리드 설계가 가장 현실적입니다.
목차
- Computer Use란 무엇인가
- 왜 지금 Gemini 3.5 Flash 내장이 중요한가
- RPA, API 자동화, Computer Use의 차이
- AI 자동화 실무에 주는 변화
- FLOWIT에 적용할 수 있는 실제 시나리오
- 화면 조작 에이전트의 리스크
- 도입 전 체크리스트
- 자주 묻는 질문
- 참고 자료
Computer Use란 무엇인가
Computer Use는 AI 모델이 컴퓨터 화면을 보고, 현재 화면에서 다음에 어떤 행동을 해야 하는지 판단하는 기능입니다. 일반적인 챗봇이 텍스트 답변을 반환한다면, Computer Use 에이전트는 화면 상태를 입력으로 받아 클릭, 키보드 입력, 스크롤, 드래그 같은 행동 계획을 출력합니다.
Google의 Gemini API 문서는 Computer Use 도구를 브라우저, 모바일, 데스크톱 제어 에이전트를 만들 수 있는 기능으로 설명합니다. 모델은 스크린샷을 통해 현재 화면을 이해하고, 개발자는 모델이 생성한 액션을 실제 실행 환경에서 받아 처리합니다. 중요한 점은 모델이 운영체제를 직접 마음대로 조작하는 것이 아니라, 모델이 제안한 UI 액션을 클라이언트 실행 환경이 검증하고 수행한다는 점입니다.
이 구조는 기존 API 자동화와 다릅니다. API 자동화는 명확한 엔드포인트와 데이터 구조가 있을 때 강력합니다. 그러나 현실의 업무 도구는 아직도 관리자 화면, SaaS 대시보드, 내부 웹앱, 폼 입력, 수동 검수 화면 중심으로 움직이는 경우가 많다. Computer Use는 바로 이 “API가 없거나 부족한 영역”을 AI 자동화 대상으로 끌어옵니다.
FLOWIT 관점의 한 줄 정의: Computer Use는 API 자동화가 닿지 않는 화면 기반 업무를 AI 에이전트가 관찰하고 실행하도록 만드는 연결 계층입니다.
왜 지금 Gemini 3.5 Flash 내장이 중요한가
Google DeepMind 발표에 따르면 Computer Use는 Gemini 3.5 Flash의 내장 도구로 제공됩니다. 이전에는 별도의 computer use 모델이나 실험적 도구처럼 다뤄지던 기능이, 이제 주력 Flash 모델 안에서 사용할 수 있는 능력으로 들어온 것입니다.
이 변화가 중요한 이유는 세 가지다. 첫째, 에이전트 개발 흐름이 단순해진다. 개발자는 하나의 주력 모델 안에서 텍스트 추론, 도구 호출, 화면 기반 액션을 함께 설계할 수 있습니다. 둘째, 장기 업무 자동화에 유리하다. 문서 점검, QA 테스트, 반복 입력, 지식 업무처럼 여러 단계가 이어지는 작업에서 화면 상태를 계속 반영할 수 있습니다. 셋째, 기업 자동화 적용 범위가 넓어진다. 사내 도구나 레거시 웹앱처럼 API 연동이 어려운 환경에서도 자동화 가능성이 생깁니다.
Gemini API 문서도 Gemini 3.5 Flash를 Computer Use의 권장 모델로 제시하며, 브라우저·모바일·데스크톱 환경 지원, 액션 의도(intent) 필드, 구성 가능한 안전 정책, 프롬프트 인젝션 탐지 같은 기능을 언급합니다. 특히 액션마다 의도를 함께 다룰 수 있다는 점은 운영 로그와 검토 프로세스를 설계할 때 중요합니다.
RPA, API 자동화, Computer Use의 차이
Computer Use를 이해하려면 기존 RPA와 API 자동화의 차이를 먼저 구분해야 합니다. 세 가지 모두 자동화를 목표로 하지만, 안정성·유연성·운영 비용은 분명히 다릅니다.

| 구분 | 강점 | 약점 | 적합한 작업 |
|---|---|---|---|
| API 자동화 | 안정적이고 빠르며 재현성이 높다. | API가 없거나 권한이 막히면 적용이 어렵습니다. | WordPress 글 생성, 메타 업데이트, 데이터 동기화 |
| RPA | 정해진 화면과 반복 작업에 강합니다. | UI가 바뀌면 쉽게 깨질 수 있습니다. | 반복 폼 입력, 정형화된 백오피스 처리 |
| Computer Use AI | 화면을 해석하고 상황에 맞게 행동을 추론합니다. | 검증·권한·샌드박스 없이는 위험합니다. | QA, 문서 점검, 관리자 UI 보조, 예외 처리 |
FLOWIT에서 가장 안전한 원칙은 단순합니다. API가 있는 작업은 API로 처리하고, API가 없거나 화면 판단이 필요한 구간만 Computer Use로 보완하는 방식이 좋습니다. 예를 들어 WordPress 글 생성, 태그 설정, 공개 전 기본 정보 정리는 WP-CLI나 REST API로 처리하는 편이 더 안정적입니다. 반면 플러그인 관리자 화면에서만 제공되는 설정 점검, 렌더링된 페이지의 시각적 오류 확인, 특정 SaaS 대시보드 검수 같은 작업은 화면 기반 에이전트가 유용할 수 있습니다.
핵심 포인트: Computer Use는 API 자동화를 대체하는 기술이 아니라, API가 닿지 않는 화면 기반 업무를 보완하는 실행 계층으로 보는 것이 안전합니다.
AI 자동화 실무에 주는 변화
AI 자동화 실무에서 가장 큰 변화는 “자동화 가능한 업무”의 범위가 넓어진다는 점입니다. 지금까지 많은 자동화는 API, 웹훅, 데이터베이스, 스프레드시트처럼 구조화된 연결 지점이 있어야 안정적으로 동작했습니다. 하지만 실제 업무 현장에는 예외가 많습니다.
예를 들어 API가 없는 SaaS 관리자 화면, 수동으로만 접근 가능한 백오피스 페이지, 버튼과 폼이 자주 바뀌는 내부 운영 도구, 문서와 대시보드를 직접 눈으로 확인해야 하는 QA 업무가 있습니다. 기존 자동화 도구는 이런 구간에서 멈추거나, 사람이 중간에 개입해야 했습니다.

Computer Use 에이전트는 이런 영역에서 보조 작업자로 활용될 수 있습니다. 예를 들어 신제품 배포 후 주요 페이지를 열어 깨진 UI를 확인하거나, 접근성 문서의 문제를 점검하거나, 특정 SaaS 대시보드에서 반복 리포트를 생성하는 방식으로 활용할 수 있습니다. 특히 “화면을 보고 판단해야 하는데, 사람이 매번 하기에는 반복적인 일”이 첫 적용 대상이 됩니다.
다만 중요한 결론은 “모든 것을 화면 조작으로 해결하자”가 아닙니다. 오히려 반대다. 화면 조작은 편리하지만 운영 리스크가 크기 때문에, 안정적인 API 자동화를 기본으로 두고 예외 구간을 Computer Use가 보완하는 방식이 가장 현실적입니다.
읽는 포인트
아래 시나리오는 “AI가 대신 클릭한다”가 아니라, 기존 자동화가 놓치는 검수·예외·화면 확인 구간을 AI가 보조한다는 관점으로 보시면 좋습니다.
FLOWIT에 적용할 수 있는 실제 시나리오
FLOWIT의 현재 자동화 흐름을 기준으로 보면 Computer Use는 세 가지 영역에서 가치가 있습니다.
1. WordPress 발행 전 시각 검수
글 생성, 이미지 업로드, 카테고리·태그 설정, 공개 전 기본 정보 정리는 WP-CLI와 REST API로 충분히 자동화할 수 있습니다. 하지만 실제 글이 브라우저에서 어떻게 보이는지는 별도의 확인이 필요합니다. 이미지가 너무 크게 보이거나, 모바일에서 표가 깨지거나, 상단 카드가 과하게 튀는 문제는 API 응답만으로 알기 어렵습니다.
Computer Use 에이전트는 발행 전 미리보기 화면을 열고, 제목·이미지·목차·FAQ·참고 자료가 정상적으로 보이는지 체크할 수 있습니다. 다만 이 단계는 읽기와 검수 중심이어야 하며, 공개 발행 버튼 클릭은 사람 승인 이후에만 허용하는 편이 안전합니다.
2. 콘텐츠 파이프라인 QA
FLOWIT은 블로그뿐 아니라 쇼츠 자동화도 함께 운영합니다. 이런 파이프라인은 스크립트, 이미지, TTS, 영상 렌더링, 업로드 전 QC처럼 여러 단계로 나뉩니다. API 로그는 성공이라고 나오지만, 실제 결과물이 어색한 경우가 생길 수 있습니다.
화면 기반 에이전트는 렌더링 결과 미리보기, 업로드 페이지 확인, 메타데이터 입력 상태 점검처럼 UI 중심의 QA에 유용합니다. 특히 “자동화는 됐지만 사람이 마지막으로 눈으로 보던 구간”을 줄이는 데 도움이 됩니다.
3. 관리자 도구와 레거시 UI 연결
많은 WordPress 플러그인, SaaS 도구, 내부 관리자 화면은 필요한 기능을 API로 모두 제공하지 않습니다. 일부 설정은 WP-CLI로 처리할 수 있지만, 플러그인 설정 화면처럼 관리자 UI에서 직접 확인해야 하는 작업도 있습니다. 이런 경우 Computer Use는 문서화된 절차를 따라 화면을 이동하고 설정 상태를 확인하는 보조자 역할을 할 수 있습니다.
운영 팁: Computer Use는 “실행 권한을 가진 자동 조작자”로 바로 투입하기보다, 처음에는 “검수자” 또는 “작업 제안자”로 도입하는 편이 안전하다.
화면 조작 에이전트의 리스크
화면을 조작하는 AI 에이전트는 강력하지만, 그만큼 운영 리스크도 큽니다. 텍스트를 잘못 생성하는 챗봇보다, 잘못 클릭하는 에이전트가 실제 시스템에 미치는 영향은 더 직접적입니다. 그래서 Computer Use는 모델 성능만 보고 도입하면 안 됩니다.

대표적인 위험은 네 가지입니다. 첫째, 프롬프트 인젝션입니다. 웹페이지나 이미지 안에 숨겨진 지시문이 에이전트 행동에 영향을 줄 수 있습니다. 둘째, 권한 오남용입니다. 에이전트가 필요 이상의 관리자 권한을 가진 상태로 작업하면 실수의 피해 범위가 커집니다. 셋째, 비가역적 액션입니다. 삭제, 결제, 발송, 공개 발행처럼 되돌리기 어려운 행동을 자동으로 수행할 수 있습니다. 넷째, 화면 변화 대응 실패입니다. UI 구조가 바뀌면 엉뚱한 버튼을 누르거나 잘못된 값을 입력할 수 있습니다.
Google DeepMind는 Computer Use 관련 발표에서 안전 장치로 적대적 학습, 선택적 기업 보호 시스템, 샌드박싱, human-in-the-loop 검증, 엄격한 접근 제어를 함께 언급합니다. 별도의 AI agent 보안 글에서도 감시, 차단, 대응 시간을 모델 능력에 맞춰 강화해야 한다고 설명합니다.
주의해야 할 운영 원칙
실무 적용 시에는 “AI가 할 수 있는가?”보다 “AI가 실수해도 안전한가?”를 먼저 물어야 합니다. FLOWIT 자동화에서도 공개 발행, 삭제, 외부 업로드, 결제, 계정 권한 변경 같은 작업은 반드시 승인 게이트를 둬야 합니다.
도입 전 체크리스트
Computer Use형 에이전트를 실무에 적용하기 전에는 아래 기준을 먼저 통과하는지 확인하는 것이 좋습니다.
- API 우선 원칙: WordPress, Notion, Google Workspace, Slack처럼 API가 안정적인 작업은 API를 먼저 사용합니다.
- 화면 조작은 보완재: API가 없거나 화면 판단이 필요한 구간만 Computer Use로 맡깁니다.
- 권한 최소화: 에이전트 계정은 읽기 전용 또는 제한 권한으로 시작합니다.
- 샌드박스 실행: 실제 운영 계정이 아니라 테스트 환경에서 먼저 검증합니다.
- 되돌리기 어려운 행동은 승인 필요: 삭제, 결제, 발행, 외부 발송은 사람의 확인 단계를 둡니다.
- 행동 로그 저장: 어떤 화면에서 어떤 이유로 어떤 액션을 했는지 기록합니다.
- 정기 리그레션 테스트: UI가 바뀌어도 에이전트가 안전하게 멈추는지 확인합니다.
이 체크리스트는 단순한 보안 문서가 아닙니다. 실제 자동화 운영 비용을 줄이기 위한 기준입니다. 에이전트가 한 번 잘못 클릭해서 복구 작업이 필요해지면, 자동화로 아낀 시간보다 더 많은 시간이 손실될 수 있습니다. 좋은 자동화는 빠른 자동화가 아니라, 실패했을 때 안전하게 멈추는 자동화입니다.
실무자가 이 흐름에서 먼저 봐야 할 것
Computer Use의 핵심은 “AI가 화면을 클릭할 수 있다”는 사실 자체가 아닙니다. 더 중요한 것은 기존 자동화가 멈추던 구간을 어떻게 안전하게 이어갈 것인가입니다.
실무자는 먼저 자동화 대상을 세 가지로 나눠보는 것이 좋습니다. 첫째, API로 안정적으로 처리할 수 있는 작업입니다. 둘째, 사람이 화면을 보며 판단해야 했던 검수 작업입니다. 셋째, 삭제·발행·결제처럼 실수했을 때 영향이 큰 작업입니다. 이 구분이 선명해야 Computer Use를 어디에 써도 되는지, 어디에는 쓰면 안 되는지 판단할 수 있습니다.
실무 적용 기준
Computer Use는 반복 업무를 무조건 자동화하는 도구가 아니라, API 자동화·사람 확인·화면 검수를 연결하는 보조 계층으로 설계할 때 가장 안전합니다.
FLOWIT처럼 콘텐츠와 업무 자동화를 함께 운영하는 팀이라면, Computer Use를 처음부터 발행이나 삭제 같은 강한 권한에 연결하기보다 미리보기 확인, UI 깨짐 감지, 관리자 화면 점검, 누락 항목 체크처럼 되돌리기 쉬운 작업부터 적용하는 편이 좋습니다. 이렇게 시작하면 자동화의 범위를 넓히면서도 운영 리스크를 낮출 수 있습니다.
자주 묻는 질문
Computer Use는 RPA와 같은 개념인가요?
비슷한 목표를 갖지만 방식은 다릅니다. 전통적인 RPA는 정해진 화면 좌표나 규칙 기반 흐름에 강하고, Computer Use 에이전트는 화면을 해석하고 다음 행동을 추론하는 데 초점이 있습니다. 운영 환경에서는 API 자동화, RPA, Computer Use를 함께 조합하는 방식이 가장 현실적입니다.
Gemini 3.5 Flash Computer Use로 모든 업무를 자동화할 수 있나요?
아닙니다. API가 있는 작업은 API 자동화가 더 안정적이며, 화면 조작은 UI 변경과 권한 위험에 취약합니다. Computer Use는 API가 없거나 화면 판단이 필요한 작업에 보완적으로 쓰는 것이 좋습니다.
기업에서 가장 먼저 적용하기 좋은 영역은 무엇인가요?
되돌리기 쉬운 읽기·점검 중심 업무가 먼저 적용하기에 적합합니다. 예를 들어 QA 테스트, 접근성 점검, 문서 검토, 내부 대시보드 확인, 반복 리포트 생성 같은 영역이 시작점이 될 수 있습니다.
프롬프트 인젝션은 왜 중요한가요?
Computer Use 에이전트는 웹페이지와 화면을 보고 행동하기 때문에, 화면 안에 숨겨진 악성 지시문에 영향을 받을 수 있습니다. 그래서 스크린샷 기반 탐지, 샌드박싱, 승인 단계, 권한 제한이 중요합니다.
FLOWIT 자동화에는 어떻게 연결할 수 있나요?
FLOWIT의 블로그·쇼츠·자료 조사 자동화에서는 API 기반 작업을 우선 사용하고, 관리자 UI나 수동 확인이 필요한 구간만 Computer Use형 에이전트로 보완하는 방식이 현실적입니다.
마무리: AI 에이전트는 이제 화면까지 다룹니다
Gemini 3.5 Flash의 Computer Use 내장은 AI 에이전트가 텍스트 생성기에서 업무 실행자로 이동하는 흐름을 잘 보여줍니다. 앞으로의 자동화는 단순히 어떤 프롬프트를 쓰는가가 아니라, 모델·도구·권한·검증·로그를 하나의 운영 시스템으로 묶는 방향으로 발전할 가능성이 큽니다.
FLOWIT의 관점에서 핵심은 명확합니다. API로 가능한 일은 더 안정적으로 자동화하고, API가 닿지 않는 화면 기반 업무는 안전 장치가 있는 에이전트로 보완해야 합니다. 결국 좋은 AI 자동화는 똑똑한 모델 하나가 아니라, 실수해도 무너지지 않는 워크플로우 설계에서 나옵니다.
참고 자료
이 글이 마음에 드세요?
FLOWIT on YouTube
영상으로도 FLOWIT을 이어서 보세요
AI 자동화, Claude Code, n8n, 데이터 분석 흐름을 블로그와 영상으로 함께 정리하고 있습니다.
AI 에이전트 보안, 권한 설계부터 시작하세요
AI 에이전트 비용 기준: 최고 모델보다 작업당 비용입니다
Gemini Managed Agents: AI 에이전트 운영 설계가 중요해졌습니다