$ cat wiki/papers/2026/2607.28227-qwen-ui-agent.md
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
TL;DR
Tongyi MAI(Alibaba / Qwen AI Lab)의 파운데이션 GUI 에이전트로, 모바일·컴퓨터·브라우저· DeepSearch 사용을 하나의 모델로 통합하며 샌드박스 환경에 더해 대규모 실기기 모바일 런타임으로 학습했다. MobileWorld 82.1% — Opus 4.8 대비 14.6포인트 위 — 와 OSWorld-Verified 79.5% 를 보고한다 (source).
저자와 소속
Tongyi MAI, Alibaba / Qwen AI Lab. 보고서 일자 2026-07-29, arXiv:2607.28227 (source).
저자 목록은 이 환경에서 얻을 수 없었다 — arxiv.org 가 CONNECT 단계에서 거부됐고
보고서의 어느 페이지도 직접 읽지 못했다. 아래 내용은 모두 arXiv HTML 과 Hugging Face
논문 페이지의 검색 결과 발췌에서 왔으며, 그 출처를 명시한 채로 기록한다
(source).
방법
- 표면마다 전문 모델을 두는 대신 모바일·컴퓨터·브라우저·DeepSearch 시나리오를 하나의 모델로 포괄
- 다양한 샌드박스 환경에 대규모 실기기 모바일 런타임을 결합 — 보고서 자신의 강조점은 시뮬레이터 전용이 아닌 실기기에 있다
- 선제적 서비스 개시를 위한 하네스: 항공편 취소 같은 사건을 감지하고 관련 사안을 추론한 뒤, 과제 상태를 유지하면서 플랫폼을 가로질러 실행한다
- 기여는 보고서가 "five transitions" 라 부르는 축으로 정리되며, 실기기 및 벤치마크 기반 모바일 사용, 컴퓨터 사용, 브라우저 사용, DeepSearch, GUI 그라운딩에 걸친다
(source)
결과
모바일 사용 (source):
| Benchmark | Qwen-UI-Agent |
|---|---|
| MobileWorld | 82.1% |
| MobileWorld-Real | 92.2% |
| AndroidDaily | 97.5% |
| MobileWorld 에서 보고서는 Opus 4.8 대비 +14.6, GPT-5.6 Sol 대비 +12.0, | |
| Seed 2.1 Pro 대비 +8.9 퍼센트포인트의 격차를 밝힌다. |
컴퓨터 사용 (source):
| Benchmark | Qwen-UI-Agent |
|---|---|
| OSWorld-Verified | 79.5% |
| OSWorld-v2 (partial-progress) | 40.0% |
| OSWorld-Verified 에서는 GPT-5.5, Gemini 3.1 Pro, Seed 2.1 Pro 를 앞서며 전체 2위로 | |
| 놓는다 — 모바일 쪽 주장보다 약한 주장이고, 보고서도 그렇게 제시한다. |
이것들은 하네스 구성이 공개되지 않은 벤더 자체 측정값이므로 Eval Harness Configuration 에 따라 모델의 속성이 아니라 (모델, 하네스) 쌍에 대한 주장이다.
의의
점진적이지 않은 대목은 모바일 결과다. MobileWorld 에서 Opus 4.8 대비 14.6포인트 차이는 프런티어 범용 모델이 근소하게 밀리는 모양이 아니라, 스페셜리스트가 제너럴리스트의 가장 약한 표면에서 이기는 모양이다. 이 위키의 Agents (LLM Agents) 와 Embodied Agents 페이지는 컴퓨터 사용을 프런티어 연구소들이 다투는 영역으로 추적해 왔다 — 이 보고서는 모바일이 그로부터 분리 가능하며, 그 분리는 학습에 쓸 실기기를 가진 쪽에 유리하다고 주장한다.
선제적 서비스 개시 하네스가 표시해 둘 나머지 하나다. 이 위키가 기록한 모든 GUI 에이전트는 호출되는 쪽이다. 이 모델은 사건을 감지하고 스스로 개시한다고 설명된다. 그것은 다른 종류의 신뢰 표면이고, 보고서는 이를 다루지 않는 것으로 보인다.
열린 질문
- 파라미터 수, 아키텍처, 라이선스가 unknown — 읽은 어느 발췌에도 없다. 검색 결과 발췌는 모델이 Hugging Face 와 ModelScope 에 있다고 말하지만 어느 허브에서도 확인하지 않았고 라이선스도 얻지 못했으므로, 여기서 오픈 웨이트 릴리스는 확인된 사실이 아니라 보고서의 주장이다 (source)
- 독립적 측정치가 없다. MobileWorld, MobileWorld-Real, AndroidDaily, OSWorld-v2 는 이 저장소가 보유한 어느 리더보드 스냅숏에도 없으므로, 여기 있는 어느 것도 제3자에 대해 대조되지 않았다
- "실기기 모바일 런타임" 을 재현하는 비용이 얼마이며, 저자들이 만들지 않은 하네스에서도 모바일 격차가 유지되는지
인용
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric
Foundation GUI Agents. Tongyi MAI, Alibaba, 2026. arXiv:2607.28227.