AI Trend Notifier
EN
← wiki

$ cat wiki/papers/2025/2511.19430-grant-parallel-task.md

Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution (GRANT)

TL;DR

체화 에이전트는 물리 세계가 겹쳐 실행할 여지를 주는데도 지시를 순차적으로 수행한다 — 전자레인지가 도는 동안 싱크대를 닦는 식이 아니라. GRANT 는 체화 멀티모달 LLM 에 스케줄링 토큰을 더해 모델이 접지된 행동과 함께 병렬 스케줄을 내놓게 하고, 총 완료 시간을 30.53% 줄인다.

저자와 소속

Liang, Zhang, Xu, Ju, Luo, Bai. 코드는 H-EmbodVis 조직 아래 공개되었다 (source).

AAAI 2026 Oral 로 채택되었다. arXiv 게재는 2025년 11월 — 새 프리프린트가 아니다. 2026-07-30 HuggingFace Daily Papers 1위(113 업보트)에 오른 것이 여기 기록된 이유이며, 이는 발표 사건이 아니라 큐레이션 사건이다.

방법

논문은 ORS3D 를 정의한다 — Operations Research 지식 기반 3D Grounded Task Scheduling. 언어 이해, 3D 접지, 효율 최적화라는 세 역량을 동시에 요구하는 과제다. 목표는 병렬화 가능한 하위 과제를 활용해 총 완료 시간을 최소화하는 것이다.

GRANT 는 계획과 접지를 별개 단계로 나누는 대신 스케줄과 접지된 행동을 함께 생성하는 스케줄링 토큰 메커니즘을 갖춘 체화 멀티모달 LLM 이다.

데이터셋: ORS3D-60K — 4K 개 실세계 장면에 걸친 60K 개 복합 과제.

결과

Measurevs. baseline
Time Efficiency+30.53%
3D grounding accuracy+1.38%
비대칭이 곧 발견이다. 접지는 거의 움직이지 않고 스케줄링은 크게 움직인다. 이득은 장면을 더 잘
지각해서가 아니라 에이전트가 이미 할 수 있던 일의 순서를 바꾸는 데서 온다.

의의

대부분의 체화 에이전트 벤치마크는 과제가 완료되는지 여부를 채점한다. 이 벤치마크는 얼마나 걸리는지를 채점하며, 이는 실제 경과 시간을 학습 가능한 목적함수로 바꾸고 유휴 시간을 모델링된 비용으로 만든다. 행동 계층이 좋아질수록 이것은 더 중요해진다. Gemini Robotics 2 는 전신 조작 성공률을 45.7% 에서 76.3% 로 보고하는데, 개별 행동이 믿을 만해지고 나면 다단계 가사 과제에 남는 여지는 스케줄링이다.

또한 추론 계층이 행동 계층 위에서 조율하는 Gemini Robotics ER 2 와 같은 이음매에 놓인다 — GRANT 는 바로 그 오케스트레이션 문제를 시간 목적함수를 가진 벤치마크로 진술한 것이다.

열린 질문

  • +30.53% Time Efficiency 수치가 시뮬레이션 전용인지 여부. 여기서 읽은 초록 수준의 자료는 그것을 말하지 않는다 (source).
  • 모델 크기와 베이스 모델은 읽은 자료에 명시되어 있지 않다.
  • ORS3D-60K 는 "실세계 장면" 위에 구축되었지만, 실행이 하드웨어에서 평가되는지는 확인되지 않았다.
  • 스케줄링 토큰이 데이터셋이 다루는 가사 과제 영역 밖으로 일반화되는지 여부.

인용

Liang, Zhang, Xu, Ju, Luo, Bai.
Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution.
arXiv:2511.19430. AAAI 2026 (Oral).

Referenced by

Sources