$ cat wiki/concepts/embodied-agents.md
Embodied Agents
Definition
물리 세계 또는 시뮬레이션 환경에서 perception 과 actuation 을 통해 행동하는 에이전트. 순수 텍스트 출력 LLM 과 달리 multi-modal perception API + actuation API + skill library 구조 필요.
Why It Matters
- agents 매칭 (1.5x) × robotics 교차 — 본인 관심사 인접
- LLM 의 software 적용을 넘어선 next frontier
- 2026 핵심 흐름: NVIDIA Project GR00T, DeepMind robotics 연구
State of the Art (2026-07)
-
Mistral Robostral Navigate (2026-07-08) — 8B 로보틱스 내비게이션 모델. 단일 RGB 카메라와 자연어 프롬프트만 쓰고 깊이 센서도 LiDAR 도 없다. R2R-CE validation unseen 76.6% 달성 — 신규 SOTA(기존 최고 단일 카메라 대비 +9.7점, 최고 깊이·다중 카메라 대비 +4.5점). CISPO 온라인 RL 로 시뮬레이션 전용 훈련(+3.2%). 포인팅 기반 예측(이미지 좌표 → 목표 + 방향)이라 카메라 내부 파라미터 변화에 자연히 강건하다. 하드웨어 비종속. Mistral 의 첫 물리 AI 제품. 의의: 내비게이션의 sim-to-real 전이가 이제 RGB 만으로 실제 로봇에서 훈련한 깊이 센서 시스템을 이길 만큼 강해졌음을 보여준다. 배치의 하드웨어 문턱을 낮춘다. → Robostral Navigate (source)
-
NVIDIA ENPIRE — 실제 하드웨어에서의 에이전틱 로봇 자기개선 (2026-06-17) ⚡ 늦은 캡처 — Jim Fan 의 NVIDIA GEAR Lab 이 CMU·UC Berkeley 와 함께 ENPIRE 를 공개했다. 실제 로봇 8대 플릿이 자체 연구 루프(논문 읽기 → 가설 수립 → 시행 → 검증 → 코드 재작성)를 자율 수행하며 인간은 루프에 없다. 접촉이 많은 과제에서 pass@8 99%. 새 발견: 물리적 스케일링 법칙 — 병렬 로봇 8대가 더 적은 대수보다 정책을 초선형으로 빠르게 개선한다. LLM 시대의 데이터 병렬 스케일링 패러다임이 스킬 획득을 넘어 실세계 물리 조작 연구로 전이된다는 첫 시연. EgoScale 의 루프를 닫는다 — EgoScale 은 1인칭 영상에서 스킬을 획득하고, ENPIRE 는 그것을 자율적으로 개선한다. → ENPIRE: Agentic Robot Policy Self-Improvement in the Real World, Jim Fan (source) (arXiv)
-
NVIDIA EgoScale — 1인칭 영상으로 만든 정밀 조작 휴머노이드 (2026-06-07) ⚡ NEW — Jim Fan 팀이 22-DoF 정밀 손을 가진 휴머노이드를 전부 2만 시간 이상의 1인칭 인간 영상만으로 훈련했다(로봇 원격조작 없음). 과제: 모형차 조립, 주사기 조작, 카드 분류, 셔츠 개기. 핵심 결과: 로그-선형 스케일링 법칙(R² = 0.998) — 인간 영상 분량 → 행동 예측 손실 → 실제 로봇 성공률. LLM 데이터 스케일링 패러다임이 정밀한 물리적 조작으로 직접 전이된다는 첫 강력한 실증. 가중치·코드·데이터셋·평가셋·백서 전부 오픈소스. → Jim Fan (source)
-
NVIDIA Cosmos 3 (2026-06-01) ⚡ NEW — 세계 최초 완전 오픈 omnimodal physical AI foundation model. 64B (Super), Nano, Edge. MoT 아키텍처: 세계 생성 + 물리 추론 + 행동 예측 통합. R-Bench #1 오픈 모델. MIT 라이선스. Cosmos Coalition (Agile Robots, Runway, Black Forest Labs 등). → Cosmos 3 Super (source)
-
Gemini Robotics-ER 1.6 (2026-04-15) — Google DeepMind. 계기판 읽기 정확도 23%→93% (agentic vision 파이프라인). Boston Dynamics Spot 협업. 산업 현장 자율 점검 임계값 교차. Gemini API 공개. → Gemini Robotics ER 1.6 (source)
-
CaP-X (2026-04) — NVIDIA Jim Fan 팀 오픈소스. "Vibe agents alive in the physical world". Robot arms + humanoids, auto-synthesize skill libraries. (source)
-
Project GR00T — NVIDIA humanoid robot foundation model
-
DrEureka — LLM 이 robot skill training code 작성 (Jim Fan 팀)
-
Voyager — Minecraft 환경 lifelong learning agent
Architecture Patterns
- No-gradient orchestration: LLM 이 "prefrontal cortex" 로 high-level reasoning, lower-level control 은 code-gen 으로 위임
- Skill library: 학습/생성한 스킬을 retrievable library 로 누적
- Perception + actuation API 분리 — 환경 추상화
Open Problems
- Sim-to-real transfer
- Sample efficiency in real-world RL
- Skill library 의 generalization vs specialization 트레이드오프
- Safety in physical actuation
- Multi-agent coordination
Key Sources
- Cosmos 3 Super — NVIDIA 오픈 omnimodal physical AI (2026-06-01, R-Bench #1)
- Jim Fan — CaP-X 및 GR00T 연구 리더
- Gemini Robotics ER 1.6 — DeepMind 산업 현장 물리적 AI, 계기판 읽기 93%
- Project GR00T 페이지 TBD
Related Concepts
- Agentic Reinforcement Learning — RL 적 학습 측면
- Reasoning Models — high-level planning 측면
- NVIDIA — Cosmos 3 + GR00T + CaP-X
- Google DeepMind — Gemini Robotics 시리즈
- foundation-agent 페이지 TBD
Open Debates
- LLM-orchestrated 구조 vs end-to-end neural control — Jim Fan/NVIDIA 는 전자 강력 지지. 학계 일부는 후자 (e.g., Sergey Levine 그룹) 주장.
Referenced by
Sources
- sources/x/2026-jimfan-cap-x-vibe-agents.md
- sources/blogs/deepmind-2026-04-15-gemini-robotics-er-1-6.md
- sources/blogs/nvidia-2026-06-01-cosmos-3.md
- sources/x/2026-06-07-drjimfan-egoscale.md
- sources/arxiv/2026-06-17/2606.19980-enpire-robot-autoresearch.md
- sources/blogs/mistral-2026-07-08-robostral-navigate.md