CALVIN benchmark
Long-horizon language-conditioned manipulation benchmark with chain-of-tasks evaluation.
1000 everyday household activities benchmark for long-horizon embodied agents (OmniGibson).
Why: Largest structured household activity benchmark family
BEHAVIOR-1K is a curated project on Embodied AI Hub.
1000 everyday household activities benchmark for long-horizon embodied agents (OmniGibson).
Why it matters: Largest structured household activity benchmark family
Always verify install pins, licenses, and hardware requirements on the official site before production use.
Builders mapping open embodied stacks; researchers comparing SOTA baselines.
Content reviewed 2026-07-28