{"object":"list","total":632,"limit":100,"offset":0,"data":[{"id":"adrialopezescoriza/demo-3","name":"DEMO^3","title":"Multi-Stage Manipulation with Demonstration-Augmented Reward, Policy, and World Model Learning","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["action","score"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2503.01837","code_url":"https://github.com/adrialopezescoriza/demo3","project_url":"https://adrialopezescoriza.github.io/demo3/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.009059,"per_frame_max":0.017726,"per_action_step_min":0.003171,"currency":"USD"},"latency_p50_ms_min":48},{"id":"allenai/molmoact","name":"MolmoAct","title":"MolmoAct: Action Reasoning Models that can Reason in Space","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":null,"era":"current","kind":"policy","is_world_model":false,"tier":"servable","tier_source":"override","tier_reason":"Open weights, data and training code released by AI2.","vendor":"Allen Institute for AI","weights_url":"https://huggingface.co/allenai/MolmoAct-7B-D-0812","routable":true,"featured":true,"contracts":["act","ground"],"modalities":{"inputs":["rgb","language"],"outputs":["action","trajectory"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2508.07917","code_url":"https://github.com/allenai/MolmoAct","project_url":"https://allenai.org/blog/molmoact","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008978,"per_frame_max":0.015836,"per_action_step_min":0.003142,"currency":"USD"},"latency_p50_ms_min":42},{"id":"anuragajay/hip","name":"HiP","title":"Compositional Foundation Models for Hierarchical Planning","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2023,"arxiv_url":"https://arxiv.org/abs/2309.08587","code_url":"https://github.com/anuragajay/hip/tree/main","project_url":"https://hierarchical-planning-foundation-model.github.io/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008737,"per_frame_max":0.01744,"per_action_step_min":0.003058,"currency":"USD"},"latency_p50_ms_min":40},{"id":"cladernyjorn/up-vla","name":"UP-VLA","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2501.18867","code_url":"https://github.com/CladernyJorn/UP-VLA","project_url":null,"providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008767,"per_frame_max":0.017732,"per_action_step_min":0.003068,"currency":"USD"},"latency_p50_ms_min":42},{"id":"community/aether","name":"Aether","title":"Aether: Geometric-Aware Unified World Modeling","domain":"general","domains":["general"],"family":"vision-3d","families":["vision-3d"],"subsection":"3. Building World Models from 3D Vision Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"override","tier_reason":"MIT, verified from the GitHub LICENSE file (InternRobotics/Aether) and the HF card. Weights are public and unrestricted: a 5B CogVideoX-based transformer doing action-conditioned prediction, 4D reconstruction and goal-conditioned planning. Served by deploy/modal/aether_world.py.","vendor":"Shanghai AI Lab","weights_url":"https://huggingface.co/AetherWorldModel/AetherV1","routable":true,"featured":true,"contracts":["predict","evaluate"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2503.18945","code_url":"https://huggingface.co/AetherWorldModel/AetherV1","project_url":"https://aether-world.github.io/","providers":["baseten","fal","modal","modal-aether","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.006,"per_frame_max":0.017772,"per_action_step_min":0.002,"currency":"USD"},"latency_p50_ms_min":38},{"id":"community/cosmos","name":"Cosmos","title":"Cosmos World Foundation Model Platform for Physical AI","domain":"general","domains":["general"],"family":"foundation-general","families":["foundation-general"],"subsection":"1. Foundation World Models","era":"classic","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2501.03575","code_url":"https://github.com/nvidia-cosmos","project_url":"https://www.nvidia.com/en-us/ai/cosmos/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.010567,"per_frame_max":0.022187,"per_action_step_min":0.003694,"currency":"USD"},"latency_p50_ms_min":50},{"id":"damo/worldvla","name":"WorldVLA","title":"WorldVLA: Towards Autoregressive Action World Model","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.21539","code_url":"https://github.com/alibaba-damo-academy/WorldVLA","project_url":null,"providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.00836,"per_frame_max":0.017769,"per_action_step_min":0.002926,"currency":"USD"},"latency_p50_ms_min":40},{"id":"danijar/dreamer","name":"Dreamer","title":"Dream to Control: Learning Behaviors by Latent Imagination","domain":"general","domains":["general"],"family":"mbrl","families":["mbrl"],"subsection":"8. World Models in the context of Model-Based RL","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video","action","latent"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2019,"arxiv_url":"https://arxiv.org/abs/1912.01603","code_url":"https://github.com/danijar/dreamer","project_url":"https://danijar.com/project/dreamer/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008599,"per_frame_max":0.017428,"per_action_step_min":0.00301,"currency":"USD"},"latency_p50_ms_min":38},{"id":"danijar/dreamerv2","name":"Dreamerv2","title":"Mastering Atari with Discrete World Models","domain":"general","domains":["general"],"family":"mbrl","families":["mbrl"],"subsection":"8. World Models in the context of Model-Based RL","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2020,"arxiv_url":"https://arxiv.org/abs/2010.02193","code_url":"https://github.com/danijar/dreamerv2","project_url":"https://danijar.com/project/dreamerv2/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008266,"per_frame_max":0.01685,"per_action_step_min":0.002893,"currency":"USD"},"latency_p50_ms_min":40},{"id":"danijar/dreamerv3","name":"Dreamerv3","title":"Mastering Diverse Domains through World Models","domain":"general","domains":["general"],"family":"mbrl","families":["mbrl"],"subsection":"8. World Models in the context of Model-Based RL","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2023,"arxiv_url":"https://arxiv.org/abs/2301.04104","code_url":"https://github.com/danijar/dreamerv3","project_url":"https://danijar.com/project/dreamerv3/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.00854,"per_frame_max":0.014997,"per_action_step_min":0.002989,"currency":"USD"},"latency_p50_ms_min":49},{"id":"eloialonso/diamond","name":"DIAMOND","title":"Diffusion for World Modeling: Visual Details Matter in Atari","domain":"game","domains":["game"],"family":"game-sim","families":["game-sim"],"subsection":null,"era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["virtual-agent"],"action_spaces":["discrete_button","keyboard_mouse","continuous_2d"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2405.12399","code_url":"https://github.com/eloialonso/diamond","project_url":null,"providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008146,"per_frame_max":0.0169,"per_action_step_min":0.002851,"currency":"USD"},"latency_p50_ms_min":53},{"id":"gaussian-world-model/gwm","name":"GWM","title":"GWM: Towards Scalable Gaussian World Models for Robotic Manipulation","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","pointcloud"],"outputs":["occupancy"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2508.17600","code_url":"https://github.com/Gaussian-World-Model/gaussianwm","project_url":"https://gaussian-world-model.github.io/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.011463,"per_frame_max":0.024918,"per_action_step_min":0.004012,"currency":"USD"},"latency_p50_ms_min":54},{"id":"ginwind/vla-jepa","name":"VLA-JEPA","title":"VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","text"],"outputs":["action","latent"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2026,"arxiv_url":"https://arxiv.org/abs/2602.10098","code_url":"https://github.com/ginwind/VLA-JEPA","project_url":"https://ginwind.github.io/VLA-JEPA/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008152,"per_frame_max":0.017844,"per_action_step_min":0.002853,"currency":"USD"},"latency_p50_ms_min":55},{"id":"guhuangai/ladi-wm","name":"LaDi-WM","title":"LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["latent"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2505.11528","code_url":"https://github.com/GuHuangAI/LaDiWM","project_url":"https://guhuangai.github.io/LaDiWM.github.io/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008698,"per_frame_max":0.017716,"per_action_step_min":0.003044,"currency":"USD"},"latency_p50_ms_min":46},{"id":"hoyyyaard/3dflowaction","name":"3DFlowAction","title":"3DFlowAction: Learning Cross-Embodiment Manipulation from 3D Flow World Model","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","pointcloud"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.06199","code_url":"https://github.com/Hoyyyaard/3DFlowAction/","project_url":null,"providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.012626,"per_frame_max":0.021314,"per_action_step_min":0.004419,"currency":"USD"},"latency_p50_ms_min":43},{"id":"huggingface/smolvla","name":"SmolVLA","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":null,"era":"current","kind":"policy","is_world_model":false,"tier":"servable","tier_source":"override","tier_reason":"Small open checkpoint trained on community data, served by LeRobot.","vendor":"Hugging Face","weights_url":"https://huggingface.co/lerobot/smolvla_base","routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","proprio","language"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.01844","code_url":"https://github.com/huggingface/lerobot","project_url":"https://huggingface.co/blog/smolvla","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008372,"per_frame_max":0.017796,"per_action_step_min":0.00293,"currency":"USD"},"latency_p50_ms_min":41},{"id":"jiangranlv/dywa","name":"DyWA","title":"DyWA: Dynamics-adaptive World Action Model for Generalizable Non-prehensile Manipulation","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2503.16806","code_url":"https://github.com/jiangranlv/DyWA","project_url":"https://pku-epic.github.io/DyWA/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008274,"per_frame_max":0.016553,"per_action_step_min":0.002896,"currency":"USD"},"latency_p50_ms_min":45},{"id":"jiangranlv/lda-1b","name":"LDA-1B","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","domain":"embodied","domains":["embodied"],"family":"policy-learning","families":["policy-learning"],"subsection":"6. World Models x Policy Learning","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["action","latent"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2026,"arxiv_url":"https://arxiv.org/abs/2602.12215","code_url":"https://github.com/jiangranlv/latent-dynamics-action","project_url":"https://pku-epic.github.io/LDA/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008555,"per_frame_max":0.017834,"per_action_step_min":0.002994,"currency":"USD"},"latency_p50_ms_min":44},{"id":"little-podi/adaworld","name":"AdaWorld","title":"AdaWorld: Learning Adaptable World Models with Latent Actions","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["action","latent"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2503.18938","code_url":"https://github.com/Little-Podi/AdaWorld","project_url":"https://adaptable-world-model.github.io/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008709,"per_frame_max":0.0175,"per_action_step_min":0.003048,"currency":"USD"},"latency_p50_ms_min":53},{"id":"litwellchi/eva","name":"EVA","title":"EVA: An Embodied World Model for Future Video Anticipation","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2410.15461","code_url":"https://github.com/litwellchi/EmbodiedVideoAnticipator?tab=readme-ov-file","project_url":"https://sites.google.com/view/eva-publi","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008685,"per_frame_max":0.016993,"per_action_step_min":0.00304,"currency":"USD"},"latency_p50_ms_min":49},{"id":"meta/v-jepa","name":"V-JEPA","title":"V-JEPA: Video Joint Embedding Predictive Architecture","domain":"general","domains":["general"],"family":"foundation-general","families":["foundation-general","latent"],"subsection":"1. Foundation World Models","era":"classic","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["proprio","rgb"],"outputs":["latent","video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":null,"arxiv_url":null,"code_url":"https://github.com/facebookresearch/jepa","project_url":"https://ai.meta.com/blog/v-jepa-yann-lecun-ai-model-video-joint-embedding-predictive-architecture/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.010889,"per_frame_max":0.022344,"per_action_step_min":0.003807,"currency":"USD"},"latency_p50_ms_min":48},{"id":"meta/v-jepa-2","name":"V-JEPA 2","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","domain":"general","domains":["general"],"family":"foundation-general","families":["foundation-general","latent"],"subsection":"1. Foundation World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["latent","video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.09985","code_url":"https://github.com/facebookresearch/vjepa2","project_url":"https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.011015,"per_frame_max":0.022018,"per_action_step_min":0.003851,"currency":"USD"},"latency_p50_ms_min":53},{"id":"nematoli/lumos","name":"LUMOS","title":"LUMOS: Language-Conditioned Imitation Learning with World Models","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb","text"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2503.10370","code_url":"https://github.com/nematoli/lumos","project_url":"http://lumos.cs.uni-freiburg.de/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008896,"per_frame_max":0.01723,"per_action_step_min":0.003114,"currency":"USD"},"latency_p50_ms_min":55},{"id":"nicklashansen/td-mpc2","name":"TD-MPC2","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","domain":"general","domains":["general"],"family":"mbrl","families":["mbrl"],"subsection":"8. World Models in the context of Model-Based RL","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"override","tier_reason":"Source list records no link, but code and 317-task checkpoints are public under MIT.","vendor":null,"weights_url":"https://github.com/nicklashansen/tdmpc2","routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["action"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2023,"arxiv_url":"https://arxiv.org/abs/2310.16828","code_url":"https://github.com/nicklashansen/tdmpc2","project_url":null,"providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.00835,"per_frame_max":0.016084,"per_action_step_min":0.002923,"currency":"USD"},"latency_p50_ms_min":39},{"id":"nvidia/dreamgen","name":"DreamGen","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2505.12705","code_url":"https://github.com/nvidia/GR00T-dreams","project_url":"https://research.nvidia.com/labs/gear/dreamgen/","providers":["baseten","fal","modal","nvidia-nim","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.00883,"per_frame_max":0.015149,"per_action_step_min":0.003091,"currency":"USD"},"latency_p50_ms_min":44},{"id":"nvidia/flare","name":"FLARE","title":"FLARE: Robot Learning with Implicit World Modeling","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation","vla"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2505.15659","code_url":"https://github.com/NVIDIA/Isaac-GR00T","project_url":"https://research.nvidia.com/labs/gear/flare/","providers":["baseten","fal","modal","nvidia-nim","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.00872,"per_frame_max":0.016229,"per_action_step_min":0.003052,"currency":"USD"},"latency_p50_ms_min":48},{"id":"nvidia/gr00t-n1-7","name":"GR00T N1.7","title":"NVIDIA Isaac GR00T N1.7, a Foundation Model for Generalist Humanoid Robots","domain":"embodied","domains":["embodied"],"family":"foundation","families":["foundation","manipulation"],"subsection":null,"era":"current","kind":"policy","is_world_model":false,"tier":"servable","tier_source":"override","tier_reason":"Open checkpoint plus a ZMQ PolicyServer in the Isaac-GR00T repo.","vendor":"NVIDIA","weights_url":"https://huggingface.co/nvidia/GR00T-N1.7-3B","routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","proprio","language"],"outputs":["action"]},"embodiments":["humanoid","arm"],"action_spaces":["joint_pos_23","joint_pos_29","ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2503.14734","code_url":"https://github.com/NVIDIA/Isaac-GR00T","project_url":"https://developer.nvidia.com/isaac/gr00t","providers":["baseten","fal","modal","nvidia-nim","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.010596,"per_frame_max":0.019122,"per_action_step_min":0.003704,"currency":"USD"},"latency_p50_ms_min":42},{"id":"octo-models/octo-base","name":"Octo","title":"Octo: An Open-Source Generalist Robot Policy","domain":"embodied","domains":["embodied"],"family":"policy-learning","families":["policy-learning"],"subsection":null,"era":"current","kind":"policy","is_world_model":false,"tier":"servable","tier_source":"override","tier_reason":"Open transformer policy trained on Open X-Embodiment, MIT licensed.","vendor":"UC Berkeley / Stanford","weights_url":"https://huggingface.co/rail-berkeley/octo-base-1.5","routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","proprio","language"],"outputs":["action"]},"embodiments":["arm","mobile-base"],"action_spaces":["ee_delta_6d_grip","joint_pos_7","base_twist_2d","waypoint_se2"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2405.12213","code_url":"https://github.com/octo-models/octo","project_url":"https://octo-models.github.io","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008732,"per_frame_max":0.017474,"per_action_step_min":0.003056,"currency":"USD"},"latency_p50_ms_min":50},{"id":"openhelix/ud-vla","name":"UD-VLA","title":"Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","text","proprio"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2511.01718","code_url":"https://github.com/OpenHelix-Team/UD-VLA","project_url":"https://irpn-eai.github.io/UD-VLA.github.io/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008697,"per_frame_max":0.017904,"per_action_step_min":0.003044,"currency":"USD"},"latency_p50_ms_min":56},{"id":"openvla/openvla-7b","name":"OpenVLA","title":"OpenVLA: An Open-Source Vision-Language-Action Model","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":null,"era":"current","kind":"policy","is_world_model":false,"tier":"servable","tier_source":"override","tier_reason":"7B checkpoint on Hugging Face under MIT, with published inference code.","vendor":"Stanford / Google / TRI","weights_url":"https://huggingface.co/openvla/openvla-7b","routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","language"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2406.09246","code_url":"https://github.com/openvla/openvla","project_url":"https://openvla.github.io","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008882,"per_frame_max":0.01638,"per_action_step_min":0.003109,"currency":"USD"},"latency_p50_ms_min":41},{"id":"orangesodahub/orv","name":"ORV","title":"ORV: 4D Occupancy-centric Robot Video Generation","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb","pointcloud"],"outputs":["video","occupancy"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.03079","code_url":"https://github.com/OrangeSodahub/ORV","project_url":"https://orangesodahub.github.io/ORV/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.012462,"per_frame_max":0.024894,"per_action_step_min":0.004362,"currency":"USD"},"latency_p50_ms_min":40},{"id":"perceptron/isaac-0-5","name":"Isaac 0.5","title":"A sparse 36B model for video understanding, embodied reasoning and robot control","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla","manipulation","foundation"],"subsection":null,"era":"current","kind":"policy","is_world_model":false,"tier":"servable","tier_source":"override","tier_reason":"Apache-2.0 on both the weights and the code, verified from the LICENSE file in the HF repo and the model card's own metadata. 42 safetensors shards are public and ungated, and the deployable LeRobot package ships with them under lerobot_policy/ with its own config, pre and post processor pipelines and a pinned policy class (perceptron_isaac). That package is a LIBERO artifact: 7-d end effector actions, 8-d proprio, cameras image and wrist_image. Grounding is not served from it, so this model is registered for act only. Announced 2026-08-26.","vendor":"Perceptron AI","weights_url":"https://huggingface.co/PerceptronAI/Isaac-0.5","routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","video","proprio","language"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2026,"arxiv_url":null,"code_url":"https://github.com/perceptron-ai-inc/isaac","project_url":"https://www.perceptron.inc","providers":["baseten","fal","modal","modal-sidekick-2","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.006,"per_frame_max":0.017458,"per_action_step_min":0.0028,"currency":"USD"},"latency_p50_ms_min":55},{"id":"physical-intelligence/pi-0","name":"π0","title":"A Vision-Language-Action Flow Model for General Robot Control","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla","manipulation"],"subsection":null,"era":"current","kind":"policy","is_world_model":false,"tier":"servable","tier_source":"override","tier_reason":"Weights and serving code released as openpi; runs behind the openpi websocket policy server.","vendor":"Physical Intelligence","weights_url":"https://huggingface.co/physical-intelligence/pi0-base","routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","proprio","language"],"outputs":["action"]},"embodiments":["arm","bimanual"],"action_spaces":["ee_delta_6d_grip","joint_pos_7","joint_pos_14"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2410.24164","code_url":"https://github.com/Physical-Intelligence/openpi","project_url":"https://www.pi.website/blog/openpi","providers":["baseten","fal","modal","modal-sidekick-2","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.006,"per_frame_max":0.017272,"per_action_step_min":0.0012,"currency":"USD"},"latency_p50_ms_min":39},{"id":"physical-intelligence/pi-0-5","name":"π0.5","title":"A Vision-Language-Action Model with Open-World Generalization","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla","manipulation"],"subsection":null,"era":"current","kind":"policy","is_world_model":false,"tier":"servable","tier_source":"override","tier_reason":"Released in openpi; knowledge-insulation upgrade over pi0.","vendor":"Physical Intelligence","weights_url":"https://huggingface.co/physical-intelligence","routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","proprio","language"],"outputs":["action"]},"embodiments":["arm","mobile-base","bimanual"],"action_spaces":["ee_delta_6d_grip","joint_pos_7","base_twist_2d","waypoint_se2","joint_pos_14"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2504.16054","code_url":"https://github.com/Physical-Intelligence/openpi","project_url":"https://www.pi.website/blog/pi05","providers":["baseten","fal","modal","modal-sidekick-2","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.006,"per_frame_max":0.014989,"per_action_step_min":0.0012,"currency":"USD"},"latency_p50_ms_min":56},{"id":"physical-intelligence/pi-0-fast","name":"π0-FAST","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla","manipulation"],"subsection":null,"era":"current","kind":"policy","is_world_model":false,"tier":"servable","tier_source":"override","tier_reason":"Autoregressive variant of pi0 released in the same openpi repo.","vendor":"Physical Intelligence","weights_url":"https://huggingface.co/physical-intelligence/pi0-fast-base","routable":true,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","proprio","language"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2501.09747","code_url":"https://github.com/Physical-Intelligence/openpi","project_url":"https://www.pi.website/research/fast","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.0086,"per_frame_max":0.016081,"per_action_step_min":0.00301,"currency":"USD"},"latency_p50_ms_min":48},{"id":"rainbow979/robodreamer","name":"RoboDreamer","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2404.12377","code_url":"https://github.com/rainbow979/robodreamer","project_url":"https://robovideo.github.io","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008588,"per_frame_max":0.017221,"per_action_step_min":0.003006,"currency":"USD"},"latency_p50_ms_min":49},{"id":"robbyant/lingbot-va","name":"LingBot-VA","title":"LingBot-VA: Causal video-action world model for generalist robot control","domain":"embodied","domains":["embodied"],"family":"policy-learning","families":["policy-learning"],"subsection":"6. World Models x Policy Learning","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video","action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2026,"arxiv_url":"https://arxiv.org/abs/2601.21998","code_url":"https://github.com/Robbyant/lingbot-va","project_url":"https://technology.robbyant.com/lingbot-va","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008987,"per_frame_max":0.017517,"per_action_step_min":0.003145,"currency":"USD"},"latency_p50_ms_min":44},{"id":"robert-gyj/ctrl-world","name":"Ctrl-World","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video","action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2510.10125","code_url":"https://github.com/Robert-gyj/Ctrl-World","project_url":"https://ctrl-world.github.io/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008696,"per_frame_max":0.01611,"per_action_step_min":0.003043,"currency":"USD"},"latency_p50_ms_min":41},{"id":"shuangli59/uva","name":"UVA","title":"UVA, Unified Video Action Model","domain":"embodied","domains":["embodied"],"family":"policy-learning","families":["policy-learning"],"subsection":"6. World Models x Policy Learning","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video","action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2503.00200","code_url":"https://github.com/ShuangLI59/unified_video_action","project_url":"https://unified-video-action-model.github.io/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008731,"per_frame_max":0.017858,"per_action_step_min":0.003056,"currency":"USD"},"latency_p50_ms_min":41},{"id":"simpler/simpler","name":"Simpler","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","domain":"embodied","domains":["embodied"],"family":"policy-eval","families":["policy-eval"],"subsection":"7. World Models for Policy evaluation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act","evaluate"],"modalities":{"inputs":["rgb"],"outputs":["video","score"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2405.05941","code_url":"https://github.com/simpler-env/SimplerEnv","project_url":null,"providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008146,"per_frame_max":0.016875,"per_action_step_min":0.002851,"currency":"USD"},"latency_p50_ms_min":42},{"id":"skyworkai/matrix-game","name":"Matrix-Game","title":"Matrix-Game: Interactive World Foundation Model.","domain":"game","domains":["game"],"family":"game-sim","families":["game-sim"],"subsection":null,"era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["virtual-agent"],"action_spaces":["discrete_button","keyboard_mouse","continuous_2d"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.18701","code_url":"https://github.com/SkyworkAI/Matrix-Game","project_url":null,"providers":["baseten","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008728,"per_frame_max":0.017904,"per_action_step_min":0.003055,"currency":"USD"},"latency_p50_ms_min":51},{"id":"thu-ml/ivideogpt","name":"iVideoGPT","title":"iVideoGPT: Interactive VideoGPTs are Scalable World Models","domain":"embodied","domains":["embodied"],"family":"foundation","families":["foundation"],"subsection":"1. Foundation Embodied World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2405.15223","code_url":"https://github.com/thuml/iVideoGPT","project_url":"https://thuml.github.io/iVideoGPT/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.011325,"per_frame_max":0.021119,"per_action_step_min":0.003959,"currency":"USD"},"latency_p50_ms_min":38},{"id":"umass/tesseract","name":"TesserAct","title":"TesserAct: Learning 4D Embodied World Models","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb","pointcloud"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2504.20995","code_url":"https://github.com/UMass-Embodied-AGI/TesserAct","project_url":"https://tesseractworld.github.io/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.011446,"per_frame_max":0.023218,"per_action_step_min":0.004006,"currency":"USD"},"latency_p50_ms_min":43},{"id":"xiaomi/xiaomi-robotics-u0","name":"Xiaomi-Robotics-U0","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","domain":"embodied","domains":["embodied"],"family":"foundation","families":["foundation"],"subsection":"1. Foundation Embodied World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2026,"arxiv_url":"https://arxiv.org/abs/2607.11643","code_url":"https://github.com/XiaomiRobotics/Xiaomi-Robotics-U0","project_url":"https://robotics.xiaomi.com/xiaomi-robotics-u0.html","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.010336,"per_frame_max":0.021964,"per_action_step_min":0.003613,"currency":"USD"},"latency_p50_ms_min":40},{"id":"zhangwenyao1/dreamvla","name":"DreamVLA","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"servable","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","text"],"outputs":["video","action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2507.04447","code_url":"https://github.com/Zhangwenyao1/DreamVLA","project_url":"https://zhangwenyao1.github.io/DreamVLA/","providers":["baseten","fal","modal","sidekick-cloud","sidekick-edge","vendor-direct"],"pricing":{"per_frame_min":0.008217,"per_frame_max":0.017592,"per_action_step_min":0.002876,"currency":"USD"},"latency_p50_ms_min":39},{"id":"1x/1x-world-model","name":"1X World Model","title":"1X World Model, 1X World Model","domain":"embodied","domains":["embodied"],"family":"locomotion","families":["locomotion"],"subsection":"4. World Models for Locomotion","era":"current","kind":"world-model","is_world_model":true,"tier":"closed","tier_source":"override","tier_reason":"Humanoid world model, internal. Partner target for the humanoid embodiment.","vendor":"1X Technologies","weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["humanoid"],"action_spaces":["joint_pos_23","joint_pos_29","ee_delta_6d_grip"],"year":null,"arxiv_url":null,"code_url":null,"project_url":"https://www.1x.tech/discover/1x-world-model","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"agibot/genie-envisioner","name":"Genie Envisioner","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","domain":"embodied","domains":["embodied"],"family":"foundation","families":["foundation"],"subsection":"1. Foundation Embodied World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"override","tier_reason":"CC BY-NC-SA 4.0 on the model and data (Apache-2.0 only on some code subdirectories), so it cannot be offered commercially. Also GE-Act's general checkpoint is ModelScope-only, not on HF.","vendor":"AgiBot","weights_url":"https://huggingface.co/agibot-world/Genie-Envisioner","routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2508.05635","code_url":"https://github.com/AgibotTech/Genie-Envisioner","project_url":"https://genie-envisioner.github.io/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"amap-ml/dreamx-world-1-0","name":"DreamX-World 1.0","title":"DreamX-World 1.0: A General-Purpose Interactive World Model","domain":"general","domains":["general"],"family":"foundation-general","families":["foundation-general"],"subsection":"1. Foundation World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"integration","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2026,"arxiv_url":"https://arxiv.org/abs/2606.16993","code_url":"https://github.com/AMAP-ML/DreamX-World","project_url":null,"providers":["modal","sidekick-cloud"],"pricing":{"per_frame_min":0.004319,"per_frame_max":0.005269,"per_action_step_min":0.001512,"currency":"USD"},"latency_p50_ms_min":235},{"id":"baai/emu-3","name":"Emu 3","title":"Emu3: Next-Token Prediction is All You Need","domain":"general","domains":["general"],"family":"vision-2d","families":["vision-2d"],"subsection":"2. Building World Models from 2D Vision Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"integration","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["latent"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2409.18869","code_url":"https://github.com/baaivision/Emu3","project_url":"https://emu.baai.ac.cn","providers":["modal","sidekick-cloud"],"pricing":{"per_frame_min":0.003694,"per_frame_max":0.00448,"per_action_step_min":0.001293,"currency":"USD"},"latency_p50_ms_min":189},{"id":"berkeley/ego-vcp","name":"Ego-VCP","title":"Ego-Vision World Model for Humanoid Contact Planning","domain":"embodied","domains":["embodied"],"family":"locomotion","families":["locomotion"],"subsection":"4. World Models for Locomotion","era":"current","kind":"world-model","is_world_model":true,"tier":"integration","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","tactile","proprio"],"outputs":["video"]},"embodiments":["humanoid"],"action_spaces":["joint_pos_23","joint_pos_29","ee_delta_6d_grip"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2510.11682","code_url":"https://github.com/HybridRobotics/Ego-VCP","project_url":"https://ego-vcp.github.io/","providers":["modal","sidekick-cloud"],"pricing":{"per_frame_min":0.003375,"per_frame_max":0.004285,"per_action_step_min":0.001181,"currency":"USD"},"latency_p50_ms_min":253},{"id":"community/accelerating-model-based-reinforcement-learning","name":"Accelerating Model-Based Reinforcement Learning with State-Space World Models","title":"Accelerating Model-Based Reinforcement Learning with State-Space World Models","domain":"embodied","domains":["embodied"],"family":"locomotion","families":["locomotion"],"subsection":"4. World Models for Locomotion","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","tactile","proprio"],"outputs":["video"]},"embodiments":["humanoid"],"action_spaces":["joint_pos_23","joint_pos_29","ee_delta_6d_grip"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2502.20168","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/agent-learning-via-early-experience","name":"Agent Learning via Early Experience","title":"Agent Learning via Early Experience","domain":"general","domains":["general"],"family":"language","families":["language"],"subsection":"4. Building World Models from Language Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2510.08558","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/cellflux","name":"CellFlux","title":"CellFlux: Simulating Cellular Morphology Changes via Flow Matching","domain":"science","domains":["science"],"family":"science","families":["science"],"subsection":null,"era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["tensor"],"outputs":["field"]},"embodiments":["none"],"action_spaces":[],"year":2025,"arxiv_url":"https://arxiv.org/abs/2502.09775","code_url":null,"project_url":"https://yuhui-zh15.github.io/CellFlux/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/context-as-memory","name":"Context as Memory","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","domain":"general","domains":["general"],"family":"memory","families":["memory"],"subsection":"10. Memory in World Model","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","text"],"outputs":["video","score"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.03141","code_url":null,"project_url":"https://context-as-memory.github.io/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/continual-reinforcement-learning-by-planning","name":"Continual Reinforcement Learning by Planning with Online World Models","title":"Continual Reinforcement Learning by Planning with Online World Models","domain":"general","domains":["general"],"family":"mbrl","families":["mbrl"],"subsection":"8. World Models in the context of Model-Based RL","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","tactile"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2507.09177","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/cosmos-drive-dreams","name":"Cosmos-Drive-Dreams","title":"Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models","domain":"driving","domains":["driving"],"family":"driving","families":["driving"],"subsection":null,"era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","multicam"],"outputs":["video"]},"embodiments":["vehicle"],"action_spaces":["steer_accel_2d","waypoint_se2","trajectory_bev"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.09042","code_url":null,"project_url":"https://research.nvidia.com/labs/toronto-ai/cosmos_drive_dreams","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/cosmos-predict-2-5-cosmos-transfer-2-5","name":"Cosmos Predict 2.5 & Cosmos Transfer 2.5","title":"Cosmos Predict 2.5 & Transfer 2.5: Evolving the World Foundation Models for Physical AI","domain":"general","domains":["general"],"family":"foundation-general","families":["foundation-general"],"subsection":"1. Foundation World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"integration","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":true,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":null,"arxiv_url":null,"code_url":"https://github.com/nvidia-cosmos","project_url":"https://huggingface.co/blog/nvidia/cosmos-predict-and-transfer2-5","providers":["modal","sidekick-cloud"],"pricing":{"per_frame_min":0.004061,"per_frame_max":0.005187,"per_action_step_min":0.001421,"currency":"USD"},"latency_p50_ms_min":246},{"id":"community/cot-vla","name":"CoT-VLA","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","text"],"outputs":["video","action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2503.22020","code_url":null,"project_url":"https://cot-vla.github.io/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/dex-wm","name":"Dex-WM","title":"Dex-WM, \"\"","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2512.13644","code_url":null,"project_url":"https://raktimgg.github.io/dexwm/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/diffusion-forcing","name":"Diffusion Forcing","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","domain":"general","domains":["general"],"family":"vision-2d","families":["vision-2d"],"subsection":"2. Building World Models from 2D Vision Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["latent"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2407.01392","code_url":null,"project_url":"https://boyuan.space/diffusion-forcing","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/dino-foresight","name":"DINO-Foresight","title":"DINO-Foresight, \"DINO-Foresight: Looking into the Future with DINO","domain":"general","domains":["general"],"family":"latent","families":["latent"],"subsection":"6. Latent Space World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":null,"arxiv_url":null,"code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/dino-wm","name":"DINO-WM","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","domain":"general","domains":["general"],"family":"latent","families":["latent"],"subsection":"6. Latent Space World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2411.04983","code_url":null,"project_url":"https://dino-wm.github.io/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/dino-world","name":"DINO-World","title":"Back to the Features: DINO as a Foundation for Video World Models","domain":"general","domains":["general"],"family":"latent","families":["latent"],"subsection":"6. Latent Space World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2507.19468","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/dreamerv4","name":"Dreamerv4","title":"Training Agents Inside of Scalable World Models","domain":"embodied","domains":["embodied"],"family":"policy-learning","families":["policy-learning"],"subsection":"6. World Models x Policy Learning","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2509.24527","code_url":null,"project_url":"https://danijar.com/project/dreamer4/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/dvla","name":"dVLA","title":"dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb","text"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2509.25681","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/dwl","name":"DWL","title":"Advancing Humanoid Locomotion: Mastering Challenging Terrains with Denoising World Model Learning","domain":"embodied","domains":["embodied"],"family":"locomotion","families":["locomotion"],"subsection":"4. World Models for Locomotion","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","proprio"],"outputs":["action"]},"embodiments":["humanoid","quadruped"],"action_spaces":["joint_pos_23","joint_pos_29","ee_delta_6d_grip","joint_pos_12","base_twist_2d"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2408.14472","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/dyna-2","name":"Dyna-2","title":"Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models","domain":"embodied","domains":["embodied"],"family":"policy-learning","families":["policy-learning"],"subsection":"6. World Models x Policy Learning","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":null,"arxiv_url":null,"code_url":null,"project_url":"https://www.dyna.co/dyna-2","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/dyna-think","name":"Dyna-Think","title":"Dyna-Think: Synergizing Reasoning, Acting, and World Model Simulation in AI Agents","domain":"general","domains":["general"],"family":"language","families":["language"],"subsection":"4. Building World Models from Language Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.00320","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/emu-3-5","name":"Emu 3.5","title":"Emu3.5: Native Multimodal Models are World Learners","domain":"general","domains":["general"],"family":"vision-2d","families":["vision-2d"],"subsection":"2. Building World Models from 2D Vision Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2510.26583","code_url":null,"project_url":"https://emu.world/pages/web/landingPage","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/enerverse","name":"Enerverse","title":"EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2501.01895","code_url":null,"project_url":"https://sites.google.com/view/enerverse","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/fantasyworld","name":"FantasyWorld","title":"FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction","domain":"general","domains":["general"],"family":"vision-3d","families":["vision-3d"],"subsection":"3. Building World Models from 3D Vision Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2509.21657","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/flow-as-action","name":"Flow-as-Action","title":"Latent Policy Steering with Embodiment-Agnostic Pretrained World Models","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["action","latent"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2507.13340","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/geometry-forcing","name":"Geometry Forcing","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","domain":"general","domains":["general"],"family":"vision-2d","families":["vision-2d"],"subsection":"2. Building World Models from 2D Vision Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video","latent"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2507.07982","code_url":null,"project_url":"https://GeometryForcing.github.io","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/gigaworld-1","name":"GigaWorld-1","title":"GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation","domain":"embodied","domains":["embodied"],"family":"policy-eval","families":["policy-eval"],"subsection":"7. World Models for Policy evaluation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["act","evaluate"],"modalities":{"inputs":["rgb"],"outputs":["action","score"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2026,"arxiv_url":"https://arxiv.org/abs/2607.02642","code_url":null,"project_url":"https://open-gigaai.github.io/giga-world-1/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/hierarchical-world-model","name":"Hierarchical World Model","title":"H-WM: Robotic Task and Motion Planning Guided by Hierarchical World Model","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2026,"arxiv_url":"https://arxiv.org/abs/2602.11291","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/i-jepa","name":"I-JEPA","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","domain":"general","domains":["general"],"family":"latent","families":["latent"],"subsection":"6. Latent Space World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","proprio"],"outputs":["latent"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2023,"arxiv_url":"https://arxiv.org/abs/2301.08243","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/kairos","name":"Kairos","title":"Kairos: A Native World Model Stack for Physical AI","domain":"general","domains":["general"],"family":"foundation-general","families":["foundation-general"],"subsection":"1. Foundation World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2026,"arxiv_url":"https://arxiv.org/abs/2606.16533","code_url":null,"project_url":"https://huggingface.co/papers/2606.16533","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/keyworld","name":"KeyWorld","title":"KeyWorld: Key Frame Reasoning Enables Effective and Efficient World Models","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2509.21027","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/learning-humanoid-locomotion-with-world-model","name":"Learning Humanoid Locomotion with World Model Reconstruction","title":"Learning Humanoid Locomotion with World Model Reconstruction","domain":"embodied","domains":["embodied"],"family":"locomotion","families":["locomotion"],"subsection":"4. World Models for Locomotion","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","proprio"],"outputs":["action"]},"embodiments":["humanoid","quadruped"],"action_spaces":["joint_pos_23","joint_pos_29","ee_delta_6d_grip","joint_pos_12","base_twist_2d"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2502.16230","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/learning-primitive-embodied-world-models","name":"Learning Primitive Embodied World Models","title":"Learning Primitive Embodied World Models: Towards Scalable Robotic Learning","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2508.20840","code_url":null,"project_url":"https://qiaosun22.github.io/PrimitiveWorld/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/lingbot-va-2-0","name":"LingBot-VA 2.0","title":"Native Video-Action Pretraining for Generalizable Robot Control","domain":"embodied","domains":["embodied"],"family":"policy-learning","families":["policy-learning"],"subsection":"6. World Models x Policy Learning","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video","action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2026,"arxiv_url":"https://arxiv.org/abs/2607.08639","code_url":null,"project_url":"https://technology.robbyant.com/lingbot-va-v2","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/long-context-state-space-video-world-models","name":"Long-Context State-Space Video World Models","title":"Long-Context State-Space Video World Models","domain":"general","domains":["general"],"family":"vision-2d","families":["vision-2d"],"subsection":"2. Building World Models from 2D Vision Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb","text","proprio"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2505.20171","code_url":null,"project_url":"https://ryanpo.com/ssm_wm","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/marble","name":"Marble","title":"Generating Bigger and Better Worlds","domain":"general","domains":["general"],"family":"foundation-general","families":["foundation-general"],"subsection":"1. Foundation World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":null,"arxiv_url":null,"code_url":null,"project_url":"https://www.worldlabs.ai/blog/bigger-better-worlds","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/matrix-3d","name":"Matrix-3D","title":"Matrix-3D, Matrix-3D: Omnidirectional Explorable 3D World Generation","domain":"game","domains":["game"],"family":"game-sim","families":["game-sim"],"subsection":null,"era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["virtual-agent"],"action_spaces":["discrete_button","keyboard_mouse","continuous_2d"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2508.08086","code_url":null,"project_url":"https://matrix-3d.github.io","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/matrix-game-2-0","name":"Matrix-Game 2.0","title":"Matrix-Game 2.0, Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model","domain":"game","domains":["game"],"family":"game-sim","families":["game-sim"],"subsection":null,"era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["virtual-agent"],"action_spaces":["discrete_button","keyboard_mouse","continuous_2d"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2508.13009","code_url":null,"project_url":"https://matrix-game-v2.github.io/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/medical-world-model","name":"Medical World Model","title":"Medical World Model: Generative Simulation of Tumor Evolution for Treatment Planning","domain":"science","domains":["science"],"family":"science","families":["science"],"subsection":null,"era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["tensor"],"outputs":["field"]},"embodiments":["none"],"action_spaces":[],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.02327","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/mimic-video","name":"mimic-video","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video","action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2512.15692","code_url":null,"project_url":"https://mimic-video.github.io","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/mind","name":"MinD","title":"MinD: Unified Visual Imagination and Control via Hierarchical World Models","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video","action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.18897","code_url":null,"project_url":"https://manipulate-in-dream.github.io/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/mindjourney","name":"MindJourney","title":"MindJourney: Test-Time Scaling with World Models for Spatial Reasoning","domain":"embodied","domains":["embodied"],"family":"navigation","families":["navigation"],"subsection":"3. World Models for Navigation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["mobile-base"],"action_spaces":["base_twist_2d","waypoint_se2"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2507.12508","code_url":null,"project_url":"https://umass-embodied-agi.github.io/MindJourney","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/mixture-of-contexts-for-long-video-generation","name":"Mixture of Contexts for Long Video Generation","title":"Mixture of Contexts for Long Video Generation","domain":"general","domains":["general"],"family":"memory","families":["memory"],"subsection":"10. Memory in World Model","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb","text"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2508.21058","code_url":null,"project_url":"https://primecai.github.io/moc/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/mosim","name":"MoSim","title":"Neural Motion Simulator Pushing the Limit of World Models in Reinforcement Learning","domain":"general","domains":["general"],"family":"mbrl","families":["mbrl"],"subsection":"8. World Models in the context of Model-Based RL","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","tactile"],"outputs":["video","action"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2504.07095","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/motus","name":"Motus","title":"Motus: A Unified Latent Action World Model","domain":"embodied","domains":["embodied"],"family":"vla","families":["vla"],"subsection":"5. World Models x VLAs","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["act"],"modalities":{"inputs":["rgb"],"outputs":["action","latent"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2512.13030","code_url":null,"project_url":"https://motus-robotics.github.io/motus","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/npe","name":"NPE","title":"A Compositional Object-Based Approach to Learning Physical Dynamics","domain":"general","domains":["general"],"family":"object-centric","families":["object-centric"],"subsection":"7. Building World Models from an Object-Centric Perspective","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2016,"arxiv_url":"https://arxiv.org/abs/1612.00341","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/nwm","name":"NWM","title":"Navigation World Models","domain":"embodied","domains":["embodied"],"family":"navigation","families":["navigation"],"subsection":"3. World Models for Navigation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["mobile-base"],"action_spaces":["base_twist_2d","waypoint_se2"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2412.03572","code_url":null,"project_url":"https://www.amirbar.net/nwm/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/object-centric-world-model-for-language-guided","name":"Object-Centric World Model for Language-Guided Manipulation","title":"Object-Centric World Model for Language-Guided Manipulation","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","text"],"outputs":["video"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2503.06170","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/osvi-wm","name":"OSVI-WM","title":"OSVI-WM: One-Shot Visual Imitation for Unseen Tasks using World-Model-Guided Trajectory Generation","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video","action"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2505.20425","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/owl-1","name":"Owl-1","title":"Owl-1: Omni World Model for Consistent Long Video Generation","domain":"general","domains":["general"],"family":"vision-2d","families":["vision-2d"],"subsection":"2. Building World Models from 2D Vision Priors","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2024,"arxiv_url":"https://arxiv.org/abs/2412.09600","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/pan","name":"PAN","title":"PAN: A World Model for General, Interactable, and Long-Horizon World Simulation","domain":"general","domains":["general"],"family":"foundation-general","families":["foundation-general"],"subsection":"1. Foundation World Models","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["agnostic"],"action_spaces":["latent_action","continuous_nd"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2511.09057","code_url":null,"project_url":"https://panworld.ai/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/particleformer","name":"ParticleFormer","title":"ParticleFormer: A 3D Point Cloud World Model for Multi-Object, Multi-Material Robotic Manipulation","domain":"embodied","domains":["embodied"],"family":"manipulation","families":["manipulation"],"subsection":"2. World Models for Manipulation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb","pointcloud"],"outputs":["occupancy"]},"embodiments":["arm"],"action_spaces":["ee_delta_6d_grip","joint_pos_7"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2506.23126","code_url":null,"project_url":"https://suninghuang19.github.io/particleformer_page/","providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null},{"id":"community/persistent-embodied-world-models","name":"Persistent Embodied World Models","title":"Learning 3D Persistent Embodied World Models","domain":"embodied","domains":["embodied"],"family":"navigation","families":["navigation"],"subsection":"3. World Models for Navigation","era":"current","kind":"world-model","is_world_model":true,"tier":"catalog","tier_source":"derived","tier_reason":null,"vendor":null,"weights_url":null,"routable":false,"featured":true,"contracts":["predict","act"],"modalities":{"inputs":["rgb"],"outputs":["video"]},"embodiments":["mobile-base"],"action_spaces":["base_twist_2d","waypoint_se2"],"year":2025,"arxiv_url":"https://arxiv.org/abs/2505.05495","code_url":null,"project_url":null,"providers":[],"pricing":{"per_frame_min":null,"per_frame_max":null,"per_action_step_min":null,"currency":"USD"},"latency_p50_ms_min":null}]}