Teahose.
SIGN IN
NEW HERE — WHAT TEAHOSE DOES
We read the entire AI & tech firehose — so you don't have to.
PODPodcastsAll-In, No Priors, Acquired…
NEWNewslettersStratechery, Newcomer…
PAPPapersPhysical AI research
PHProduct Huntdaily launches
VCInvestor ScoutSequoia, a16z, Benchmark…
CLAUDE DISTILLS →
7 reads, 30 sec each — free, 6 AM ET.
+ a live graph of the companies, people & themes underneath.
HOME/TOPICS/VISION-LANGUAGE MODELS
// TOPIC

Vision-Language Models

ITEMS 139ACROSS PODCASTS · NEWSLETTERS · PAPERS
// TAGGED
139 ITEMS
01
POD20VCAUG 1, 2026
20VC: The Best AI Companies Have Unique Data Acquisition Strategies | Will Simile Kill Kalshi, Polymarkets and NASDAQ | How to Sign Fortune 500 Companies As Customers in Weeks with Joon Sung Park, Simile
HARRY STEBBINGS, JUN SUNG PARK
02
NEWSCOATUEJUL 31, 2026
Charts of the Day
COATUE MANAGEMENT
03
PODTHE A16Z SHOWJUL 29, 2026
AI Micro Dramas, Generative Media, and the Future of Creativity
DAVID SACKS, JUSTINE MOORE
04
PAPRARXIV PHYSICAL AIJUL 29, 2026
ContactFlow: A video action conditioning that transfers across embodiments
SAMI AZIRAR, HERMANN BLUM, ET AL. (ARXIV PHYSICAL AI)
05
PAPRARXIV PHYSICAL AIJUL 29, 2026
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
HENGYI XIE, HAN DING, ET AL. (ARXIV PHYSICAL AI)
06
PAPRARXIV PHYSICAL AIJUL 28, 2026
πR2: Reactive Real-time Flow Policies
SUNGJAE PARK, SHUBHAM TULSIANI
07
PAPRARXIV PHYSICAL AIJUL 27, 2026
Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?
GUOHENG SUN, ANG LI, ET AL. (ARXIV PHYSICAL AI)
08
PAPRARXIV PHYSICAL AIJUL 27, 2026
WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning
MELYA BOUKHEDDIMI, FRANK KIRCHNER, ET AL. (ARXIV PHYSICAL AI)
09
PAPRARXIV PHYSICAL AIJUL 26, 2026
DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
TAIYI SU, YI XU, ET AL. (ARXIV PHYSICAL AI)
10
PAPRARXIV PHYSICAL AIJUL 26, 2026
N0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
NEOTEAI TEAM, FUDAN TEAI TEAM
11
PAPRARXIV PHYSICAL AIJUL 23, 2026
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
XIAOMI ROBOTICS TEAM JUN GUO, QUANYUN ZHOU, ET AL. (ARXIV PHYSICAL AI)
12
PAPRARXIV PHYSICAL AIJUL 22, 2026
Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations
V. DANG, ERDAL KAYACAN, ET AL. (ARXIV PHYSICAL AI)
13
PAPRARXIV PHYSICAL AIJUL 22, 2026
FELT: Generating Tactile Signals from Vision for Visuo-Tactile Manipulation
ZINAN LI, DANIEL SEITA, ET AL. (ARXIV PHYSICAL AI)
14
PAPRARXIV PHYSICAL AIJUL 22, 2026
LENS: LLM-guided Environment Simplification for Planning and Control in Clutter
AILEEN LIAO, MICHAEL POSA, ET AL. (ARXIV PHYSICAL AI)
15
PAPRARXIV PHYSICAL AIJUL 22, 2026
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
HONGYU DING, JIEBO LUO, ET AL. (ARXIV PHYSICAL AI)
16
POD张小珺JÙN|商业访谈录JUL 22, 2026
147. 和蚂蚁灵波沈宇军聊:机器人原生基础模型、大脑和本体的关系、预训练与数据scale up、老师汤晓鸥
张小珺, 沈宇军
17
PAPRARXIV PHYSICAL AIJUL 21, 2026
DiMaS: Distribution Matching for Steering Vision-Language-Action Models
PEGAH KHAYATAN, MATTHIEU CORD, ET AL. (ARXIV PHYSICAL AI)
18
PAPRARXIV PHYSICAL AIJUL 20, 2026
DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation
JIAN ZHU, YI XU, ET AL. (ARXIV PHYSICAL AI)
19
PAPRARXIV PHYSICAL AIJUL 20, 2026
Patch Policy: Efficient Embodied Control via Dense Visual Representations
GAOYUE ZHOU, LERREL PINTO, ET AL. (ARXIV PHYSICAL AI)
20
NEWSSTRATECHERYJUL 17, 2026
Mainframes and Main Characters (This Week in Stratechery)
BEN THOMPSON
21
PAPRARXIV PHYSICAL AIJUL 16, 2026
Reflex: Real-Time VLA Control through Streaming Inference
YUANCHUN GUO, BINGYAN LIU
22
NEWSTHE AI CORNERJUL 13, 2026
Demis Hassabis Says AGI Arrives in 2 to 5 Years. Here Is the Full Picture
THE AI CORNER
23
PAPRARXIV PHYSICAL AIJUL 13, 2026
VIA: Visual Interface Agent for Robot Control
HENGYUAN HU, DORSA SADIGH, ET AL. (ARXIV PHYSICAL AI)
24
PAPRARXIV PHYSICAL AIJUL 12, 2026
VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment
GUOYANG XIA, YAN XIE, ET AL. (ARXIV PHYSICAL AI)
25
PAPRARXIV PHYSICAL AIJUL 10, 2026
DemoBridge: A Simulation-in-the-Loop Toolkit for Single-View Human Demonstration Retargeting
ZEHAO WANG, RAHAF ALJUNDI, ET AL. (ARXIV PHYSICAL AI)
26
PAPRARXIV PHYSICAL AIJUL 7, 2026
Calf-Integrated Arms for Bimanual Quadruped Loco-Manipulation
YAN PAN, CHENGXU ZHOU, ET AL. (ARXIV PHYSICAL AI)
27
NEWSJACK CLARK FROM IMPORT AIJUL 6, 2026
Import AI 464: Fables writes GPU kernels; AI automation; and analog computation
JACK CLARK FROM IMPORT AI
28
NEWSTHE AI CORNERJUL 6, 2026
Zuckerberg's $14B Bet: Glasses Kill the Phone in 5 Years
THE AI CORNER
29
PAPRARXIV PHYSICAL AIJUL 6, 2026
S2-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation
ZHIPENG XIE, JING ZHAO, ET AL. (ARXIV PHYSICAL AI)
30
PAPRARXIV PHYSICAL AIJUL 5, 2026
ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation
TIANYI LU, YU-GANG JIANG, ET AL. (ARXIV PHYSICAL AI)
31
PAPRARXIV PHYSICAL AIJUL 4, 2026
Decoupling the Declarative from the Procedural in Vision-Language-Action Models
NIKOLAOS TSAGKAS, ALEXANDROS KOURIS, ET AL. (ARXIV PHYSICAL AI)
32
PAPRARXIV PHYSICAL AIJUL 3, 2026
CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations
BOWEN JIANG, WILLIAM PAINTER REGER, ROBERTO MARTÍN-MARTÍN
33
PAPRARXIV PHYSICAL AIJUL 1, 2026
FurnitureVLA: Learning Long-Horizon Bimanual Furniture Assembly with Vision-Language-Action Model
CHENYANG MA, DIEGO ROMERES, ET AL. (ARXIV PHYSICAL AI)
34
PODTHE A16Z SHOWJUN 30, 2026
Building AI for Creators | Luma &amp; Phota Labs
MATT TANCIK, YOKO LI, ZACH XIA
35
PAPRARXIV PHYSICAL AIJUN 30, 2026
Adapting Generalist Robot Policies with Semantic Reinforcement Learning
JAGDEEP SINGH BHATIA, SERGEY LEVINE, ET AL. (ARXIV PHYSICAL AI)
36
PAPRARXIV PHYSICAL AIJUN 30, 2026
Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments
XIAOPENG LIN, KAI CHEN, ET AL. (ARXIV PHYSICAL AI)
37
PAPRARXIV PHYSICAL AIJUN 29, 2026
VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes
YEN-JEN WANG, KAREN LIU, ET AL. (ARXIV PHYSICAL AI)
38
PODLENNY'SJUN 28, 2026
OpenAI Codex lead on the new shape of product work | Andrew Ambrosino
ANDREW AMBROSINO, LENNY RACHITSKY
39
PAPRARXIV PHYSICAL AIJUN 23, 2026
InSight: Self-Guided Skill Acquisition via Steerable VLAs
MAGGIE WANG, MAC SCHWAGER, ET AL. (ARXIV PHYSICAL AI)
40
PAPRARXIV PHYSICAL AIJUN 22, 2026
Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering
HYUNDOO JEONG, GOKUL SWAMY, ANDREA V. BAJCSY
41
PAPRARXIV PHYSICAL AIJUN 22, 2026
PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation
NAMAI CHANDRA, SHRIRAM DAMODARAN, LIN WANG
42
PAPRARXIV PHYSICAL AIJUN 20, 2026
OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation
YINGDONG HU, YANG GAO, ET AL. (ARXIV PHYSICAL AI)
43
PAPRARXIV PHYSICAL AIJUN 18, 2026
Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems
YANDONG WANG, CHAO ZHANG, ET AL. (ARXIV PHYSICAL AI)
44
PAPRARXIV PHYSICAL AIJUN 18, 2026
Pose6DAug: Physically Plausible Multi-view Object Swapping for Robot Data Augmentation
JONGHOON LEE, JINWOO SHIN, ET AL. (ARXIV PHYSICAL AI)
45
PAPRARXIV PHYSICAL AIJUN 17, 2026
Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement
KINAM KIM, YASUYUKI MATSUSHITA, ET AL. (ARXIV PHYSICAL AI)
46
PODAI + A16ZJUN 15, 2026
Ideogram’s Open-Weights Image Model and the Future of AI Design
JUSTINE MOORE, MOHAMMAD NOROUZI, YOKO LI
47
PODTHE A16Z SHOWJUN 15, 2026
AI, Design, and the Power of Open Models
A16Z PODCAST HOST, JUSTINE MOORE, MOHAMMAD NOROUZI, YOKO LI
48
PAPRARXIV PHYSICAL AIJUN 15, 2026
What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents
JIAHENG HU, ANNIE XIE, ET AL. (ARXIV PHYSICAL AI)
49
PAPRARXIV PHYSICAL AIJUN 12, 2026
Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack
HE ZHANG, ZHENGYOU ZHANG, ET AL. (ARXIV PHYSICAL AI)
50
PAPRARXIV PHYSICAL AIJUN 11, 2026
Improving Robotic Generalist Policies via Flow Reversal Steering
ANDY TANG, SERGEY LEVINE, ET AL. (ARXIV PHYSICAL AI)
51
PAPRARXIV PHYSICAL AIJUN 10, 2026
CHORUS: Decentralized Multi-Embodiment Collaboration with One VLA Policy
RIA DOSHI, JEANNETTE BOHG, ET AL. (ARXIV PHYSICAL AI)
52
PAPRARXIV PHYSICAL AIJUN 5, 2026
LARA: Latent Action Representation Alignment for Vision-Language-Action Models
MENGYA LIU, SIYUAN HUANG, ET AL. (ARXIV PHYSICAL AI)
53
NEWSAXIOS AI+JUN 4, 2026
🌈 GLAAD's AI warning
AXIOS AI+
54
PAPRARXIV PHYSICAL AIJUN 4, 2026
OneVLA: A Unified Framework for Embodied Tasks
LINGFENG ZHANG, WENBO DING, ET AL. (ARXIV PHYSICAL AI)
55
PAPRARXIV PHYSICAL AIJUN 4, 2026
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
NASTARAN DARABI, A. TRIVEDI
56
PAPRARXIV PHYSICAL AIJUN 3, 2026
FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization
YIHAO WU, ZHENGYOU ZHANG, ET AL. (ARXIV PHYSICAL AI)
57
PAPRARXIV PHYSICAL AIJUN 3, 2026
GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors
TIANYI XIE, YE YUAN, ET AL. (ARXIV PHYSICAL AI)
58
PODTRAINING DATAJUN 2, 2026
Knowing what your customers want, all the time: Listen Labs' Alfred Wahlforss
ALFRED WAHLFORSS, KONSTANTIN
59
PAPRARXIV PHYSICAL AIJUN 2, 2026
ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
YE LI, ZHI WANG, ET AL. (ARXIV PHYSICAL AI)
60
PAPRARXIV PHYSICAL AIJUN 1, 2026
Colosseum V2: Benchmarking Generalization for Vision Language Action Models
JEREMY MORGAN, ISHIKA SINGH, ET AL. (ARXIV PHYSICAL AI)
61
PAPRARXIV PHYSICAL AIJUN 1, 2026
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
SHENGYUN SI, YU-GANG JIANG, ET AL. (ARXIV PHYSICAL AI)
62
PAPRARXIV PHYSICAL AIMAY 28, 2026
EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
PERRY DONG, CHELSEA FINN, ET AL. (ARXIV PHYSICAL AI)
63
PAPRARXIV PHYSICAL AIMAY 28, 2026
FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies
XINTONG HU, TAO YU, ET AL. (ARXIV PHYSICAL AI)
64
PAPRARXIV PHYSICAL AIMAY 28, 2026
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
QIUYUE WANG, XIONGHUI CHEN, ET AL. (ARXIV PHYSICAL AI)
65
PAPRARXIV PHYSICAL AIMAY 28, 2026
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
MINGJIAN GAO, YUETING ZHUANG, ET AL. (ARXIV PHYSICAL AI)
66
POD张小珺JÙN|商业访谈录MAY 28, 2026
143. 对何小鹏的第二次访谈:更大赌注、人形机器人Iron诞生、那场意外、技术剧变下CEO、GX和缝合怪
何小鹏, 小俊
67
PAPRARXIV PHYSICAL AIMAY 22, 2026
GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization
XIAOSONG JIA, YU-GANG JIANG, ET AL. (ARXIV PHYSICAL AI)
68
PAPRARXIV PHYSICAL AIMAY 22, 2026
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
ZIXING LEI, SIHENG CHEN, ET AL. (ARXIV PHYSICAL AI)
69
PODGOOGLE IOMAY 21, 2026
Gemini Robotics — Google IO 2026
GEMINI ROBOTICS TEAM (GOOGLE DEEPMIND), PAUL REES
70
PAPRARXIV PHYSICAL AIMAY 21, 2026
Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors
JIAHE CHEN, JINGBO WANG, ET AL. (ARXIV PHYSICAL AI)
71
PAPRARXIV PHYSICAL AIMAY 21, 2026
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
LIJIN YANG, HAO YANG, ET AL. (ARXIV PHYSICAL AI)
72
PAPRARXIV PHYSICAL AIMAY 21, 2026
PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance
YUPENG ZHENG, WENCHAO DING, ET AL. (ARXIV PHYSICAL AI)
73
PAPRARXIV PHYSICAL AIMAY 20, 2026
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
SHIZHE CHEN, PAUL PACAUD, CORDELIA SCHMID
74
PAPRARXIV PHYSICAL AIMAY 18, 2026
MolmoAct2: Action Reasoning Models for Real-world Deployment
HAOQUAN FANG, RANJAY KRISHNA, ET AL. (ARXIV PHYSICAL AI)
75
PAPRARXIV PHYSICAL AIMAY 18, 2026
StableVLA: Towards Robust Vision-Language-Action Models without Extra Data
YIYANG FU, DAQUAN ZHOU, ET AL. (ARXIV PHYSICAL AI)
76
POD晚点聊 LATETALKMAY 18, 2026
165: 英伟达 GEAR 高深远:世界模型、自进化循环、DreamDojo
MANCHI, 晚点团队
77
PAPRARXIV PHYSICAL AIMAY 17, 2026
Do World Action Models Generalize Better than VLAs? A Robustness Study
ZHANGUANG ZHANG, YINGXUE ZHANG, ET AL. (ARXIV PHYSICAL AI)
78
PAPRARXIV PHYSICAL AIMAY 17, 2026
VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model
WENHAO LI, CHANG XU, ET AL. (ARXIV PHYSICAL AI)
79
PAPRARXIV PHYSICAL AIMAY 13, 2026
Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs
JIAHUI NIU, HUAWEI LI, ET AL. (ARXIV PHYSICAL AI)
80
PAPRARXIV PHYSICAL AIMAY 5, 2026
TiPToP: A Modular Open-Vocabulary Planning System for Robotic Manipulation
WILLIAM SHEN, TOM'AS LOZANO-P'EREZ, ET AL. (ARXIV PHYSICAL AI)
81
PAPRARXIV PHYSICAL AIMAY 4, 2026
$\Delta$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation
YIJIE ZHU, ZITONG YU, ET AL. (ARXIV PHYSICAL AI)
82
PODSEQUOIA AI ASCENTAPR 30, 2026
Jim Fan — VLAs Are Dead, WAMs Are Next
JIM FAN (NVIDIA GEAR), HOST (SEQUOIA)
83
PAPRARXIV PHYSICAL AIAPR 30, 2026
LaST-R1: Reinforcing Action via Adaptive Physical Latent Reasoning for VLA Models
HAO CHEN, PHENG-ANN HENG, ET AL. (ARXIV PHYSICAL AI)
84
PAPRARXIV PHYSICAL AIAPR 29, 2026
Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
JUN GUO, HUAPING LIU, ET AL. (ARXIV PHYSICAL AI)
85
PAPRARXIV PHYSICAL AIAPR 24, 2026
RedVLA: Physical Red Teaming for Vision-Language-Action Models
YUHAO ZHANG, JIAMING JI, ET AL. (ARXIV PHYSICAL AI)
86
PAPRARXIV PHYSICAL AIAPR 21, 2026
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
YIYANG DU, CHENYAN XIONG, ET AL. (ARXIV PHYSICAL AI)
87
PAPRARXIV PHYSICAL AIAPR 21, 2026
UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling
BOYU CHEN, YIXIAO GE, ET AL. (ARXIV PHYSICAL AI)
88
PAPRARXIV PHYSICAL AIAPR 17, 2026
Observing and Controlling Features in Vision-Language-Action Models
HUGO BUURMEIJER, MARCO PAVONE, ET AL. (ARXIV PHYSICAL AI)
89
PAPRARXIV PHYSICAL AIAPR 17, 2026
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
ZIXUAN WANG, JIAYA JIA, ET AL. (ARXIV PHYSICAL AI)
90
PAPRARXIV PHYSICAL AIAPR 16, 2026
R3D: Revisiting 3D Policy Learning
ZHENGDONG HONG, JIAYUAN GU, ET AL. (ARXIV PHYSICAL AI)
91
PAPRARXIV PHYSICAL AIAPR 16, 2026
Vision-Based Safe Human-Robot Collaboration with Uncertainty Guarantees
JAKOB THUMM, MARCO PAVONE, ET AL. (ARXIV PHYSICAL AI)
92
PAPRARXIV PHYSICAL AIAPR 13, 2026
ViserDex: Visual Sim-to-Real for Robust Dexterous In-hand Reorientation
ARJUN BHARDWAJ, MARCO HUTTER, ET AL. (ARXIV PHYSICAL AI)
93
POD张小珺JÙN|商业访谈录APR 10, 2026
135. 和自然选择创始人Tristan聊,Elys、赛博分身、灵魂、Context的获取与流动和AI社交网络
PRODUCER, TRISTAN (张筱帆), 张小珺
94
PAPRARXIV PHYSICAL AIAPR 9, 2026
HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation
SHUANGHAO BAI, BADONG CHEN, ET AL. (ARXIV PHYSICAL AI)
95
PAPRARXIV PHYSICAL AIAPR 9, 2026
LAMP: Lift Image-Editing as General 3D Priors for Open-world Manipulation
JINGJING WANG, GUOFENG ZHANG, ET AL. (ARXIV PHYSICAL AI)
96
PAPRARXIV PHYSICAL AIAPR 7, 2026
Action Images: End-to-End Policy Learning via Multiview Video Generation
HAOYU ZHEN, CHUANG GAN, ET AL. (ARXIV PHYSICAL AI)
97
PAPRARXIV PHYSICAL AIAPR 7, 2026
SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation
WUYANG LUAN, RUI MA, ET AL. (ARXIV PHYSICAL AI)
98
PAPRARXIV PHYSICAL AIAPR 6, 2026
DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation
ZEBIN YANG, MENG LI, ET AL. (ARXIV PHYSICAL AI)
99
PAPRARXIV PHYSICAL AIAPR 6, 2026
Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models
YANRU WU, YUE WANG, ET AL. (ARXIV PHYSICAL AI)
100
NEWSTHE AI CORNERAPR 5, 2026
OpenAI’s Next Image Model Just Leaked. The Examples Are Insane.
THE AI CORNER
101
PAPRARXIV PHYSICAL AIAPR 5, 2026
Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
YUANCHANG LIANG, PRAHLAD VADAKKEPAT, ET AL. (ARXIV PHYSICAL AI)
102
PAPRARXIV PHYSICAL AIAPR 5, 2026
MobileManiBench: Simplifying Model Verification for Mobile Manipulation
WENBO WANG, BAINING GUO, ET AL. (ARXIV PHYSICAL AI)
103
PAPRARXIV PHYSICAL AIAPR 5, 2026
Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models
BRYCE GRANT, XIJIA ZHAO, PENG WANG
104
PAPRARXIV PHYSICAL AIAPR 4, 2026
ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning
YANDAN YANG, MU XU, ET AL. (ARXIV PHYSICAL AI)
105
PAPRARXIV PHYSICAL AIAPR 2, 2026
ForeAct: Steering Your VLA with Efficient Visual Foresight Planning
ZHUOYANG ZHANG, SONG HAN, ET AL. (ARXIV PHYSICAL AI)
106
PAPRARXIV PHYSICAL AIAPR 2, 2026
Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution
RUISI CAI, QUAN ZHOU, ET AL. (ARXIV PHYSICAL AI)
107
POD晚点聊 LATETALKAPR 2, 2026
157: 具身季报26Q1:人形再思考、英伟达世界模型、高自由度灵巧手
MANCHI, 晚点团队
108
PAPRARXIV PHYSICAL AIAPR 1, 2026
Learning Humanoid Navigation from Human Data
WEIZHUO WANG, MONROE KENNEDY, ET AL. (ARXIV PHYSICAL AI)
109
PAPRARXIV PHYSICAL AIMAR 31, 2026
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
YI CHEN, XIHUI LIU, ET AL. (ARXIV PHYSICAL AI)
110
PAPRARXIV PHYSICAL AIMAR 30, 2026
FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
YICHI ZHANG, JIA WAN, ET AL. (ARXIV PHYSICAL AI)
111
PAPRARXIV PHYSICAL AIMAR 30, 2026
OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies
YUNZHOU SONG, KOSTAS DANIILIDIS, ET AL. (ARXIV PHYSICAL AI)
112
PAPRARXIV PHYSICAL AIMAR 30, 2026
SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning
PHILIP SCHROEDER, ONDREJ BIZA, ET AL. (ARXIV PHYSICAL AI)
113
PAPRARXIV PHYSICAL AIMAR 29, 2026
Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization
YE WANG, QIN JIN, ET AL. (ARXIV PHYSICAL AI)
114
PAPRARXIV PHYSICAL AIMAR 29, 2026
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
JI-LU YE, JIANGMIAO PANG, ET AL. (ARXIV PHYSICAL AI)
115
PAPRARXIV PHYSICAL AIMAR 28, 2026
VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model
YANJIANG GUO, CHELSEA FINN, ET AL. (ARXIV PHYSICAL AI)
116
PAPRMIT RESEARCHMAR 25, 2026
Open-World Task and Motion Planning via Vision-Language Model Generated Constraints
NISHANTH KUMAR, CAELAN REED GARRETT, ET AL. (MIT)
117
PAPRARXIV PHYSICAL AIMAR 25, 2026
Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control
WILLIAM CHEN, SERGEY LEVINE, ET AL. (ARXIV PHYSICAL AI)
118
PAPRBEIJING ACADEMY OF ARTIFICIAL INTELLIGENCE (BAAI) RESEARCHMAR 23, 2026
Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills
HAOQI YUAN, ZONGQING LU, ET AL. (BEIJING ACADEMY OF ARTIFICIAL INTELLIGENCE (BAAI))
119
PAPRARXIV PHYSICAL AIMAR 23, 2026
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
ZHIDE ZHONG, HAOANG LI, ET AL. (ARXIV PHYSICAL AI)
120
PAPRARXIV PHYSICAL AIMAR 23, 2026
WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control
HAORAN JIANG, HONGYANG LI, ET AL. (ARXIV PHYSICAL AI)
121
PAPRARXIV PHYSICAL AIMAR 22, 2026
DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
SHENYUAN GAO, LINXIJIMFAN, ET AL. (ARXIV PHYSICAL AI)
122
PODDWARKESHMAR 20, 2026
Terence Tao – Kepler, Newton, and the true nature of mathematical discovery
DWARKESH PATEL, TERENCE TAO
123
PAPRMIT RESEARCHMAR 19, 2026
Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds
ANDREW CHOI, WEI XU, ET AL. (MIT)
124
PAPRMIT RESEARCHMAR 19, 2026
Sparse Autoencoders Reveal Interpretable and Steerable Features in VLA Models
AIDEN SWANN, MAC SCHWAGER, ET AL. (MIT)
125
POD张小珺JÙN|商业访谈录MAR 16, 2026
133. 对谢赛宁的7小时马拉松访谈:世界模型、逃出硅谷、AMI Labs、两次拒绝Ilya、杨立昆、李飞飞和42
ZHANG XIAOJUN, 张小珺
126
PODCLIMB BY VSCMAR 12, 2026
Jagdeep Singh (Rhoda AI) — 10 Hours, Not 10,000: $450M to Train Robots on YouTube
JAGDEEP SINGH (RHODA AI CO-FOUNDER/CEO), HOST
127
PODBLOOMBERG LIVEDEC 1, 2025
Fei-Fei Li (World Labs) — On Creating Large World Models
FEI-FEI LI (WORLD LABS CO-FOUNDER/CEO), BLOOMBERG LIVE HOST
128
PODLATENT SPACENOV 25, 2025
Fei-Fei Li & Justin Johnson (World Labs) — After LLMs: Spatial Intelligence and World Models
FEI-FEI LI (WORLD LABS CO-FOUNDER/CEO), JUSTIN JOHNSON (WORLD LABS CO-FOUNDER), LATENT SPACE HOSTS
129
PODSTANFORD AI SPEAKER SERIESNOV 23, 2025
Stanford AI Club: Jeff Dean on Important AI Trends
JEFF DEAN
130
PODLENNY'SNOV 16, 2025
The Godmother of AI on jobs, robots & why world models are next | Dr. Fei-Fei Li
LENNY (HOST), DR. FEI-FEI LI
131
PODTRAINING DATANOV 11, 2025
How Google’s Nano Banana Achieved Breakthrough Character Consistency
NICOLE BRITOVA, HANSA SRINIVASAN
132
PODTRAINING DATANOV 7, 2025
OpenAI Sora 2 Team: How Generative Video Will Unlock Creativity and World Models
ROHAN SAHAI, THOMAS DIMSON, BILL, THOMAS DIMSON
133
PODZHANG XIAOYUN'SOCT 31, 2025
Interview with Li Xiang (Part 2): CEO Large Model, MoE, Liang Wenfeng, VLA, Energy, Memory, Confronting Human Nature, Intimate Relationships, Human Wisdom
LI XIANG
134
POD张小珺JÙN|商业访谈录 (ZHANG XIAOJUN BUSINESS INTERVIEWS)OCT 30, 2025
Interview with Li Xiang Part 2: CEO Large Model, MoE, Liang Wenfeng, VLA, Energy, Memory, Confronting Human Nature, Intimate Relationships, Human Wisdom
LI XIANG, TIAN ZHEN XIAO JUN
135
POD晚点聊 LATETALK (INVESTIGATIVE JOURNALISM)OCT 23, 2025
138: From the moment you use your mobile phone to when it understands you better, OPPO's mobile phone AI practice | Conversation with Wan Yulong, head of Xiaobu
WAN YULONG, MANQI
136
PODONE-OFF EPISODESOCT 21, 2025
#38 Karol Hausman & Kevin Black: Building A Brain For Any Robot | AI Eating The Physical World
UNKNOWN HOST, KEVIN BLACK, CARL HAUSMAN
137
PODONE-OFF EPISODESSEP 12, 2025
Fully autonomous robots are much closer than you think – Sergey Levine
SERGEY LEVINE, DWARKESH PATEL
138
PODONE-OFF EPISODESJUN 7, 2025
【BAAI2025】 Building Physical Intelligence | Karol Hausman
KAROL HAUSMAN
139
PODONE-OFF EPISODESAPR 26, 2025
The Race to Create General-Purpose Robots | Karol Hausman & Lachy Groom on TBPN
HOST, KAROL HAUSMAN, LACHY GROOM