Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning
视觉语言动作模型所言即所指?论忠实性在具身推理中的作用
Matthew Foutter, Matteo Cercola, Lena Wild, Yunshan Wang, Michelle Li, Daniele Gammelli, Marco Pavone
机构
*
Stanford University(斯坦福大学)
;
Politecnico di Milano(米兰理工大学)
;
KTH Royal Institute of Technology(皇家理工学院)
;
Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所)
;
NVIDIA Research(英伟达研究院)
How to Build Digital Humans? From Priors to Photorealistic Avatars
如何构建数字人?从先验知识到逼真的虚拟形象
Wojciech Zielonka, Tobias Kirschstein, Timo Bolkart, Simon Giebenhain, Vanessa Sklyarova, Xiang Deng, Donglai Xiang, Shunsuke Saito, Yebin Liu, Matthias Niessner, Justus Thies
机构
*
Meta
;
Technical University of Munich(慕尼黑技术大学)
;
Google(谷歌)
;
Tsinghua University(清华大学)
;
Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所)
;
NVIDIA
;
Technical University of Darmstadt(达姆施塔特技术大学)
;
ETH Zurich(苏黎世联邦理工学院)
机构
*
Nanjing University(南京大学)
;
Australian National University(澳大利亚国立大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Nvidia(英伟达)
Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models
检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头
Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song
机构
*
HKUST(香港科技大学)
;
University of Edinburgh(爱丁堡大学)
;
CUHK(香港中文大学)
;
NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司)
;
Tsinghua University(清华大学)
机构
*
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
Technion, NVIDIA(技术学院与NVIDIA)
;
University of Oxford(牛津大学)
;
School of Electronics Engineering(电子工程学院)
;
Computer Science, Peking University(计算机科学,北京大学)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
VIBE:通过真实世界语音进行大型音频-语言模型生成偏见评估的语音诱导开放式偏见评估
Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang, Hung-yi Lee
机构
*
Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通信工程研究所)
;
NVIDIA, Taiwan(台湾NVIDIA)
;
Artificial Intelligence Center of Research Excellence, National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)
Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models
使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移
Alexander Popov, Alperen Degirmenci, David Wehr, Shashank Hegde, Ryan Oldja, Alexey Kamenev, Bertrand Douillard, David Nistér, Urs Muller, Ruchi Bhargava, Stan Birchfield, Nikolai Smolyanskiy
Comments8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU