arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-02-13 至 2026-02-13 共收录 3
2602.11860 2026-02-13 cs.AI

Talk2DM: Enabling Natural Language Querying and Commonsense Reasoning for Vehicle-Road-Cloud Integrated Dynamic Maps with Large Language Models

Talk2DM: 通过大语言模型实现车辆-道路-云集成动态地图的自然语言查询与常识推理

Lu Tao, Jinxuan Luo, Yousuke Watanabe, Zhengshu Zhou, Yuhuan Lu, Shen Ying, Pan Zhang, Fei Zhao, Hiroaki Takada

机构 * School of Resource and Environmental Sciences, Wuhan University(武汉大学资源与环境科学学院) School of Earth Sciences, Yunnan University(云南大学地球科学学院) College of Artificial Intelligence, Tianjin University of Science & Technology(天津科技大学人工智能学院) Department of Computer and Information Engineering, Khalifa University(卡利法大学计算机与信息工程系) NVIDIA Institutes of Innovation for Future Society, Nagoya University(名古屋大学创新未来社会研究所)

AI总结 Talk2DM通过大语言模型实现车辆-道路-云集成动态地图的自然语言查询与常识推理,提升人机交互效率与准确性。

Comments Submitted to IEEE TITS. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11440 2026-02-13 cs.CV

Ctrl&Shift: High-Quality Geometry-Aware Object Manipulation in Visual Generation

Ctrl&Shift: 视觉生成中高质量的几何感知物体操控

Penghui Ruan, Bojia Zi, Xianbiao Qi, Youze Huang, Rong Xiao, Pichao Wang, Jiannong Cao, Yuhui Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) IntelliFusion Inc.(IntelliFusion公司) University of Electronic Science and Technology of China(电子科技大学) NVIDIA

AI总结 Ctrl&Shift通过端到端扩散框架实现高质量几何感知物体操控,无需显式3D建模,兼顾细粒度控制与现实泛化能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11244 2026-02-13 cs.CV

Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

压力测试揭示视频-语言模型中脆弱的时间与视觉基础

Sethuraman T, Savya Khosla, Aditi Tiwari, Vidya Ganesh, Rakshana Jayaprakash, Aditya Jain, Vignesh Srinivasakumar, Onkar Kishor Susladkar, Srinidhi Sunkara, Aditya Shanmugham, Rakesh Vaideeswaran, Abbaas Alif Mohamed Nishar, Simon Jenni, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究) Qualtrics iManage NVIDIA Amazon Science(亚马逊科学) Capital One

AI总结 REVEAL{}通过五个压力测试揭示视频-语言模型在时间与视觉基础方面的脆弱性,展示其在处理视频内容、时间序列和运动方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏