arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

NVIDIA(英伟达)

2026-04-14 至 2026-04-14 共收录 11
2602.04849 2026-04-14 physics.chem-ph cs.AI cs.MA

El Agente Estructural: An Artificially Intelligent Molecular Editor

结构代理:一种人工智能分子编辑器

Changhyeok Choi, Yunheng Zou, Marcel Müller, Han Hao, Yeonghun Kang, Juan B. Pérez-Sánchez, Ignacio Gustin, Hanyong Xu, Andrew Wang, Mohammad Ghazi Vakili, Chris Crebolder, Alán Aspuru-Guzik, Varinia Bernales

机构 * University of Toronto(多伦多大学) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) NVIDIA(英伟达)

AI总结 本文提出El Agente Estructural,一种多模态、自然语言驱动的几何生成与操控代理,用于自主化学和分子建模。该代理通过整合领域知识工具和视觉语言模型,实现对分子结构的精确操控,无需重建核心分子框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20563 2026-04-14 cs.CV cs.AI cs.LG cs.RO

LEAD: Minimizing Learner-Expert Asymmetry in End-to-End Driving

LEAD:最小化学习者-专家不对称性以实现端到端驾驶

Long Nguyen, Micha Fauth, Bernhard Jaeger, Daniel Dauner, Maximilian Igl, Andreas Geiger, Kashyap Chitta

机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) NVIDIA Research(英伟达研究院) KE:SAI

AI总结 本文研究了仿真中专家示范与学生观测不一致对模仿学习的影响,提出TransFuser v6在CARLA等基准中取得新突破,提升驾驶性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09368 2026-04-14 cs.CV cs.LG

RobustSpring: Benchmarking Robustness to Image Corruptions for Optical Flow, Scene Flow and Stereo

RobustSpring:用于光流、场景流和立体视觉的图像破坏鲁棒性基准测试

Victor Oei, Jenny Schmalfuss, Lukas Mehl, Madlen Bartsch, Shashank Agnihotri, Margret Keuper, Andreas Bulling, Andrés Bruhn

机构 * University of Stuttgart(斯图加特大学) NVIDIA(英伟达) University of Mannheim(曼海姆大学) MPI for Informatics(马克斯·普朗克信息学研究所)

AI总结 本文提出RobustSpring基准测试,用于评估光流、场景流和立体视觉模型对图像破坏的鲁棒性,通过20种不同图像破坏生成20,000张破坏图像,提供新的鲁棒性度量标准,促进更准确和抗扰的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10905 2026-04-14 cs.SD cs.AI cs.CL eess.AS

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

音频Flamingo Next:下一代开放音频-语言模型用于语音、声音和音乐

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang-gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Duraiswami, Dinesh Manocha, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(英伟达,美国) University of Maryland, USA(马里兰大学,美国)

AI总结 AF-Next通过改进基础模型、扩展数据集和引入时序推理方法,提升了语音、环境声音和音乐的理解与推理能力,展示了更强的性能和实用性。

Comments Project website: https://afnext-umd-nvidia.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20136 2026-04-14 cs.CL cs.AI

M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

M$^3$KG-RAG:多跳多模态知识图谱增强的检索增强生成

Hyeongcheol Park, Jiyoung Seo, Jaewon Mun, Hogun Park, Wonmin Byeon, Sung June Kim, Hyeonsoo Im, JeungSub Lee, Sangpil Kim

机构 * Korea University(高丽大学) Sungkyunkwan University(成均馆大学) NVIDIA Research(英伟达研究院) Hanwha Systems(韩华系统)

AI总结 本文提出M$^3$KG-RAG,通过构建多跳多模态知识图谱并引入GRASP机制,提升多模态大语言模型的推理深度和回答准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17012 2026-04-14 cs.CV

4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

4D-RGPT:通过感知蒸馏实现区域级4D理解

Chiao-An Yang, Ryo Hachiuma, Sifei Liu, Subhashree Radhakrishnan, Raymond A. Yeh, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA(英伟达)

AI总结 本文提出4D-RGPT和P4D框架,解决3D/4D视频问答中4D感知和时间理解不足的问题,并构建了区域级提示的R4D-Bench基准。

Comments CVPR 2026 (Highlight). Project page: https://www.ca-joe-yang.com/resource/projects/4D_RGPT/. GitHub: https://github.com/NVlabs/4D-RGPT. Dataset: https://huggingface.co/datasets/nvidia/R4D-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07523 2026-04-14 cs.CL

Aligning What LLMs Do and Say: Towards Self-Consistent Explanations

对LLMs的行为与说法进行对齐:迈向自洽的解释

Sahar Admoni, Ofra Amir, Assaf Hallak, Yftah Ziser

机构 * Technion – Israel Institute of Technology(以色列理工学院) Nvidia Research(英伟达研究院) University of Groningen(格罗宁根大学)

AI总结 研究通过比较回答与解释的特征重要性分布,发现后验自一致性银行(PSCB)能更可靠地体现模型决策与解释的一致性,应用DPO优化提升对齐性而不影响任务精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15803 2026-04-14 cs.LG cs.AI

WebLLM: A High-Performance In-Browser LLM Inference Engine

WebLLM:一种高性能的浏览器内LLM推理引擎

Charlie F. Ruan, Yucheng Qin, Akaash R. Parthasarathy, Xun Zhou, Ruihang Lai, Hongyi Jin, Yixin Dong, Bohan Hou, Meng-Shiun Yu, Yiyan Zhai, Sudeep Agarwal, Hangrui Cao, Siyuan Feng, Tianqi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达)

AI总结 WebLLM通过JavaScript框架在浏览器内实现高性能LLM推理,利用WebGPU和WebAssembly结合MLC-LLM和Apache TVM优化,实现80%的本地性能,推动隐私保护的本地化LLM应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10065 2026-04-14 cs.CL cs.AI cs.SD eess.AS

ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models

ASPIRin: 动作空间投影用于全双工语音语言模型中的交互优化强化学习

Chi-Yuan Hsiao, Ke-Han Lu, Yu-Kuan Fu, Guan-Ting Lin, Hsiao-Tsung Hung, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) ASUS Open Cloud Infrastructure Software Center(华硕开放云端基础设施软件中心) NVIDIA AI Technology Center(英伟达人工智能技术中心)

AI总结 ASPIRin通过动作空间投影和GRPO方法优化全双工语音语言模型的交互性能,提升语义连贯性并减少重复生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09690 2026-04-14 cs.CV

Are We Recognizing the Jaguar or Its Background? A Diagnostic Framework for Jaguar Re-Identification

我们是在识别豹还是其背景?一种用于豹再识别的诊断框架

Antonio Rueda-Toicen, Abigail Allen Martin, Daniil Morozov, Matin Mahmood, Alexandra Schild, Shahabeddin Dayani, Davide Panza, Gerard de Melo

机构 * Hasso Plattner Institute(哈索·普拉特纳研究院) NVIDIA(英伟达) Jaguar ID Project(美洲豹识别项目) Universidade Federal de Mato Grosso(马托格罗索联邦大学) Technical University Munich(慕尼黑工业大学) Helmholtz Zentrum Berlin(亥姆霍兹柏林研究中心) Freie Universitaet Berlin(柏林自由大学) Hyper3Labs

AI总结 本文提出一种诊断框架,通过控制泄漏的上下文比例和左右性诊断,评估豹再识别中使用的证据类型,提出新的基准数据集和评估协议。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27383 2026-04-14 cs.CV

Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression

分解、混合、适应:一种统一的框架用于参数高效神经网络重组与压缩

Nazia Tasnim, Shrimai Prabhumoye, Bryan A. Plummer

机构 * Boston University(波士顿大学) NVIDIA(英伟达)

AI总结 本文提出CRISP框架,通过分解预训练权重为基矩阵和混合投影,实现参数高效重组与压缩,优于现有方法4-5%,并在PEFT和PEFT+MC组合中表现更优。

Comments Accepted in CVPR, 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏