arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-09-01 至 2026-09-01 共收录 6
2608.29590 2026-09-01 cs.CV 新提交

Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models

强安全护栏下大型视觉语言模型的护栏无关社会偏见评估

Yusuke Hirota, Michael Ross Boone, Arun George Zachariah, Jibin Rajan Varghese, Yu-Chiang Frank Wang, Boyi Li, Ryo Hachiuma

机构 * NVIDIA(英伟达)

AI总结 本研究针对强护栏LVLMs的偏见评估难题,提出解耦人物属性推断的评估方法,发现20款LVLMs均存在不当使用用户人口统计信息的偏见,且专有模型偏见低于开源模型。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29374 2026-09-01 cs.CV 新提交

Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

思考、观察与修正:多模态大语言模型中基于不一致感知的视觉自我修正

Yu Cheng, Arushi Goel, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) NVIDIA Research(英伟达研究院)

AI总结 本研究针对工具增强型多模态推理中工具输出缺乏验证的问题,提出ReVISE框架,通过带监督反思的训练数据集与强化学习目标奖励,实现错误检测与修正,在多个基准上取得性能提升。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29057 2026-09-01 cs.LG math.DS 新提交

Sparse Koopman Autoencoders Identify Local Dynamical Regimes in Multibasin Systems

稀疏Koopman自编码器识别多盆系统中的局部动力学 regime

Aidan Li, Uday Kiran Reddy Tadipatri, Mahan Fathi, Sarath Chandar, Ross Goroshin

机构 * Chandar Research Lab(钱达尔研究实验室) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) University of Pennsylvania(宾夕法尼亚大学) NVIDIA(英伟达) Polytechnique Montréal(蒙特利尔理工学院)

AI总结 该研究提出稀疏Koopman自编码器(SKAEs),无需标签即可识别多盆系统的局部动力学 regime,其预测性能优于密隐KAEs,且隐支撑可有效识别吸引盆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-09-01 cs.CL 版本更新

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

Comments Accepted to EMNLP 2026 Main Conference. Code: https://github.com/NVIDIA-NeMo/Skills/tree/main/recipes/sherloc

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-09-01 cs.CV 版本更新

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15503 2026-09-01 cs.AR cs.DC cs.LG cs.PF 版本更新

DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures

DCC: 面向处理-内存架构的机器学习内核数据驱动编译

Peiming Yang, Sankeerth Durvasula, Ivan Fernandez, Mohammad Sadrosadati, Onur Mutlu, Gennady Pekhimenko, Christina Giannoula

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Barcelona Supercomputing Center(巴塞罗那超级计算中心) ETH Zürich(苏黎世联邦理工学院) Nvidia(英伟达) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

AI总结 针对PIM系统中数据重排与计算代码优化相互依赖的问题,提出数据驱动的编译器DCC,通过统一调优联合优化数据重排与计算代码,在HBM-PIM和AttAcc PIM上分别实现平均2.21倍和3.92倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏