arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2277 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2277 篇

2303.17158 2023-03-31 cs.CV eess.IV 57%

KD-DLGAN: Data Limited Image Generation via Knowledge Distillation

Kaiwen Cui, Yingchen Yu, Fangneng Zhan, Shengcai Liao, Shijian Lu1, Eric Xing

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Journal ref CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15271 2022-11-30 cs.AI 57%

The Myth of Culturally Agnostic AI Models

Eva Cetinic

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

Comments Accepted for "Cultures in AI/AI in Culture" NeurIPS 2022 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12261 2022-10-25 cs.CL cs.CV 57%

Z-LaVI: Zero-Shot Language Solver Fueled by Visual Imagination

Yue Yang, Wenlin Yao, Hongming Zhang, Xiaoyang Wang, Dong Yu, Jianshu Chen

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09502 2022-10-18 cs.CV 57%

GAMA: Generative Adversarial Multi-Object Scene Attacks

Abhishek Aich, Calvin-Khang Ta, Akash Gupta, Chengyu Song, Srikanth V. Krishnamurthy, M. Salman Asif, Amit K. Roy-Chowdhury

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2022; First two authors contributed equally; Includes Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12690 2022-09-28 cs.CV 57%

On Modality Bias Recognition and Reduction

Yangyang Guo, Liqiang Nie, Harry Cheng, Zhiyong Cheng, Mohan Kankanhalli, Alberto Del Bimbo

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV

Comments Accepted by ToMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03340 2022-05-09 cs.CV 57%

Prompt Distribution Learning

Yuning Lu, Jianzhuang Liu, Yonggang Zhang, Yajing Liu, Xinmei Tian

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06687 2022-02-15 cs.CV 57%

Domain Adaptation via Prompt Learning

Chunjiang Ge, Rui Huang, Mixue Xie, Zihang Lai, Shiji Song, Shuang Li, Gao Huang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.08239 2022-02-11 cs.CL cs.AI 57%

LaMDA: Language Models for Dialog Applications

Romal Thoppilan, Daniel De Freitas, Jamie Hall, Noam Shazeer, Apoorv Kulshreshtha, Heng-Tze Cheng, Alicia Jin, Taylor Bos, Leslie Baker, Yu Du, YaGuang Li, Hongrae Lee, Huaixiu Steven Zheng, Amin Ghafouri, Marcelo Menegali, Yanping Huang, Maxim Krikun, Dmitry Lepikhin, James Qin, Dehao Chen, Yuanzhong Xu, Zhifeng Chen, Adam Roberts, Maarten Bosma, Vincent Zhao, Yanqi Zhou, Chung-Ching Chang, Igor Krivokon, Will Rusch, Marc Pickett, Pranesh Srinivasan, Laichee Man, Kathleen Meier-Hellstern, Meredith Ringel Morris, Tulsee Doshi, Renelito Delos Santos, Toju Duke, Johnny Soraker, Ben Zevenbergen, Vinodkumar Prabhakaran, Mark Diaz, Ben Hutchinson, Kristen Olson, Alejandra Molina, Erin Hoffman-John, Josh Lee, Lora Aroyo, Ravi Rajakumar, Alena Butryna, Matthew Lamm, Viktoriya Kuzmina, Joe Fenton, Aaron Cohen, Rachel Bernstein, Ray Kurzweil, Blaise Aguera-Arcas, Claire Cui, Marian Croak, Ed Chi, Quoc Le

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.09163 2021-12-02 cs.AR cs.LG eess.IV 57%

High-Performance FPGA-based Accelerator for Bayesian Neural Networks

Hongxiang Fan, Martin Ferianc, Miguel Rodrigues, Hongyu Zhou, Xinyu Niu, Wayne Luk

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

Comments Design Automation Conference (DAC) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00245 2021-08-16 cs.CV cs.CL 57%

Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models

Linjie Li, Jie Lei, Zhe Gan, Jingjing Liu

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV

Comments To appear in ICCV 2021; Website: https://adversarialvqa.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.04734 2021-07-21 cs.AI 57%

Reinforcement Learning Under Moral Uncertainty

Adrien Ecoffet, Joel Lehman

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

Comments 28 pages, 18 figures; update adds discussion of a possible flaw of Nash voting, discussion of further possible research into MEC, as well as a few more references; updated to ICML version

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.09961 2021-04-06 cs.RO cs.LG 57%

Scaffolded Learning of In-place Trotting Gait for a Quadruped Robot with Bayesian Optimization

Keyan Zhai, Chu'an Li, Andre Rosendo

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

Comments 9 pages, 6 figures, 16-th International Conference on Intelligent Autonomous System (IAS-16)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.03493 2021-03-08 cs.CV 57%

Causal Attention for Vision-Language Tasks

Xu Yang, Hanwang Zhang, Guojun Qi, Jianfei Cai

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.10534 2019-08-29 cs.CV 57%

Adversarial Representation Learning for Text-to-Image Matching

Nikolaos Sarafianos, Xiang Xu, Ioannis A. Kakadiaris

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV

Comments To appear in ICCV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.07183 2019-04-09 cs.CV 57%

Adversarial Attacks Beyond the Image Space

Xiaohui Zeng, Chenxi Liu, Yu-Siang Wang, Weichao Qiu, Lingxi Xie, Yu-Wing Tai, Chi Keung Tang, Alan L. Yuille

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV

Comments To appear in CVPR 2019 as oral

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.10348 2018-06-28 cs.CL cs.CV 57%

Learning Visually-Grounded Semantics from Contrastive Adversarial Samples

Haoyue Shi, Jiayuan Mao, Tete Xiao, Yuning Jiang, Jian Sun

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

Comments To Appear at COLING 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.10726 2018-05-29 cs.AI 57%

Strength Factors: An Uncertainty System for a Quantified Modal Logic

Naveen Sundar Govindarajulu, Selmer Bringsjord

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

Comments Presented on August 20, 2017 at the Logical Foundations for Uncertainty and Machine Learning Workshop @ IJCAI 2017 in Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14815 2024-02-23 cs.CY cs.AI cs.CV cs.LG 56%

Demographic Bias of Expert-Level Vision-Language Foundation Models in Medical Imaging

Yuzhe Yang, Yujia Liu, Xin Liu, Avanti Gulhane, Domenico Mastrodicasa, Wei Wu, Edward J Wang, Dushyant W Sahani, Shwetak Patel

专题命中 幻觉与鲁棒性 :分类 cs.CV、cs.AI、cs.LG;VLM(comments)

Comments Code and data are available at https://github.com/YyzHarry/vlm-fairness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24094 2026-08-26 cs.RO 新提交 50%

SIREN-Bench: Behavior-Driven Generation and Evaluation of Emergency-Vehicle Interactions

SIREN-Bench:行为驱动的应急车辆交互生成与评估

Yicheng Zhu, Tianmu Zhao, Haoxin Leng, Fan Zuo, Tao Li, Zilin Bian

机构 * Rochester Institute of Technology(罗切斯特理工学院) CVS Health(CVS健康公司) City University of Hong Kong(香港城市大学) New York University(纽约大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 该研究提出行为驱动的SIREN协同仿真平台,构建SIREN-Bench-v1基准,经3类任务评估揭示不同行为模式下的失效特性,为自动驾驶与交通安全研究提供可扩展平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23570 2026-08-26 cs.CL 新提交 50%

Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning

驯服视觉忽视:用于多模态上下文学习中自适应注意力的变分信息瓶颈框架

Kaito Tanaka, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(山王大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 针对多模态上下文学习中视觉上下文时而被利用时而被忽视的问题,提出VIB-ICL框架,通过CMIG量化跨模态信息,推导理论界并经五组基准实验验证,实现准确率提升与演示样本减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22367 2026-08-25 cs.CL 新提交 50%

Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs

上下文感知集群解码:dMLLMs中的语义锚驱动连贯性

Yikai Zhao, Qiyan Zhao, Jiaquan Zhang, Xiaofeng Zhang, Xiaosong Yuan, Pengzhou Cheng

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Alibaba Group(阿里巴巴集团) Shanghai University(上海大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 针对 dMLLMs 生成长文本时的语义漂移与重复问题,提出上下文感知集群解码方法,结合置信度与邻域邻近度评分,在多模型多基准上实现质量提升并减少幻觉。

Comments This paper is accepted by EMNLP 2026. 19 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01341 2026-08-24 cs.SI 版本更新 50%

Structural Hallucination in Large Language Models: A Network-Based Evaluation of Knowledge Organization and Citation Integrity

大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估

Moses Boudourides

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18465 2026-08-20 cs.HC cs.ET cs.IR 新提交 50%

Reducing Technician Search Burden: A Multimodal RAG for Cessna 172 Maintenance Manual

减轻技术人员的检索负担:面向赛斯纳172维护手册的多模态检索增强生成

Seongjun Ha, Md Rashedul Islam, Gaurav Nanda, Damon Lercel

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本研究针对赛斯纳172维护手册,开发多模态检索增强生成流程,其多模态手册检索器召回率达93.37%,生成响应与基准答案语义相似度87.20%,可减轻技术人员检索负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17717 2026-08-19 cs.RO 新提交 50%

CompCPZ: Preserving Multi-Modal Intent in Language-Guided Robot Manipulation

CompCPZ:在语言引导的机器人操作中保留多模态意图

Zhen Zhang, Ahmad Hafez, Peng Xie, Yanliang Huang, Wenyuan Wu, Amr Alanwar

机构 * School of Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑工业大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 CompCPZ是一种用于语言引导机器人操作的代数层,可恢复多模态析取表示,在ManiSkill3基准测试中性能优于多种基线,且能迁移至真实机器人实验,凸显组合语言接地需评估意图连通分量结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17583 2026-08-19 cs.CL 新提交 50%

Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究

Hamidreza Saffari, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract)

AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。

Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13901 2026-08-17 cs.RO 新提交 50%

Ontology-Grounded World Models for Failure Diagnosis and Closed-Loop Repair in Physical AI Systems

用于物理人工智能系统故障诊断与闭环修复的本体论驱动世界模型

Kailin Wang, Haoxiang Jie, Yaoyuan Yan, Jiacheng Zhou, Zhiyou Heng

机构 * AI Lab, Country Garden Services Group(碧桂园服务集团AI实验室) Fudan University(复旦大学) Omni AI

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出分层于EV-WM之上的Onto-EV-WM本体驱动接口,在PointMaze、LIBERO-Goal等基准测试中实现高故障修复成功率,为物理AI系统提供有效的故障诊断与闭环修复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12337 2026-08-14 cs.CL 新提交 50%

From Refuse to Richness: Rubric Rewards for Long-Form Hallucination Reinforcement Learning

从拒答到丰富:用于长文本幻觉强化学习的评分规则奖励

Yudong Wang, Zhe Yang, Wenhan Ma, Rang Li, Qibin Yang, Weimin Xiong, Jiangshan Duo, Liang Zhao, Zhifang Sui

机构 * Peking University(北京大学) Xiaomi(小米)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 该研究针对长文本幻觉强化学习的「拒答-丰富度」权衡,提出用关键要点评分规则定义奖励,发现软组合依据、评分规则覆盖率与相关性的奖励能实现最佳平衡,提升了依据性与分布外迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11592 2026-08-13 cs.RO 新提交 50%

Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems

Video2Track:从真实世界交互视频到自动驾驶系统的可操控对抗性封闭赛道测试

Mengjie Tian, Xinrui Zhang, Tianyu Li, Peizhi Zhang, Guirong Zhou, Haojie Feng, Junpeng Huang, Qixiang Zhang, Lu Xiong

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文提出Video2Track框架,通过两个耦合模块将真实驾驶视频交互场景转化为可操控对抗性封闭赛道测试,可复现实景交互场景并生成可控变体,为ADS验证提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24060 2026-08-13 cs.RO 版本更新 50%

RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统

Zhuoran Li, Zhiyang Li, Kaijun Zhou, Jinyu Gu

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。

Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-12 cs.ET 版本更新 50%

Scale-CDA: A Scalable Retrofit Platform for Cooperative Driving Automation in Production Vehicles

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 幻觉与鲁棒性 :MLLM(abstract_cn)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏