Grounding Aleatoric Uncertainty for Unsupervised Environment Design
专题命中 幻觉与鲁棒性 :grounding(title);分类 cs.AI、cs.LG
Comments NeurIPS 2022
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :grounding(title);分类 cs.AI、cs.LG
Comments NeurIPS 2022
不确定性缓解与意图推断:一种双模式人机联合规划系统
机构 * Department of Electrical and Computer Engineering, George Washington University(电气与计算机工程系,乔治华盛顿大学) ; Department of Mechanical and Aerospace Engineering, George Washington University(机械与航空航天工程系,乔治华盛顿大学) ; Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本文提出一种双模式人机联合规划系统,通过缓解不确定性与推断意图,提升人机协作效率。
一试即优:用于跨情节探索摊销的去冗余过程记忆
机构 * Tsinghua University(清华大学) ; DISCOVER Robotics(DISCOVER机器人公司) ; Northeast Agricultural University(东北农业大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 研究如何让机器人避免重复探测隐藏状态物体,提出面向实例的记忆框架IOM,用视觉语言模型实例化,在多任务中减少操纵操作,提升效率且不降低成功率,即使过程错误也能成功。
Comments 8 pages, 3 figures, 3 tables
多模态铁路道口安全分析
机构 * University of California, Riverside(加州大学河滨分校) ; Riverside County Transportation Commission(河滨县交通委员会)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出多模态管道,利用视觉线索和事故报告评估铁路道口安全,基于FRA评分实现高风险/低风险分类(F1=0.757)和分数估计(RMSE=0.078)。
从失败中学习:计算机使用代理的推理时自我改进
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。
Comments Published in ECCV 2026
机器人操作的世界价值模型
机构 * Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出世界价值模型(WVM),融合世界模型与价值估计,通过时序建模评估数据质量,在标准基准和次优轨迹基准上达到SOTA,提升策略学习性能。
Comments preprint
近端策略优化区域:教师存在于提示中,而非梯度中
机构 * NVIDIA(英伟达)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出ZPPO方法,通过将教师知识注入提示而非策略梯度,解决小模型知识蒸馏中教师梯度主导和强化学习策略漂移问题,在多种规模模型上超越现有方法。
Comments Project page: https://byungkwanlee.github.io/ZPPO-page/
KSAFE-MM:通过本地化语境化实现韩国文化风险的多模态安全基准
机构 * Korea University(韩国大学) ; KT Corporation(KT公司)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 针对多模态大语言模型在安全评估中缺乏文化特异性问题,提出KSAFE-MM基准,通过语言和视觉语境化构建通用与韩国文化特有的多模态安全测试集,揭示模型对文化攻击的脆弱性及安全性与过度拒绝之间的权衡。
通过主动感知与行为树自动生成功能的Real2Sim
机构 * University of Padova, Dept. of Information Engineering(帕多瓦大学信息工程系) ; ABB Robotics(ABB机器人)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本文提出一种基于视觉语言模型的自主Real2Sim框架,通过分解语义任务,自动生成行为树以高效获取物理参数,实验证明其在效率和安全性上的优势。
具有合规性接触形成和故障恢复的鲁棒且具有弹性的软机器人物体插入
机构 * OMRON SINIC X Corporation(OMRON SINIC X公司)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本文提出了一种基于合规性腕部的物体插入方法,通过大变形吸收接触,实现安全接触形成和故障恢复,实验显示在随机条件下成功率高达83%。
精度降低可能更可靠:对VLMs量化影响的系统评估
机构 * Computer Vision Center(计算机视觉中心)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文系统评估了量化对VLMs可靠性的影响,发现量化能提升准确率、校准、异常检测和抗噪能力,但不改善协变量偏移或虚假相关性。
Comments Accepted at ICML 2026
MVR:多视图视频奖励塑造用于强化学习
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。
Comments ICLR 2026
接触丰富机器人任务的安全学习:从经典学习方法到安全基础模型的综述
机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genova, Italy(人类-机器人接口与交互实验室,意大利技术研究院,热那亚,意大利) ; Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目(DRIM)和热那亚大学,热那亚,意大利) ; Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN, USA(工业工程埃德华森学校,普渡大学,西拉法伊斯,美国)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);grounding(abstract)
AI总结 本文综述了接触丰富机器人任务的安全学习方法,探讨了从经典学习方法到安全基础模型的发展,分析了安全探索与执行的关键技术及未来方向。
Comments version 2
机构 * Seoul National University(首尔国立大学) ; Naver AI
专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2025
机构 * UC Berkeley(伯克利大学)
专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project page: https://hidden-plain-sight.github.io/
专题命中 幻觉与鲁棒性 :vision language model(abstract);grounding(abstract);multimodal large language model(abstract)
Comments 8 pages, 4 figures
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICML camera-ready version. Code is released at https://github.com/BillChan226/HALC
基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现
机构 * Guangdong University of Technology(广东工业大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV
AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。
Comments Accepted by ACM MM 2026
CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI
AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。
通过动态多轮交互对视觉语言模型进行情境化评估
机构 * UC San Diego(加州大学圣地亚哥分校) ; Northeastern University(东北大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Johns Hopkins University(约翰·霍普金斯大学)
专题命中 幻觉与鲁棒性 :vision language model(title);分类 cs.AI
AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。
GeMoE:基于门控熵的MoE大视觉语言模型中不确定性感知自适应路由
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV
AI总结 针对MoE架构中静态路由无法自适应选择专家的问题,提出基于门控熵的不确定性感知自适应路由方法GeMoE,通过最小描述长度原理建模复杂度与性能的权衡,在保持99.5%性能的同时提升36.5%专家激活稀疏性。
测量塑性:面向视觉-语言模型的传感器级自适应
机构 * University of Seoul(首尔大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV
AI总结 提出多视角物理提示(MVP)用于测试时自适应,通过将相机曝光三角(ISO、快门速度、光圈)作为物理提示,在传感器层面进行自适应,无需梯度或模型修改,在ImageNet-ES上优于数字方法。
Comments Accepted to the ICML 2026 Workshop on Continual Adaptation at Scale
由多模态大语言模型视觉先验引导的3D烟雾场景重建
机构 * Hefei University of Technology(合肥工业大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; Anhui University(安徽大学) ; United Arab Emirates University(阿联酋大学) ; Nanyang Technological University(南洋理工大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(title);分类 cs.CV
AI总结 本文提出整合视觉先验与高效3D场景建模的框架,通过增强烟雾退化图像和开发Smoke-GS框架,提升烟雾场景重建与视图合成的鲁棒性与一致性。
Lingua-SafetyBench: 一个多语言视觉-语言模型安全评估基准
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; School of Computer Science, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) ; School of Engineering Science, University of the Chinese Academy of Sciences(中国科学院工程科学学院) ; NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心)
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV
AI总结 本文提出Lingua-SafetyBench,通过10万多个多语言图像-文本对评估多模态模型的安全性,发现非高资源语言和非拉丁文在文本主导风险下安全性更差,强调需要专门的语言和模态对齐策略以提升安全性和公平性。
部分重校正softmax损失用于视觉-语言模型鲁棒性
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI
AI总结 本文提出部分重校正softmax损失,通过限制top K softmax输出提升预训练多模态模型的对抗鲁棒性,实验显示细调后模型对主流攻击更具鲁棒性。
Comments The study described in Section 4 was conducted without required institutional review board approval. The paper is withdrawn pending completion of the approval process
测试时适应用于触觉-视觉-语言模型
机构 * Shenzhen Technology University(深圳技术大学) ; New York University(纽约大学) ; Shenzhen University(深圳大学) ; Tsinghua University(清华大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI
AI总结 本文提出了一种可靠性感知框架,用于提升触觉-视觉-语言模型在测试时的适应能力,通过估计各模态可靠性来过滤不可靠样本并优化融合过程,有效提升了在模态损坏情况下的准确率。
面向视觉语言模型的层次化通用多模态攻击
机构 * School of Electrical Engineering and Computer Science, the University of Queensland(电气工程与计算机科学学院,昆士兰大学) ; Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV
AI总结 本文提出HRA框架,通过层次化优化路径和文本重要性建模,实现对视觉语言模型的通用多模态攻击,验证了其在多种任务和数据集上的优越迁移性能。
Comments 10 pages, 7 figures
自适应多任务视觉语言模型用于机器人故障检测与推理
机构 * UT Austin(德克萨斯大学) ; Amazon Robotics(亚马逊机器人技术) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 幻觉与鲁棒性 :vision language model(title);分类 cs.LG
AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。
基于骨架化的对抗扰动在大视觉语言模型数学文本识别中的应用
机构 * Doshisha University Kyoto, 610-0394 Japan ; University of Brescia Brescia, 25134 Italy ; Independent Researcher Tokyo, Japan
专题命中 幻觉与鲁棒性 :vision language model(title);分类 cs.CV
AI总结 本文提出基于骨架化的对抗扰动方法,用于评估大视觉语言模型在数学文本识别中的视觉能力和局限性,并通过ChatGPT验证其实际应用价值。
Comments accepted to ITC-CSCC 2025
Journal ref Proc. ITC-CSCC 2025