arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-30 至 2026-01-30 共收录 40 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2505.19616 2026-01-30 cs.LG cs.AI cs.CV 85%

Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models

多模态大语言模型中模态干扰的诊断与缓解

Rui Cai, Bangzheng Li, Xiaofei Wen, Muhao Chen, Zhe Zhao

机构 * Department of Computer Science, University of California-Davis, Davis, CA, United States(计算机科学系,加州大学戴维斯分校)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种统一的微调框架,通过结合启发式和对抗性扰动的数据增强与输出一致性正则化,有效缓解多模态大语言模型中的模态干扰问题,提升模型的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 8 篇

2601.21342 2026-01-30 cs.AI 83%

Ostrakon-VL: Towards Domain-Expert MLLM for Food-Service and Retail Stores

Ostrakon-VL:面向食品服务与零售商店的领域专家MLLM

Zhiyong Shen, Gongpeng Zhao, Jun Zhou, Li Yu, Guandong Kou, Jichen Li, Chuanlei Dong, Zuncheng Li, Kaimao Li, Bingkun Wei, Shicheng Hu, Wei Xia, Wenguo Duan

机构 * Rajax Network Technology (Taobao Shangou of Alibaba)(Rajax网络技术(淘宝商购的阿里巴巴))

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Ostrakon-VL通过多阶段训练策略在FSRS场景中取得新突破,实现60.1的高分表现,超越现有模型并展示更高参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21181 2026-01-30 cs.AI 83%

MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models

MAD:用于减轻多模态大语言模型中跨模态幻觉的模态自适应解码

Sangyun Chung, Se Yeon Kim, Youngchae Chee, Yong Man Ro

机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国科学技术院集成视觉语言实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual language model(abstract);分类 cs.AI

AI总结 MAD通过自适应加权对比解码分支,有效减少多模态大语言模型中的跨模态幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21617 2026-01-30 cs.CV 79%

PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization

PathReasoner-R1: 通过知识引导的策略优化在病理视觉-语言模型中引入结构化推理

Songhan Jiang, Fengchun Liu, Ziyue Wang, Linghan Cai, Yongbing Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Technical University of Dresden(德累斯顿技术大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 PathReasoner-R1通过知识引导的策略优化,在病理视觉-语言模型中引入结构化推理,提升模型的临床推理能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21037 2026-01-30 cs.LG cs.AI cs.CL cs.CV 75%

Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning

基于框架的思考:视觉上下文和测试时扩展如何增强视频推理

Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, Serge Belongie, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学) Hong Kong University of Science(香港科学大学) University of California San Diego(加州大学圣地亚哥分校) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过视频生成模型进行视觉推理,利用视觉上下文和测试时扩展提升视频推理能力,展示了模型在空间和时间复杂任务中的鲁棒零样本泛化能力。

Comments 8 pages, 3 figures, 3 tables (26 pages, 13 figures, 6 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22155 2026-01-30 cs.CV cs.CL 70%

UEval: A Benchmark for Unified Multimodal Generation

UEval:一个统一多模态生成的评估基准

Bo Li, Yida Yin, Wenhao Chai, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21821 2026-01-30 cs.CV 70%

MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods

MMFineReason: 通过以开放数据为中心的方法缩小多模态推理差距

Honglin Lin, Zheng Liu, Yun Zhu, Chonghan Qin, Juekai Lin, Xiaoran Shang, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室、OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 MMFineReason通过大规模多模态推理数据集和基于难度的过滤策略,提升模型推理能力与参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25851 2026-01-30 cs.CV 57%

MuSLR: Multimodal Symbolic Logical Reasoning

MuSLR:多模态符号逻辑推理

Jundong Xu, Hao Fei, Yuhui Zhang, Liangming Pan, Qijun Huang, Qian Liu, Preslav Nakov, Min-Yen Kan, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) Peking University(北京大学) UniMelb(墨尔本大学) University of Auckland(奥克兰大学) MBZUAI(穆斯林人工智能研究所) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 MuSLR提出了一种多模态符号逻辑推理基准,通过形式逻辑规则提升VLMs的推理能力,显著提升链式推理性能及复杂逻辑处理效果。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08182 2026-01-30 cs.LG 57%

CTRLS: Chain-of-Thought Reasoning via Latent State-Transition

CTRLS: 通过潜在状态转移进行链式推理

Junda Wu, Yuxin Xiong, Xintong Li, Sheldon Yu, Zhengmian Hu, Tong Yu, Rui Wang, Xiang Chen, Jingbo Shang, Julian McAuley

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究)

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

AI总结 CTRLS通过建模潜在状态转移的马尔可夫决策过程,利用分布式强化学习提升大语言模型的推理能力与探索效率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 14 篇

2601.21634 2026-01-30 cs.CV 83%

RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning

RSGround-R1: 重新思考通过空间推理的遥感视觉定位

Shiqi Huang, Shuting He, Bihan Wen

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(电气电子工程学院,南洋理工大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(教育部计算与经济交叉学科重点实验室,上海财经大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 RSGround-R1通过引入空间推理引导的后训练框架,提升遥感图像中目标物体的定位精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21296 2026-01-30 cs.LG cs.AI 76%

Grounding and Enhancing Informativeness and Utility in Dataset Distillation

基于信息性和效用的蒸馏数据集 grounding

Shaobo Wang, Yantai Yang, Guo Chen, Peiru Li, Kaixin Li, Yufa Zhou, Zhaorun Chen, Linfeng Zhang

机构 * EPIC Lab, SJTU(SJTU实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Duke University(杜克大学) The University of Chicago(芝加哥大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 本文提出InfoUtil框架,通过博弈论和梯度范数优化,提升数据集蒸馏的信息性和效用,实验显示在ImageNet-1K上性能提升6.1%。

Comments Accepted by ICLR 2026, 20 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22114 2026-01-30 cs.CV cs.AI cs.SY eess.SY 73%

SINA: A Circuit Schematic Image-to-Netlist Generator Using Artificial Intelligence

SINA:一种使用人工智能的电路原理图到网表生成器

Saoud Aldowaish, Yashwanth Karumanchi, Kai-Chen Chiang, Soroosh Noorzad, Morteza Fayazi

机构 * University of Utah, Salt Lake City, UT, USA(犹他大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 SINA利用深度学习、CCL和OCR技术,结合视觉-语言模型,实现了高准确率的电路原理图到网表自动转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21199 2026-01-30 cs.CV cs.AI 73%

Thinker: A vision-language foundation model for embodied intelligence

Thinker:一个用于具身智能的视觉-语言基础模型

Baiyu Pan, Daqin Luo, Junpeng Yang, Jiyuan Wang, Yixuan Zhang, Hailin Shi, Jichao Jiao

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Thinker通过构建大规模数据集和改进输入方式,在机器人感知与推理任务中实现了最先进的性能。

Comments IROS 2025, 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22041 2026-01-30 cs.MA cs.AI cs.CV cs.LG 67%

Learning to Communicate Across Modalities: Perceptual Heterogeneity in Multi-Agent Systems

在多智能体系统中学习跨模态交流:感知异质性

Naomi Pitzer, Daniela Mihai

机构 * University of Southampton(索姆塞特大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究通过异质多模态交流游戏探讨智能体在感知异质性下的交流机制,发现单模态系统更高效,多模态系统需更多信息交换,位扰动实验揭示了意义的分布编码特性。

Comments To be published in EvoLang XVI proceedings. 15 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13578 2026-01-30 cs.CV cs.AI cs.LG 67%

CMOOD: Concept-based Multi-label OOD Detection

基于概念的多标签异常检测

Zhendong Liu, Yi Nian, Yuehan Qin, Henry Peng Zou, Li Li, Xiyang Hu, Yue Zhao

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 COOD提出了一种基于概念的零样本多标签OOD检测框架,通过增强语义空间和改进评分函数,有效区分复杂标签依赖的OOD样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00590 2026-01-30 cs.CL cs.AI cs.LG 62%

Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models

Wikontic: 构建与维基数据对齐、本体感知的知识图谱

Alla Chepurova, Aydar Bulatov, Mikhail Burtsev, Yuri Kuratov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) London Institute for Mathematical Sciences(伦敦数学科学研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Wikontic通过多阶段流程构建维基数据对齐、本体感知的知识图谱,提升KG质量并实现高效构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21615 2026-01-30 cs.LG cs.AI 62%

Beyond Parameter Finetuning: Test-Time Representation Refinement for Node Classification

超越参数微调:用于节点分类的测试时间表示精调

Jiaxin Zhang, Yiqi Wang, Siwei Wang, Xihong Yang, Yu Shi, Xinwang Liu, En Zhu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TTReFT框架,通过改进测试时间适应方法,解决图神经网络在分布外测试中的性能下降问题,提升节点分类的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13993 2026-01-30 eess.IV cs.AI cs.CV 62%

OrthoInsight: Rib Fracture Diagnosis and Report Generation Based on Multi-Modal Large Models

OrthoInsight:基于多模态大模型的肋骨骨折诊断与报告生成

Ningyong Wu, Jiangbo Zhang, Wenhong Zhao, Jinzhi Wang, Chenzhan Yu, Zhigang Xiu, Duwei Dai, Ziyu Xu, Yongli Yang

机构 * Organizational Management Department, School of Management, Xi’an Jiaotong University(管理学院组织管理部,西安交通大学) West China Longquan Hospital, Sichuan University(四川大学西部临床医学院) School of Electronic Science and Engineering, Xi’an Jiaotong University(西安交通大学电子科学与工程学院) Systems Engineering Institute, Xi’an Jiaotong University(西安交通大学系统工程研究院) Institute of Medical Artificial Intelligence, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学第二附属医院医学人工智能研究所) School of Human Settlements and Civil Engineering, Xi’an Jiaotong University(西安交通大学人居环境与土木工程学院) School of Life Science and Technology, Xi’an Jiaotong University(西安交通大学生命科学与技术学院)

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 OrthoInsight通过多模态大模型实现肋骨骨折的自动诊断与报告生成,结合CT图像分析与医学知识图谱,提升诊断效率和临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21796 2026-01-30 cs.CL cs.AI 57%

KID: Knowledge-Injected Dual-Head Learning for Knowledge-Grounded Harmful Meme Detection

KID: 基于知识注入的双头学习用于知识引导的有害迷因检测

Yaocong Li, Leihan Zhang, Le Zhang, Qiang Yan

机构 * School of Economics and Management, Beijing University of Posts and Telecommunications(经济管理学院,北京邮电大学) College of Computing, Beijing Information Science and Technology University(计算机学院,北京信息科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 KID通过知识注入和双头学习框架,提升有害迷因检测的准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13518 2026-01-30 cs.CV 57%

Text-driven Online Action Detection

基于文本的在线动作检测

Manuel Benavent-Lledo, David Mulero-Pérez, David Ortiz-Perez, Jose Garcia-Rodriguez

机构 * Department of Computer Technology, University of Alicante(阿拉维大学计算机技术系) ValgrAI - Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚人工智能研究生学校和研究网络) Institute of Informatics Research, University of Alicante(阿拉维大学信息研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TOAD模型,利用CLIP文本嵌入实现高效的零样本和少样本在线动作检测,其在THUMOS14数据集上的mAP达到82.46%

Comments Published in Integrated Computer-Aided Engineering

Journal ref Integrated Computer-Aided Engineering. 2025;32(4):415-423

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20895 2026-01-30 cs.LG 57%

Faster Predictive Coding Networks via Better Initialization

通过更好的初始化提升预测编码网络的速度

Luca Pinchetti, Simon Frieder, Thomas Lukasiewicz, Tommaso Salvatori

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Institute of Logic and Computation, Vienna University of Technology(维也纳技术大学逻辑与计算研究所) VERSES AI Research Lab(VERSES AI研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出了一种改进的初始化方法,通过优化预测编码网络的初始化以提升训练效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20420 2026-01-30 cs.LG 57%

Concept Component Analysis: A Principled Approach for Concept Extraction in LLMs

概念成分分析:一种用于大语言模型中概念提取的原则性方法

Yuhang Liu, Erdun Gao, Dong Gong, Anton van den Hengel, Javen Qinfeng Shi

机构 * Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) School of Computer Science and Engineering, The University of New South Wales(计算机科学与工程学院,新南威尔士大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出概念成分分析(ConCA)方法,通过无监督线性解混从LLM中提取可解释概念,提供理论支持优于现有SAEs方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20230 2026-01-30 cs.CL cs.HC 50%

Unit-Based Agent for Semi-Cascaded Full-Duplex Dialogue Systems

基于单元的代理用于半级联全双工对话系统

Haoyuan Yu, Yuxuan Chen, Minjie Cai

机构 * Hunan University(湖南大学) Gongdao Technology(公道科技) Jilin University(吉林大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 本文提出基于单元的半级联全双工对话系统,利用多模态大语言模型和辅助模块实现高效对话处理,实验显示其在挑战赛中表现优异。

Comments ICASSP 2026 (Grant Challenge). https://github.com/yu-haoyuan/fd-badcat

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2601.21694 2026-01-30 cs.CV 57%

ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing

ChartE$^{3}$: 一个全面的端到端图表编辑基准

Shuo Li, Jiajun Sun, Zhekai Wang, Xiaoran Fan, Hui Li, Dingwen Yang, Zhiheng Xi, Yijun Wang, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 ChartE$^{3}$提出一个端到端图表编辑基准,通过多模态大语言模型评估,揭示了现有技术在全局编辑任务上的性能差距。

Comments Our benchmark will be publicly available at https://github.com/galactic123/ChartE3

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 3 篇

2601.21506 2026-01-30 cs.RO cs.SY eess.SY 85%

IROS: A Dual-Process Architecture for Real-Time VLM-Based Indoor Navigation

IROS: 一种用于实时基于视觉语言模型的室内导航的双过程架构

Joonhee Lee, Hyunseung Shin, Jeonggil Ko

机构 * Yonsei University(延世大学)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);grounding(abstract)

AI总结 IROS是一种结合视觉语言模型上下文推理与轻量级感知模块的双过程架构,实现低延迟的室内导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20966 2026-01-30 cs.RO cs.AI 70%

Parallels Between VLA Model Post-Training and Human Motor Learning: Progress, Challenges, and Trends

VLA模型后训练与人类运动学习的类比:进展、挑战与趋势

Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Sheng-Bin Duan, Fu-Chao Xie, Wen-Kai Wang, Si-Cheng Wang, Ling-Yun Li, Tian Tu, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Grainger College of Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) Joint Laboratory of Intelligence Science and Technology, Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学系统工程学院智能科学与技术联合实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文从人类运动学习角度综述了VLA模型后训练的进展、挑战与趋势,提出四类后训练方法并探讨了其在机器人操作中的应用与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21751 2026-01-30 cs.CV 57%

Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation

动态拓扑感知:突破视觉语言导航中的粒度刚性

Jiankun Peng, Jianyuan Guo, Ying Xu, Yue Liu, Jiashuang Yan, Xuanwei Ye, Houhua Li, Xiaoming Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 DGNav通过动态拓扑导航框架,解决视觉语言导航中的粒度刚性问题,提升导航效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 3 篇

2504.14224 2026-01-30 cs.CV 83%

Beyond Retraining: Training-Free Unknown Class Filtering for Source-Free Open Set Domain Adaptation of Vision-Language Models

超越再训练:用于无源开放集域适应的无训练未知类过滤

Yongguang Li, Jindong Li, Qi Wang, Qianli Xing, Runliang Niu, Shengsheng Wang, Menglin Yang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 VLM-OpenXpert通过无训练模块SUFF和BGAT实现无源开放集域适应,有效抑制未知类干扰并提升模型性能。

Comments Core methods unchanged; title updated and full-text narrative refined for clarity and logical coherence. No changes to key findings and conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21220 2026-01-30 cs.CV 57%

LAMP: Learning Universal Adversarial Perturbations for Multi-Image Tasks via Pre-trained Models

LAMP: 通过预训练模型学习通用对抗扰动以实现多图像任务

Alvi Md Ishmam, Najibul Haque Sarker, Zaber Ibn Abdul Hakim, Chris Thomas

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 LAMP通过预训练模型学习通用对抗扰动,针对多图像多模态大语言模型实现高效的黑盒攻击,提升了多任务攻击成功率。

Comments Accepted in main technical track AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18874 2026-01-30 cs.HC cs.AI cs.CR cs.CY 57%

When Ads Become Profiles: Uncovering the Invisible Risk of Web Advertising at Scale with LLMs

当广告成为资料:利用LLMs揭示大规模网络广告中的隐形风险

Baiyu Chen, Benjamin Tag, Hao Xue, Daniel Angus, Flora Salim

机构 * The University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Queensland University of Technology(昆士兰理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 利用LLMs揭示广告流中的隐私信息泄露风险,展示其在大规模数据中的高精度推断能力。

Comments The ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏