arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-28 至 2026-08-28 共收录 94 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 10 篇

2505.11326 2026-08-28 cs.CV cs.AI 版本更新 89%

Temporally-Grounded Language Generation: Towards Real-Time Vision-Language Models

时间接地语言生成:迈向实时视觉-语言模型

Keunwoo Peter Yu, Joyce Chai

机构 * Computer Science and Engineering Division University of Michigan(计算机科学与工程系大学米歇尔大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对实时交互环境对视觉-语言模型的时间精确性要求,提出TGLG基准任务及TRACE指标,构建VLM-TSI模型,实验显示其性能优于强基线但仍有提升空间。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26856 2026-08-28 cs.CV cs.AI 新提交 85%

From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation

从推理到像素:用于VQA和分割的接地医学多模态大语言模型

Haowen Gu, Gensheng Pei, Junzhu Mao, Qiong Wang, Mingwu Ren, Yazhou Yao

机构 * Nanjing University of Science and Technology(南京理工大学) Sungkyunkwan University(成均馆大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 针对现有医学多模态大语言模型缺乏像素级接地的问题,提出MedREAL框架,引入SARP与R2V机制,构建MedRAVS-13K数据集,在Med-VQA和分割任务上性能优于现有方法,为医学图像分析提供可解释框架。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26716 2026-08-28 cs.CV 新提交 83%

Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models

超越原子布局:基于视觉-语言模型的组合式设计理解

Yiyang Huang, Zhaowen Wang, Simon Jenni, Jing Shi, Yitian Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

专题命中 视觉问答 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文针对组合式布局理解任务,提出后训练范式MASON,利用约2万布局的CoDeLayout数据集,使Qwen2.5-VL 7B准确率达91.66%,优于基线及全数据微调。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21165 2026-08-28 cs.CL cs.CV 版本更新 81%

Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects

多种方言,多种语言,一种文化视角:评估多语言视觉语言模型对孟加拉文化的理解,涵盖历史关联语言和地区方言

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Shubhashis Roy Dipta, Mahbub E Sobhani, Rubaya Tabassum, Ariful Ekraj Hridoy, Mehraj Mahmood, Md. Tarek Hasan, Swakkhar Shatabda

机构 * United International University(国际联合大学) BRAC University(布拉塔克大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);visual question answering(abstract);grounding(abstract)

AI总结 提出 BanglaVerse 基准,通过手工标注图像和扩展至多种语言及方言,评估多语言视觉语言模型在孟加拉文化理解中的表现,发现标准孟加拉语评估高估模型能力,方言变化导致性能下降,文化知识缺失是主要瓶颈。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26580 2026-08-28 cs.CV cs.CL 新提交 79%

Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models

面向扩散多模态大语言模型的视觉信息引导并行解码

Insu Lee, Wooje Park, Wonseok Shin, Jinwoo Son, Byonghyo Shim

机构 * Seoul National University(首尔大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26848 2026-08-28 cs.CV cs.AI 新提交 73%

MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA

MedFG-VQA:用于轻量级医学视觉问答的低频记忆与图注意力

Haowen Gu, Gensheng Pei, Zeren Sun, Mingwu Ren, Xiangbo Shu, Yazhou Yao, Fumin Shen

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(高端工程机械智能制造国家重点实验室) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电气与计算机工程系) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 MedFG-VQA是轻量级医学VQA框架,通过FMF和GACA实现高效视觉-文本对齐,构建含200万对问答的SynMed-VQA数据集,性能优于大模型且计算成本低,适用于临床部署。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08897 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 62%

Recurrence Meets Transformers for Universal Multimodal Retrieval

循环机制与Transformer结合的通用多模态检索模型

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26949 2026-08-28 cs.AI 新提交 57%

A Table Is Worth 64 Tokens: Pixel-level Compression for Multi-Table Document Question Answering

一张表格值64个Token:面向多表格文档问答的像素级压缩

Iñigo Alonso, Mirella Lapata

机构 * School of Informatics(信息学院) University of Edinburgh(爱丁堡大学)

专题命中 视觉问答 :VLM(abstract_cn);分类 cs.AI

AI总结 本文针对多表格文档问答提出无需训练的两步像素级表格压缩方法,在长文档上节省41%总Token,比高效单步压缩配置少用15%Token且无准确率损失,还较原生分辨率单步问答提升7个百分点准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29353 2026-08-28 cs.AI 版本更新 57%

Nomad: Autonomous Exploration and Discovery

Nomad:自主探索与发现

Bokang Jia, Samta Kamboj, Satheesh Katipomu, Seung Hun Han, Neha Sengupta, Andrew Jackson

机构 * Inception, G42(G42 的 Inception) G42 MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26431 2026-08-28 cs.SD eess.AS 新提交 50%

AudioSpan: Spanning the Duration and Depth of Audio Comprehension

AudioSpan:覆盖音频理解的时长与深度

Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 22 篇

2608.13463 2026-08-28 cs.CV cs.AI cs.CL cs.LG 版本更新 92%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 视觉推理 :MLLM(title,title_cn);vision language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 15 pages (single column), 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-08-28 cs.CV cs.CL 版本更新 91%

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-08-28 cs.CL 版本更新 88%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract)

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27456 2026-08-28 cs.CV 新提交 86%

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

UrbanGround:从局部感知到真实城市中的空间能动性

Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) Shanghai University(上海大学) University of Oxford(牛津大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出首个基于香港3D地理空间数据构建的UrbanGround沙盒,探究MLLM智能体在真实城市中从局部感知转化为可靠行动的程度,发现其长时间探索时错误累积的缺陷,为相关研究提供支撑。

Comments 35 pages, 11 figures, 7 tables. Project Page: this https URL (https://urbanground.github.io), Code Repository: this https URL (https://github.com/UrbanGround/UrbanGround)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26993 2026-08-28 cs.CV 新提交 86%

Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning

Aphanta:面向多模态推理的任务对齐图像编辑中间产物诊断框架

Hengyuan Xu, Wei Cheng, Yumeng Ji, Xuanyang Zhang, Xianfang Zeng, Gang Yu, Xingjun Ma

机构 * StepFun(阶跃星辰) Fudan University(复旦大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Aphanta框架,用于诊断MLLM与图像编辑中间产物的任务对齐性,实验显示图像编辑是专用视觉工作空间,该框架可用于评估相关流水线效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26744 2026-08-28 cs.CV 新提交 86%

G2D: Generative-to-Discriminative Collaborative Inference for Zero-Shot Image Classification

G2D:用于零样本图像分类的生成式到判别式协同推理框架

Zehua Hao, Fang Liu, Qinliang Wang, Yaoyang Du, Xinyan Huang, Puhua Chen

机构 * Xidian University(西安电子科技大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 G2D是一种无需训练的零样本图像分类框架,通过生成式VLM验证CLIP检索的候选,在8个基准上平均准确率达68.85%,优于CLIP及独立生成式模型,还可迁移至其他模型。

Comments Accepted at ACM MM 2026. 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26715 2026-08-28 cs.HC 新提交 83%

RegulAR: Graph-Grounded Error Recognition and Assistance for Procedural Tasks in AR

RegulAR:面向增强现实中流程任务的基于图的错误识别与辅助

Yi-Lin Ye, Jindu Wang, Hiu Tung Wong, Shuchang Xu, Huamin Qu, Wong Kam-Kwai

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract)

AI总结 RegulAR是一款结合分层依赖图与MLLM的AR任务助手,可识别流程任务错误并提供恢复指导,在被试内研究中被证实比仅用MLLM的基线系统更能帮助用户理解任务结构与恢复任务。

Comments 16 pages, 7 figures. Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26581 2026-08-28 cs.LG 新提交 81%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25160 2026-08-28 cs.CV cs.AI cs.CL 版本更新 81%

GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts

GSM8K-V:视觉语言模型能否在视觉语境下解决小学级数学应用题

Fan Yuan, Yuchen Yan, Yifan Jiang, Haoran Zhao, Tao Feng, Jinyan Chen, Yanwei Lou, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建了多图像视觉数学基准GSM8K-V,评估34个VLMs发现其存在显著模态差距,最优模型仅达59%准确率,瓶颈为隐式视觉推理错误,且视觉数学优化模型在此无提升。

Comments 59 pages, 7 figures, Project Page: this https URL (https://zju-real.github.io/GSM8K-V) Code: this https URL (https://github.com/ZJU-REAL/GSM8K-V) Datasets: this https URL (https://huggingface.co/datasets/ZJU-REAL/GSM8K-V) Accepted at EMNLP 2026 Main Conference. Updated to the camera-ready version with additional experiments, analyses, and revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25548 2026-08-28 cs.RO 版本更新 78%

Using VLM Reasoning to Constrain Task and Motion Planning

利用视觉语言模型推理来约束任务和运动规划

Muyang Yan, Miras Mengdibayev, Ardon Floros, Weihang Guo, Lydia E. Kavraki, Zachary Kingston

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Computer Science, Rice University(莱斯大学计算机科学系) Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)

专题命中 视觉推理 :VLM(title);vision-language model(abstract)

AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。

Comments 9 pages, 7 figures, 1 table. Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13029 2026-08-28 cs.CV 版本更新 77%

Think3D: Thinking with Space for Spatial Reasoning

Think3D: 基于空间的思考以实现空间推理

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li, Binghao Ran, Fuxi Zhang, Zhuohan Sun, Yizhuang Peng, Zhenfei Yin, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-28 cs.CV cs.AI 版本更新 74%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI;MLLM(comments)

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments This submission is an iterative version of our previous work, **"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions"** ( arXiv:2506.09557 (https://arxiv.org/abs/2506.09557) ). We plan to consolidate the current submission with the earlier version into a unified manuscript. Therefore, we would like to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26355 2026-08-28 cs.CV cs.LG 新提交 73%

Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos

寻找合适的证据:因子引导的长视频由粗到细推理

Baixuan Xu, Yinyui Xu, Tianshi Zheng, Zhaowei Wang, Weiqi Wang, Haochen Shi, Jiayu Liu, Qing Zong, Xiyu Ren, Xinyu Geng, Zhitao He, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程学系)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 针对长视频问答的证据稀疏、选项区分困难问题,提出因子引导的PACE框架,经实验在多基准数据集上优于现有方法,实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26809 2026-08-28 cs.CV cs.MM 新提交 70%

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

思考镜头:基于智能体推理的一致多镜头视频编辑

Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li

机构 * Nankai University(南开大学) Tencent(腾讯)

专题命中 视觉推理 :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。

Comments Project Page: this https URL (https://wucy0519.github.io/MMLVE/) and see source codes at this https URL (https://github.com/Wucy0519/MMLVE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26193 2026-08-28 cs.AI 新提交 70%

AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes

AffectOmni:面向社交与艺术相关场景的可通过强化学习验证的以人为中心的接地情感推理

Yibo Wang, Rui Yang, Jisheng Dang, Bimei Wang, Yitao Wu, Pengfei Cao, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) Hainan University(海南大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 AffectOmni是面向社交与艺术场景的可验证情感推理框架,通过GRPO训练,引入两类奖励优化以人为中心的证据选择与时间推理,经多数据集实验较7B基线实现显著性能提升。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27176 2026-08-28 cs.CL cs.AI cs.LG eess.AS 新提交 62%

When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue

当文本误导时:面向音频接地对话的不一致感知推理

Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba

机构 * Center for Language and Speech Processing, Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对口语对话理解中基于转录本的捷径问题,构建了含501个问题的受控基准ContraTalk,提出Audio Twin智能体式推理框架,可提升冲突问答案例的准确率并减少文本偏向陷阱选择。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26386 2026-08-28 cs.CL cs.AI cs.LG 新提交 62%

Co-Evolving Structured Knowledge and Reasoning in Language Models

语言模型中结构化知识与推理的协同演化

Ryan Thomas Noonan, Linxi Zhao, Menghan Xu, Akanksha Sarkar, Mihir Mishra, Dongyoung Go, Kilian Q. Weinberger, Yoav Artzi, Jennifer J. Sun

机构 * Cornell University(康奈尔大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对检索增强方法的局限,提出协同演化框架KBevo,联合学习构建结构化知识库与推理,提升了知识结构质量、答案可达性及推理与可控性。

Comments COLM2026. Code available at this https URL (https://github.com/kilian-group/KBevo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26866 2026-08-28 cs.CV 新提交 57%

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

顺序很重要:面向视觉-语言推理的中文多面板梗图基准

Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian

机构 * Shanghai Maritime University(上海海事大学) Dalian Maritime University(大连海事大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22018 2026-08-28 cs.AI 版本更新 57%

SPAR-Hate: Auditor-Guided Multi-Perspective Role Reasoning for Bilingual Hate Speech Parsing

SPAR-Hate:一种由审核员引导的用于双语仇恨言论解析的多智能体框架

Yifan Lyu, Dianqing Lin, Xinran Li, Jiaqi Qiao, Xiujuan Xu

机构 * Dalian University of Technology(大连理工大学) Inner Mongolia University(内蒙古大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 针对结构化仇恨言论解析的文化等挑战,提出SPAR-Hate多智能体框架,分解文档为决策单元后从三视角生成判断并仲裁,在基准上实现双语仇恨解析最优结果。

Comments 16 pages, 2 figures. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-08-28 cs.CL cs.AI 版本更新 57%

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

Comments EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏