Adaptive Discrete Communication Bottlenecks with Dynamic Vector Quantization
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at Complex Networks 2021
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
Journal ref 2020 International Conference on Robotics and Automation
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
Comments 20 pages, 18 figures, 2 tables
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments ICCV 2019, 10 pages, 9 figures
Journal ref International Conference on Computer Vision, 2019
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 2 figures
Journal ref IJCAI 2019
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG
Comments CNLVR,NLVR. Accepted to ACL 2018
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Accepted in IJCAI-17
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments 23 pages; CVPR 2017 submission; see https://guesswhat.ai
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments To appear in AAAI 2016
专题命中 视觉推理 :vision-language model(abstract,comments);分类 cs.AI
Comments large language models, large vision-language model, reasoning, non-ideal conditions, reinforcement learning
顺序很重要:面向视觉-语言推理的中文多面板梗图基准
机构 * Shanghai Maritime University(上海海事大学) ; Dalian Maritime University(大连海事大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。
SPAR-Hate:一种由审核员引导的用于双语仇恨言论解析的多智能体框架
机构 * Dalian University of Technology(大连理工大学) ; Inner Mongolia University(内蒙古大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 针对结构化仇恨言论解析的文化等挑战,提出SPAR-Hate多智能体框架,分解文档为决策单元后从三视角生成判断并仲裁,在基准上实现双语仇恨解析最优结果。
Comments 16 pages, 2 figures. Submitted to EMNLP 2026
大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析
机构 * Adelaide University(阿德莱德大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Amap, Alibaba Group(阿里巴巴集团高德地图) ; Beihang University(北京航空航天大学)
专题命中 视觉推理 :vision language model(abstract);分类 cs.AI
AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。
Comments EMNLP2026 Findings
从图表到文本:模型感知的多模态解释作为可访问非视觉交互的基础
机构 * Institute of Theoretical and Applied Informatics, PAS(波兰科学院理论与应用信息研究所)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 该研究提出多智能体框架,将时间序列预测的视觉输出转为模型感知文本解释,可提升非视觉交互的可访问性,其可解释配置使解释质量最高提升32%。
StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; East China University of Science and Technology(华东理工大学) ; Singapore Management University(新加坡管理大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。
Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo
Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏
机构 * Xi’an Jiaotong University(西安交通大学) ; MOE KLINNS Lab(MOE KLINNS实验室) ; Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) ; Sun Yat-sen University(中山大学)
专题命中 视觉推理 :VLM(abstract_cn);分类 cs.CV
AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。
一个用于高级多模态个性化研究的基准和知识引导框架
机构 * Google(谷歌) ; DeepMind(深Mind)
专题命中 视觉推理 :vision language model(abstract);分类 cs.CV
AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。
超越裁决:科学事实核查中人类与大语言模型推理的基于图的分析
机构 * Interdisciplinary Transformation University Austria (ITU)(奥地利跨学科转型大学(ITU))
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 本研究提出类型化推理图框架,用于对比科学事实核查中人类与LLM的推理路径,基于MISSCIPLUS数据集评估GPT-5等模型,发现各模型在裁决性能与人类对齐度上存在差异。
OmniCAD:面向机器人装配任务的3D空间推理大规模基准测试集
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出OmniCAD——涵盖多类工业系统的3D空间推理大规模基准测试集,评估VLMs三类装配推理能力,发现当前VLMs在该任务中表现不佳,将开源相关资源推动该领域研究。
从语音到掩码轨迹的运动感知推理:2026年第8届LSVOS挑战赛MeViS音频赛道亚军方案
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Anhui University of Science and Technology(安徽理工大学) ; National University of Singapore(新加坡国立大学) ; China Agricultural University(中国农业大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
AI总结 该研究提出Speech2MaskTrack方案,整合语音识别、运动定位等技术,在第8届LSVOS挑战赛MeViS音频赛道获亚军,实现语音引导的参考视频对象分割任务。
基于几何与知识基础的大语言模型推理的任务驱动型3D可打印性辅助
机构 * Colorado School of Mines(科罗拉多矿业学院)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 该研究提出一种基于几何与知识基础的LLM推理的任务驱动型3D可打印性辅助框架,可生成多维度结构化打印建议,经实验验证其可提升可打印性、任务适用性及材料选择准确率。
DesignAgent3D:通过类设计师多模态推理实现交互式3D场景编辑
机构 * University of Michigan(密歇根大学) ; University of Notre Dame(圣母大学) ; Yale University(耶鲁大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
AI总结 DesignAgent3D是一种交互式多模态智能体框架,通过类设计师的规划-感知-行动范式解决文本引导3D场景编辑的缺陷,在NeRF和3D Gaussian Splatting上均优于现有方法,实现了更优的语义对齐、空间定位精度和多视图一致性。
Traj-VLN:通过自回归轨迹生成学习像素空间交互
机构 * Southern University of Science and Technology(南方科技大学) ; Peng Cheng National Laboratory(鹏城国家实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。
DisasterLex:面向灾害分析中地理空间推理的专家概念到模式知识图谱
机构 * Texas A&M University(德克萨斯大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.LG
AI总结 提出DisasterLex框架,通过插入专家知识图谱(EKG)将用户查询与数据库模式桥接,在灾害分析场景中实现文本到SQL的准确转换,性能优于现有方法1.4-2.75倍。
Journal ref Findings of the Association for Computational Linguistics: EMNLP 2026