arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-25 至 2026-08-25 共收录 179 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 15 篇

2608.21450 2026-08-25 cs.CV 新提交 89%

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

超越视觉相似度:面向基于知识的视觉问答的实体对齐检索

Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong, Xiangwen Deng, Zhifang Liu, Peng Jiao, Haoqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Arizona(亚利桑那大学)

专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(title,abstract);分类 cs.CV

AI总结 针对KB-VQA现有检索范式忽略实体语义对齐的缺陷,提出首个MLLM嵌入检索器KBMR,结合语义判别器与连续语义蒸馏目标,在Recall@1和VQA准确率上较CLIP基线实现显著提升。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-08-25 cs.CV cs.AI 版本更新 88%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29902 2026-08-25 cs.AI 版本更新 85%

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进

Yinuo Liu, Zi Qian, Heng Zhou, Jiahao Zhang, Yajie Zhang, Zhihang Li, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

专题命中 视觉问答 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21796 2026-08-25 cs.CV cs.AI 新提交 84%

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

SAFE-G:面向基于知识的视觉问答的结构感知忠实证据引导生成

Long Shu, Shuochen Liu, Wei Chen, Junda Lin, Zhi Zheng, Huijun Hou, Tong Xu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) NIO(蔚来)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对KB-VQA现有方法难以捕捉结构关联、推理不忠实的问题,提出SAFE-G框架,通过混合搜索、图检索与证据对齐RL策略,在两个基准上准确率优于现有方法8.9%、3.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19739 2026-08-25 cs.CV cs.AI cs.LG 版本更新 82%

Question-Guided Evidence Acquisition for Multimodal Visual Question Answering

面向多模态视觉问答的问题引导式证据获取

Alin-Ionut Popa

机构 * Amazon Inc.(亚马逊公司)

专题命中 视觉问答 :visual question answering(title);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对多模态视觉问答中模型读取文档不可靠的问题,提出Q-Guide智能体引导感知,在两个数据集上优于基线方法,且增益来自精准感知引导而非复杂控制逻辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21431 2026-08-25 cs.CV cs.MM 新提交 79%

Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning

基于结构化上下文推理提升基于知识的视觉问答性能

Qiyou Liu, Yong Zhang, Jianjie Luo, Zhenguo Yang, Yi Yu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出SCoRe框架,通过上下文获取、选择、压缩三阶段处理多模态知识,在OK-VQA和A-OKVQA基准上性能优于现有最优方法,提升了基于知识的视觉问答效果。

Comments Accepted by ICME 2026. Source code is available at this https URL (https://github.com/WISLab-GDUT/SCoRe)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03337 2026-08-25 cs.CV 版本更新 79%

QIRL: Optimized Question-Image Relation Learning for Bias-Robust Visual Question Answering

QIRL:用于实现偏差鲁棒视觉问答的优化问答-图像关系学习

Quanxing Xu, Ling Zhou, Xian Zhong, Feifei Zhang, Rubing Huang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 该研究针对现有VQA偏差缓解方法的两大局限,提出QIRL框架,通过NIG与ISI模块结合生成驱动自监督学习,在VQA-CPv2和VQA-v2数据集上取得最优性能,可适配各类VQA架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22996 2026-08-25 cs.CV 新提交 70%

ENCORE: Entropy-Guided Cropping and Attention Regularization for Robust Vision--Language Understanding

ENCORE:面向鲁棒视觉-语言理解的熵引导裁剪与注意力正则化方法

Yuanhao Sun, Huawei Ji, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 ENCORE是一个熵引导的视觉-语言理解框架,通过基于熵的裁剪策略和熵正则化训练,仅微调0.14%参数,在10个VQA基准上实现平均1.43%的准确率提升,达到2B参数VLMs的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22363 2026-08-25 cs.AI 新提交 70%

Analyzing and Mitigating Cross-Lingual Degradation in Multilingual Medical VQA

分析与缓解多模态医学视觉问答中的跨语言退化问题

Jingbo Wang, Sendong Zhao, Haochun Wang, Bing Qin, Ting Liu

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 针对多模态医学VQA中LVLMs的跨语言退化问题,构建多语言基准并提出MedVL-XLRepE方法,可在3种LVLMs和8种语言上将退化缓解幅度提升至最高6.33%。

Comments EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22688 2026-08-25 cs.IR cs.MM 新提交 67%

FashionKG-RAG: Knowledge Graph-Enhanced Retrieval-Augmented Generation for Fashion Question Answering

FashionKG-RAG:面向时尚问答的知识图谱增强检索增强生成

Yujuan Ding, Linyin Luo, Shijie Wang, Xu Yuan, Yunshan Ma, Yi Bin, Wenqi Fan, Qing Li

专题命中 视觉问答 :grounding(abstract,abstract_cn)

AI总结 针对现有时尚知识图谱的局限性,本文提出全领域知识图谱FashionEcoKG,并开发无需训练的PG-RAG框架,通过双粒度路径重排序模块提升时尚问答的检索与答案准确性,效果优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22279 2026-08-25 cs.CV cs.AI 新提交 62%

OVIBench: Benchmarking Online Video Question Answering under Interruption

OVIBench:面向中断场景的在线视频问答基准测试

Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

机构 * HIT(哈尔滨工业大学) CASIA(中国科学院自动化研究所) ZJU(浙江大学) UESTC(电子科技大学) HKUST(香港科技大学)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22762 2026-08-25 cs.AI 新提交 57%

Compositional Chain-of-Relations for Faithful Knowledge Graph Question Answering with Large Language Models

面向大型语言模型的忠实知识图谱问答的组合式关系链

Chenhui Liu, Jianpeng Zhou, Jiahai Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文针对现有基于LLM的KGQA方法存在的实体剪枝不可靠、约束处理无基础的局限,提出组合式关系链(CCoR)框架,以关系为中心探索实现更忠实的多跳KGQA,在多个基准上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21376 2026-08-25 cs.CL cs.AI 新提交 57%

On the Role of Citations in Preference Data

引用在偏好数据中的作用

Yu Hou, Hal Daumé III, Rachel Rudinger, William Walden

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文在科学问答场景下,通过混合效应模型研究引用对人类与四个开源LLM偏好的影响,发现人类偏好多样且数量少的引用,LLM也有相关偏好,还探讨了对偏好数据收集的启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-08-25 cs.CV 版本更新 57%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21853 2026-08-25 cs.CL 新提交 50%

PUMA: A Polish Benchmark for Culturally Grounded Multimodal Understanding

PUMA:面向文化扎根多模态理解的波兰基准测试

Sławomir Dadas, Michał Perełkiewicz, Rafał Poświata, Małgorzata Grębowiec, Bartłomiej Jaworski, Izabela Woźniakowska

机构 * National Information Processing Institute(国家信息处理研究所)

专题命中 视觉问答 :visual question answering(abstract)

AI总结 该研究针对英语外文化多模态评估不足的问题,提出波兰多模态基准PUMA,通过900项任务评估各类模型在波兰语境下的多模态能力,发现商用模型在视觉问答表现好但音频/文档理解弱,并开源评估框架推进本地化多模态AI研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 35 篇

2608.22217 2026-08-25 cs.CV 新提交 93%

UR$^{2}$-MLLM: Uncertainty-aware Revisit Reasoning in Multimodal Large Language Models for Radiology Report Generation

UR²-MLLM:面向放射科报告生成的多模态大语言模型中基于不确定性感知的重访推理

Yucheng Chen, Yang Yu, Jiazhou Zhou, Yufei Shi, Yongying Lan, Yichi Zhang, Liyi Li, Si Yong Yeo

机构 * MedVisAI Lab(MedVisAI实验室) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) Centre of AI in Medicine, Singapore(新加坡医学人工智能中心) AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)AI方向) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(title,abstract);grounding(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对放射科报告生成任务,提出UR²-MLLM框架,通过动态重访不确定区域的机制实现最优性能,提升报告的可靠性与临床适配性。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13791 2026-08-25 eess.IV cs.CV 版本更新 91%

VLM- and LLM-Driven Multi-Agent System for PET Image Denoising

基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统

Boxiao Yu, Savas Ozdemir, Yang Xing, Fumio Hashimoto, Jiong Wu, Yizhou Chen, Axel Rominger, Ruogu Fang, Kuangyu Shi, Tinsu Pan, Kuang Gong

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22857 2026-08-25 cs.CL 新提交 90%

SAVER: Selective Auditing of Verbal Evidence for Error Recovery in VLM Change Reasoning

SAVER:面向VLM变化推理中错误恢复的口头证据选择性审计

Youdi Li

机构 * Panasonic Connect Co., Ltd.(松下连接公司)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract)

AI总结 针对VLMs视觉变化推理的表述失败问题,提出轻量规则方法SAVER,通过选择性审计VLM输出的口头证据触发结构化重提示,在CLEVR-Change等基准上显著提升准确率。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23234 2026-08-25 cs.CV 新提交 90%

MLLM-Assisted Audio VOS: A 3rd Place Report for the MeViS-Audio Track, 8th LSVOS Challenge

多模态大语言模型(MLLM)辅助音频引导的视频目标分割:第8届LSVOS挑战赛MeViS音频赛道第3名报告

Liangtao Shi, Jinxia Xie, Xiantao Hu, Ting Liu

机构 * Hefei University of Technology(合肥工业大学) Nanjing University of Science and Technology(南京理工大学) Hunan Police College(湖南警察学院)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出一种结合MLLM与SAM的无训练音频引导视频分割框架,分解任务至各阶段并选用适配基础模型,在第8届LSVOS挑战赛MeViS音频赛道获第3名,验证了基础模型用于该任务的有效性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22429 2026-08-25 cs.AI 新提交 90%

Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding

基于结构化接地的思考:面向图表与视觉表格理解的感知强化学习

Changjiang Jiang, Qiannian Zhao, Lei Xin, Jinxiang Xie, Preslav Nakov, Zhuohan Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Nanjing University(南京大学)

专题命中 视觉推理 :grounding(title,abstract);MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract)

AI总结 针对MLLMs依赖外部工具感知图表等视觉内容的问题,提出TwSG框架,通过两阶段训练实现细粒度视觉推理,降低延迟并提升准确率与鲁棒性。

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01946 2026-08-25 cs.RO cs.CV 版本更新 85%

Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models

为视觉-语言机器人操控扩展跨环境故障推理数据

Paul Pacaud, Ricardo Garcia, Shizhe Chen, Cordelia Schmid

机构 * Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所、巴黎高等师范学院、法国国家科学研究中心、巴黎文理研究大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出自动框架生成多样化的机器人规划与执行故障数据,构建FailCoT数据集,训练Guardian模型提升故障检测泛化能力。

Comments Code, Data, and Models available at this https URL (https://www.di.ens.fr/willow/research/guardian/). The paper contains 8 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21543 2026-08-25 cs.CV cs.AI 新提交 85%

presto: Efficient, Training-free, and Open-world Object Placement via Imaginary Search

presto:基于想象搜索的高效无训练开放世界物体放置方法

Weixuan Ding, Shang Liu, Hanyu Pei, Zeyan Liu

机构 * Wuhan University(武汉大学) University of Louisville(路易斯维尔大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出零样本无训练框架presto,将开放世界物体放置转化为MLLM引导的启发式搜索任务,经多基准实验及人类研究验证,其在开放世界场景中性能最优,且MLLM作为评判者的变体更具感知一致性。

Comments Accepted to ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23354 2026-08-25 cs.RO cs.CV 新提交 84%

OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

OptiSight:弥合具身导航中的语义推理与几何控制

Alperen Avan, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial (CSIC-UPC)(机器人学与工业信息研究所(西班牙国家研究委员会-加泰罗尼亚理工大学))

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出OptiSight混合框架,结合VLM推理与确定性视觉伺服,在8GB VRAM预算下,于AI Habitat中实现了多种室内场景下的可靠零样本具身导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-25 cs.CV cs.AI 版本更新 81%

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22584 2026-08-25 cs.AI 新提交 79%

Weakly supervised concept Bottleneck Learning for Robust Two stage Object centric visual reasoning

用于鲁棒的两阶段以对象为中心的视觉推理的弱监督概念瓶颈学习

Sparsh Tiwari, Gesina Schwalbe, Bettina Finzel

机构 * University of Lübeck(吕贝克大学) Ulm University(乌尔姆大学) University of Bamberg(班贝格大学)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI

AI总结 针对两阶段视觉推理需昂贵标注的问题,提出动态正交概念瓶颈(D-OCB)框架,在极弱监督下提取对齐人类的符号谓词,通过动态超参数分配、子空间相关性惩罚及动态维度分配,实现高概念对齐与下游推理准确率,性能媲美或优于端到端范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23242 2026-08-25 cs.MM 新提交 78%

Mind the Couch! Eliciting MLLM Reasoning in Interior Design via Weak-to-Strong Task Vector Injection

留意沙发!通过弱到强任务向量注入激发多模态大语言模型在室内设计中的推理能力

Yuxuan Yang, Jingyao Wang, Luntian Mou

专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract)

AI总结 针对MLLMs在室内设计中因模态对齐问题产生的空间碰撞与审美不和谐,本文提出DART-I机制,通过弱到强任务向量注入引导MLLMs推理,无需微调即可实现精确推理,且经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23518 2026-08-25 cs.CV 新提交 77%

Investigating Relational Reasoning in VLMs

研究视觉语言模型(VLMs)中的关系推理

Adhithya Laxman Ravi Shankar Geetha, Aulia Kharis Rakhmasari, Haleema Ramzan, Xander Yap

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本研究以Qwen3-VL-4B为对象,构建含几何形状的合成数据集,探究VLMs的关系推理能力,发现其结合了真正视觉推理与基于语言线索的捷径策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23268 2026-08-25 cs.CV 新提交 77%

Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner

面向多模态智能体学习者的双粒度智能体记忆与Shapley上下文归因

Jieke Wang, Tiancheng Shen, Yibo Yang, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大模型推理不足的问题,提出双粒度智能体记忆框架DG-Mem,结合Shapley上下文归因,在多个数学多模态推理数据集上实现性能提升,且无需参数更新即可适配各类骨干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23172 2026-08-25 cs.CL cs.CV 新提交 77%

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23155 2026-08-25 cs.RO 版本更新 75%

LaGEA: Language Guided Embodied Agents for Robotic Manipulation

LAGEA:基于语言引导的机器人操作代理

Abdul Monaf Chowdhury, Akm Moshiur Rahman Mazumder, Safaeid Hossain Arib, Rabeya Akter

机构 * Department of Robotics Mechatronics Engineering, University of Dhaka, Bangladesh Center for Computational \& Data Sciences, Independent University, Bangladesh

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract)

AI总结 LAGEA通过语言引导具身代理学习,提升机器人操作任务的成功率和效率。

Comments ICML 2026 Main Track Poster

详情

展开后加载摘要…

URL PDF HTML 收藏