arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2512.03503 2026-06-16 cs.CL 版本更新 50%

Understanding LLM Reasoning for Abstractive Summarization

理解大语言模型在抽象摘要中的推理能力

Haohan Yuan, Haopeng Zhang

机构 * ALOHA Lab, University of Hawaii at Manoa(夏威夷大学马诺亚分校ALOHA实验室)

专题命中 视觉推理 :grounding(abstract)

AI总结 本研究通过大规模比较8种推理策略和3种大型推理模型在8个数据集上的表现,发现推理并非万能,其效果依赖于策略和摘要设置,且存在质量与事实准确性之间的权衡。

Comments 27 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16975 2026-06-16 cs.SD eess.AS 版本更新 50%

Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs

基于多模态大语言模型的链式思维差异-共性推理的可解释音频编辑评估

Yuhang Jia, Xu Zhang, Yang Chen, Hui Wang, Enzhi Wang, Yong Qin

机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院,天津,中国) Academy for Advanced Interdisciplinary Studies, Nankai University, Tianjin, China(南开大学先进跨学科研究学院,天津,中国)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 提出首个基于自然语言的音频编辑自动评估框架,利用Qwen2-Audio和链式思维推理策略,实现可解释且与人类判断高度一致的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14691 2026-06-15 cs.CL 新提交 50%

CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距

Jiayue Cao, Zhicong Lu, Xuehan Sun, Wei Jia, Hongling Zheng, Changyuan Tian, Zichuan Lin, Wenqian Lv, Nayu Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Tianjin University(天津大学)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24102 2026-06-15 cs.CL 版本更新 50%

From Training to Generalization: Improving Moral Reasoning Through Pragmatic Inference

道德推理习得的语用推理:通过元语用链接实现泛化

Guangliang Liu, Xi Chen, Bocheng Chen, Han Zi, Xitong Zhang, Kristen Johnson

机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Nanyang Technological University(南洋理工大学) University of Mississippi(密苏里大学) Northeastern University(东北大学) Qualcomm(高通公司) Michigan State University(密歇根州立大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 针对大语言模型在道德推理中泛化能力不足的问题,提出基于元语用链接和道德基础理论的语用推理方法,使模型获取道德推理目标与社会变量间的元语用链接,在三个任务上验证了其适应性和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25371 2026-06-10 cs.RO 版本更新 50%

FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand

FOUND-IT: 基于基础模型优先、按需粒度的任务驱动3D场景图

Dominic Maggio, Nicolas Gorlo, Kris Hauser, Luca Carlone

机构 * Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) Samsung Research America(三星美国研究院)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出首个基于未标定单目相机实时构建任意室内外环境分层任务驱动3D场景图的方法,通过几何基础模型和可调整粒度支持动态任务,并在ASHiTA SG3D基准上提升79%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09195 2026-06-09 cs.CL 新提交 50%

Symbolic and Abstractive Reasoning with Complex Visual Queries

复杂视觉查询的符号与抽象推理

Yichi Zhang, Jingdian Lu, Zhuo Chen, Lingbing Guo, Jun Xu, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) Ant Group(蚂蚁集团)

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 提出复杂视觉查询(CVQ)概念,通过多模态知识图谱合成数据集,并设计两阶段训练框架,提升多模态大语言模型的符号与抽象推理能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07089 2026-06-08 cs.RO 新提交 50%

Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning

必要时做梦:通过自适应多模态推理推进世界行动模型

Yinzhou Tang, Jingbo Xu, Yu Shang, Zihao Song, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 提出AdaWAM,通过轻量动态路由器自适应触发文本或视觉推理,提升长时复杂任务中的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10832 2026-06-08 cs.CL 版本更新 50%

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

面向视觉原生多模态深度搜索智能体的在策略数据演化

Shijue Huang, Hangyu Guo, Guanting Dong, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of Edinburgh(爱丁堡大学)

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06044 2026-06-05 cs.CL 50%

IA-RAG: Interval-Algebra-Driven Temporal Reasoning for Dynamic Knowledge Retrieval

IA-RAG:基于区间代数的动态知识检索时间推理

Xiaoman Wang, Yaoze Zhang, Wenzhuo Fan, Hongwei Zhang, Ding Wang, Guohang Yan, Song Mao, Botian Shi, Yunshi Lan, Pinlong Cai

机构 * East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Shanghai for Science and Technology(上海科技大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出IA-RAG框架,通过区间代数建模时间约束,实现层次化时间检索与推理,在复杂时间问答任务上表现优异。

Comments 22 pages, 10 figures, 13 tables. Code available at https://github.com/xiaoAugenstern/LogicalRAG_TemporalQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04454 2026-06-04 cs.CL 50%

Stepwise Reasoning Enhancement for LLMs via External Subgraph Generation

通过外部子图生成增强大语言模型的逐步推理

Xin Zhang, Yang Cao, Baoxing Wu, Kai Song, Siying Li

机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出SGR框架,通过从知识图谱生成查询相关子图来引导大语言模型进行逐步推理,提升复杂多步推理的准确性、鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19852 2026-06-04 cs.CL 50%

Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning

工具总是有益的吗?学习自适应调用工具以实现双模式多模态大语言模型推理

Qinghe Ma, Zhen Zhao, Yiming Wu, Jian Zhang, Lei Bai, Yinghuan Shi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 提出AutoTool模型,通过强化学习框架自适应决定是否调用工具,结合双模式推理策略和模式特定奖励函数,在提升准确率的同时降低推理开销。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03604 2026-06-03 cs.CL 50%

Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding

超越字面:多模态模因理解中的语用意图分解

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Luyao Ye, Huimin Wang, Hanqi Yan, Binyang Li, Kam-Fai Wong, Yulan He

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei(华为) Central China Normal University(中央师范大学) Shenzhen University(深圳大学) King’s College London(伦敦国王学院) University of International Relations(国际关系大学)

专题命中 视觉推理 :vision language model(abstract)

AI总结 针对大型视觉语言模型(LVLMs)在理解模因时倾向于描述字面内容而非语用意图的问题,提出Intent Projection框架,通过表示、输出和目标三层面的字面-语用分解,在六个基准上超越开源模型并缩小与专有模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02674 2026-06-03 cs.CR 50%

Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning

跨厂商Sola ISPM基准测试:评估面向联邦身份安全推理的智能体AI

Eden Yavin, Gal Engelberg, Konstantin Koutsyi, Leon Goldberg, Gal Baron

专题命中 视觉推理 :grounding(abstract)

AI总结 针对多云和SaaS平台中跨厂商身份安全配置错误与权限提升路径的评估缺失,提出包含50个数据驱动任务的跨厂商Sola ISPM基准测试,并构建评估框架,实验表明结构化关系上下文将答案正确性相对提升约34%,探索查询减少约70%。

Comments 22 pages, 4 figures, 8 tables, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01925 2026-06-03 cs.MA 50%

QoEReasoner: An Agentic Reasoning Framework for Automated and Explainable QoE Diagnosis in RANs

QoEReasoner: 用于RAN中自动化和可解释QoE诊断的智能体推理框架

Qizhe Li, Haolong Chen, Shan Dai, Zhuo Li, Zhiwei Hu, Xuan Li, Guangxu Zhu, Qingjiang Shi

专题命中 视觉推理 :grounding(abstract)

AI总结 提出QoEReasoner,一种基于LLM的智能体系统,通过确定性工具、领域知识库和历史案例库实现RAN中QoE退化的自动、可解释诊断,准确率提升18%-40%,诊断时间从30分钟降至3分钟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01837 2026-06-02 cs.CR 50%

Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition

良性输入,有害输出:通过分布式语义重组的跨模态越狱

Yani Wang, Yilong Yang, Yang Liu, Zhuzhu Wang, Zuobin Ying, Zhuo Ma

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 提出分布式语义重组(DSR)框架,将有害意图分解为良性文本和视觉基元,利用多模态大模型的推理能力在跨模态推理阶段融合为有害输出,实现高攻击成功率且输入毒性极低。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01394 2026-06-02 cs.CL 50%

UniD$^3$: A Knowledge Graph-Enhanced RAG Framework for Drug-Disease Discovery and Reasoning

UniD$^3$:一种用于药物-疾病发现与推理的知识图谱增强RAG框架

Qing Wang, Tianshi Liu, Minghao Zhou, Jialu Liang, Sen Guo, Guangyu Wang, Jing Su, Qianqian Song

机构 * Department of Health Outcomes and Biomedical Informatics, University of Florida(佛罗里达大学健康成果与生物医学信息学系) Department of Hematology, H. Lee Moffitt Cancer Center and Research Institute(血液科,H. Lee Moffitt癌症中心与研究院) Center for Bioinformatics and Computational Biology, Houston Methodist Research Institute(生物信息学与计算生物学中心,休斯顿方法主义研究学院) Department of Cardiothoracic Surgery, Weill Cornell Medicine, Cornell University(心胸外科,Weill Cornell医学,康奈尔大学) Department of Biostatistics and Health Data Science, Indiana University School of Medicine(生物统计学与健康数据科学系,印第安纳大学医学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出UniD$^3$框架,结合大语言模型与知识图谱增强检索生成(KG-RAG),从生物医学文献中提取、组织和验证药物-疾病知识,生成结构化数据集并提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00750 2026-06-02 cs.CL 50%

I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications

I-WebGenBench: 评估大语言模型生成的科学网页应用中的交互性

Dasen Dai, Biao Wu, Meng Fang, Shuoqi Li, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室) UTS University of Liverpool(利物浦大学)

专题命中 视觉推理 :visual language model(abstract)

AI总结 提出 Paper-to-Interactive-System Agent 将研究论文转化为可执行交互式网页系统,并构建 PaperVoyager 框架以显式建模机制和交互逻辑,显著提升生成质量。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00507 2026-06-02 cs.CL 50%

LaSR: Context-Aware Speech Recognition via Latent Reasoning

LaSR:通过潜在推理实现上下文感知的语音识别

Heyang Liu, Ziyang Cheng, Jiayi Huang, Wenyang Xiao, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出LaSR训练范式,利用潜在推理轨迹增强语音大语言模型的上下文感知能力,在学术术语识别上显著提升性能且不增加延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31460 2026-06-01 cs.RO cs.SY eess.SY 50%

On-Device Robotic Planning: Eliminating Inference Redundancy for Efficient Decision-Making

设备端机器人规划:消除推理冗余以实现高效决策

Joonhee Lee, Hyunseung Shin, Hyunmi Kim, Pei Zhang, Jeonggil Ko

机构 * School of Integrated Technology, College of Computing, Yonsei University(延世大学整合技术学院,计算学院) Department of Hyperscale AI SoC Research Section, ETRI(ETRI超大规模AI SoC研究部) EECS - Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程学院)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 提出REIS框架,通过场景门控、KV引导的affordance路由和审慎推理减少推理冗余,在保持语义适应性的同时加速机器人控制。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28774 2026-05-28 cs.CL 50%

Agent Explorative Policy Optimization for Multimodal Agentic Reasoning

Agent探索性策略优化用于多模态Agent推理

Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov, Yu-Chiang Frank Wang, Byung-Kwan Lee

机构 * NVIDIA KAIST(韩国科学技术院)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 针对多模态Agent推理中思考与工具使用的不对称性(Thinking-Acting Gap),提出AXPO算法,通过固定思考前缀并重采样工具调用及其延续,结合基于不确定性的前缀选择,显著提升工具使用率和模型性能。

Comments Project page: https://byungkwanlee.github.io/AXPO-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27741 2026-05-28 cs.CL 50%

Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization

逃离语言先验:通过模态感知策略优化缓解音频推理中的后期模态崩溃

Cihan Xiao, Yiwen Shao, Chenxing Li, Xiang He, Zhenwen Liang, Steve Yves, Sanjeev Khudanpur, Liefeng Bo

机构 * Johns Hopkins University(约翰霍普金斯大学) Tencent Hunyuan(腾讯文言)

专题命中 视觉推理 :grounding(abstract)

AI总结 针对多模态大语言模型在强化学习后训练中因统一策略梯度忽略模态依赖性而导致的后期模态崩溃问题,提出模态感知策略优化(MAPO)框架,通过模态相关性掩码和辅助注意力损失分支动态聚焦梯度并维持跨模态推理,在复杂音频推理基准上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00491 2026-05-27 cs.CL 50%

From Knowledge to Inference: Formalizing Specialized Public Health Reasoning on GlobalHealthAtlas

从知识到推理:形式化GlobalHealthAtlas上的专业公共卫生推理

Zhaokun Yan, Shan Xu, Wuzheng Dong, Zhaohan Liu, Lijie Feng, Chengxiao Dai, Chen Tianqi, Binfan Liu, Yunpu Ma, Wenting Wei, Yingting Li, Yi Zhang, Tongning Wu

机构 * China Academy of Information and Communications Technology(中国信息通信技术研究院) CRRC Industrial Academy Co., Ltd.(CRRC工业学院有限公司) The University of Sydney(悉尼大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Institute of Infectious Disease and Biosecurity(上海传染病与生物安全研究院) School of Public Health, Fudan University(复旦大学公共卫生学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 为解决公共卫生推理缺乏结构化监督信号和基准的问题,提出大规模多语言数据集GlobalHealthAtlas(280,210实例,15领域,17语言),并构建LLM辅助的构建与质量控制流水线及领域对齐评估器,支持安全关键型公共卫生推理的LLM训练与评估。

Journal ref ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25646 2026-05-26 cs.RO 50%

G-DRAGON: Geospatial Reasoning and Dynamic Planning for Retrieval-Augmented Outdoor Navigation

G-DRAGON:面向检索增强的户外导航的地理空间推理与动态规划

Dongzhihan Wang, Yi Du, Jianan Sun, Yuan Xue, Yingchen Zhang, Bing Xiao, Chen Wang, Liang Xu

机构 * Spatial AI & Robotics Lab(空间人工智能与机器人实验室) University at Buffalo(布法罗大学) School of Future Technology(未来技术学院) Shanghai University(上海大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出G-DRAGON框架,通过轻量级LLM的生成式检索将自然语言命令映射到本地OSM实体,结合全局路径规划与SLAM系统,并利用前沿探索和开放集语义体素映射实现最后一英里目标定位,在仿真和真实场景中优于现有方法。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25486 2026-05-26 cs.IR 50%

RAG-Match: Retrieval-Augmented Knowledge Injection and Hierarchical Reasoning for Calibrated Semantic Relevance

RAG-Match:面向校准语义相关性的检索增强知识注入与分层推理

Hengjun Jiang, Liansheng Sun, Yan Jiang, Xiaojie Ke, Yongjin Wang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

专题命中 视觉推理 :grounding(abstract)

AI总结 提出RAG-Match三阶段框架,通过知识增强预训练、分层推理对齐和偏好决策校准,提升搜索场景中细粒度语义相关性判断的准确性。

Comments 17 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25384 2026-05-26 cs.CL 50%

GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

GeoMathCode: 理解几何问题求解中交织的数学-代码推理

Yingji Zhang, Yong Dai, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) X-Humanoid Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Cancer Biomarker Centre, CRUK Manchester Institute(癌症生物标志物中心,CRUK曼彻斯特研究所)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文提出GeoMathCode,通过程序化表示作为中间视觉输出,分析多模态大模型在几何问题中的推理与代码生成,发现推理与代码步骤在潜在空间可解耦,监督微调使推理流形更结构化,且层次化代码结构包含更多数学符号信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21008 2026-05-21 eess.AS 50%

A Survey of Audio Reasoning in Multimodal Foundation Models

多模态基础模型中音频推理的综述

Zhihan Guo, Wenqian Cui, Guan-Ting Lin, Daxin Tan, Jingyao Li, Qiyong Zheng, Dingdong Wang, Jing Xiong, Han Shi, Jiaya Jia, Irwin King

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 本文综述了多模态基础模型中音频推理的研究问题,探讨了音频推理模型的架构和训练基础,并系统整理了音频到文本、音频到语音、音频视觉推理和代理音频推理等领域的最新进展,同时分析了新兴范式和评估实践,提出了未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17962 2026-05-19 cs.CE 50%

FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation

FinDocMRE:一个文档级金融多模态推理评估基准

Jiayong Zhu, Jiangtong Li, Jinru Ding, Dawei Cheng, Jie Xu, Feng Yu

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出FinDocMRE基准,用于评估金融多模态模型在文档级推理中的能力,通过构建包含12,207个样本的金融报告数据集,评估多图像处理和文档理解能力,发现现有模型在复杂文档环境中整合视觉基础与逻辑推理存在挑战。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16117 2026-05-18 cs.CL 50%

SGR: A Stepwise Reasoning Framework for LLMs with External Subgraph Generation

SGR:一种用于LLM的分步推理框架,通过外部子图生成

Xin Zhang, Yang Cao, Baoxing Wu, Kai Song, Siying Li

机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 SGR通过外部子图生成提升LLM推理能力,利用结构化知识支持多步推理,实验表明在多个基准数据集上均优于基线方法,提高了推理准确性和事实可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11629 2026-05-13 cs.CL 50%

OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

OmniThoughtVis: 一种可扩展的蒸馏流水线,用于可部署的多模态推理模型

Yuanhao Yue, Chengyu Wang, Yuanjie Lyu, Lei Shen, Jun Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文提出OmniThoughtVis流水线,通过大规模多模态Co T监督将高容量教师模型的推理能力转移到小型部署模型,实现了在多个基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01719 2026-05-08 cs.CL 50%

What MLLMs Learn about When they Learn about Multimodal Reasoning

大语言模型在学习多模态推理时所学的内容

Jiwan Chung, Neel Joshi, Pratyusha Sharma, Youngjae Yu, Vibhav Vineet

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出MathLens基准测试,通过分解性能为感知、推理和多模态特定组件,揭示多模态推理模型评估中隐含的假设。研究显示,不同训练策略导致的能力谱系不同,多模态特定错误占比上升,表明进展反映的是子技能平衡变化而非统一提升。

详情

展开后加载摘要…

URL PDF HTML 收藏