arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2604.15244 2026-04-17 cs.CL 50%

From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning

从标记到步骤:面向验证的推测解码用于高效多步推理

Kiran Purohit, Ramasuri Narayanam, Soumyabrata Pal

机构 * IIT Kharagpur(印度克哈格普尔理工学院) Adobe Research(Adobe研究院)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出SpecGuard框架,通过模型内部信号进行步骤级验证,提升多步推理的准确性和效率,实验显示在多个推理基准上准确率提升3.6%且延迟降低11%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01773 2026-04-16 cs.RO 50%

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13706 2026-04-16 cs.CL 50%

Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models

Co-FactChecker:一种用于人类-人工智能协作事实核查的框架

Dhruv Sahnan, Subhabrata Dutta, Tanmoy Chakraborty, Preslav Nakov, Iryna Gurevych

机构 * MBZUAI(穆罕默德·本·拉希德人工智能技术 institute) TU Darmstadt(德累斯顿理工大学) IIT Delhi(德里印度理工学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出Co-FactChecker框架,通过将模型的思考轨迹作为共享草稿,利用专家反馈指导推理,提升事实核查的准确性和可解释性。

Comments 11 pages, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10787 2026-04-14 cs.CL 50%

When Meaning Isn't Literal: Exploring Idiomatic Meaning Across Languages and Modalities

当意义不再字面化:探索跨语言和模态的隐喻意义

Sarmistha Das, Shreyas Guha, Suvrayan Bandyopadhyay, Salisa Phosit, Kitsuchart Pasupa, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校) King Mongkut's Institute of Technology Ladkrabang(国王科技大学拉卡邦分校)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出Mediom多语言多模态隐喻语料库及HIDE框架,通过系统性测试揭示语言模型在隐喻理解上的缺陷,并为下一代AI系统提供文化根基的隐喻理解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08771 2026-04-13 cs.HC cs.ET 50%

TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction

TeamLLM: 探索LLMs在多模态群体交互预测中的能力

Diana Romero, Xin Gao, Daniel Khalkhali, Salma Elmalaki

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 本文研究LLMs在多模态传感器数据中预测群体协调模式的能力,发现LLMs在语言基础行为上比LSTM基线提升3.2倍,细调准确率达96%。同时揭示了文本模型在多模态交互中的局限性及模拟模式的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04017 2026-04-07 cs.CL 50%

GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces

GeoBrowse:一种用于代理工具使用的地理定位基准测试

Xinyu Geng, Yanjing Xiao, Yuyang Zhang, Hanwen Wang, Xinyan Liu, Rui Min, Tianqing Fang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 GeoBrowse基准测试结合了视觉推理与知识密集型多跳查询,通过专家标注的逐步轨迹分析验证多步工具使用策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03088 2026-04-06 cs.IR 50%

ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning

ADSeeker: 一种基于知识的推理框架用于工业异常检测与推理

Kai Zhang, Zekai Zhang, Xihe Sun, Anpeng Wang, Jingmeng Nie, Qinghui Chen, Han Hao, Jianyuan Guo, Jinglin Zhang

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 ADSeeker通过整合视觉文档知识库和查询图像-知识检索增强生成框架,提升工业异常检测性能,提出层次稀疏提示机制和类型级特征以提取异常模式,构建大规模AD数据集MulA,实现零样本状态下的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 50%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28924 2026-04-01 cs.CL 50%

CrossTrace: A Cross-Domain Dataset of Grounded Scientific Reasoning Traces for Hypothesis Generation

CrossTrace:一种跨领域 grounded 科学推理轨迹数据集用于假设生成

Andrew Bouras, OMS-II Research Fellow

机构 * Nova Southeastern University Dr. Kiran C. Patel College of Osteopathic Medicine(诺瓦东南大学基兰·C·帕特尔骨科医学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 CrossTrace 是一个跨领域 grounded 科学推理轨迹数据集,包含 1389 个轨迹,涵盖生物医学研究、AI/ML 和跨领域工作。通过 QLoRA 微调 Qwen2.5-7B-Instruct,显著提升 IAScore 和结构合规性,验证跨领域推理轨迹的有效性。

Comments 14 pages, 1 figure, 8 tables. Dataset and code available at https://github.com/andrewbouras/crosstrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24004 2026-03-26 cs.CL 50%

Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning

基于表格的思考:通过神经符号推理增强多模态表格理解

Kun-Yang Yu, Zhi Zhou, Shi-Yu Tian, Xiao-Wen Yang, Zi-Yi Jia, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文提出TWT框架,通过神经符号推理解决表格数据结构多样性、特征依赖复杂性及任务异质性问题,在八个数据集上验证了其在多模态表格理解任务中的优越性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23229 2026-03-25 cs.CL 50%

I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes

我来了,我看到了,我解释了:在表情包中评估多模态大语言模型的隐喻意义

Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) National Research Council Canada(加拿大国家研究委员会)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文评估了八种最先进的生成式多模态大语言模型在检测和解释六种隐喻意义类型上的能力,并通过人工评估验证其解释的合理性与忠实性。

Comments LREC 2026, 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19858 2026-03-23 cs.RO cs.MA 50%

Beyond detection: cooperative multi-agent reasoning for rapid onboard EO crisis response

超越检测:用于快速在轨遥感危机响应的协作多智能体推理

Alejandro D. Mousist, Pedro Delgado de Robles Martín, Raquel Lladró Climent, Julian Cobos Aparicio

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出了一种分层多智能体架构,用于在轨遥感处理,在资源和带宽受限条件下,通过协调专用AI智能体实现互补多模态观测的利用,减少计算开销并保持决策一致性。

Comments Accepted for presentation at the ESA's 4S Symposium 2026 Conference (see https://atpi.eventsair.com/4s-symposium-2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17910 2026-03-23 cs.CL 50%

L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention

L2V-CoT:通过潜在干预实现链式推理的跨模态转移

Yuliang Zhan, Xinyu Tang, Han Wan, Jian Li, Ji-Rong Wen, Hao Sun

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出L2V-CoT方法,通过潜在干预将链式推理从LLM转移到VLM,利用低频潜在表示提升多步推理能力,实验表明优于无训练基线和监督方法。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19468 2026-03-23 cs.SD eess.AS 50%

Listen First, Then Answer: Timestamp-Grounded Speech Reasoning

先听再回答:基于时间戳的语音推理

Jihoon Jeong, Pooneh Mousavi, Mirco Ravanelli, Cem Subakan

机构 * Mila-Quebec AI Institute(魁北克AI研究所) Université Laval(拉瓦尔大学) Concordia University(康科迪亚大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出基于强化学习的时间戳接地策略,使语音大模型在推理时更关注音频内容,提升多模态推理的准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15997 2026-03-18 cs.MM cs.CL cs.SC 50%

Visual Set Program Synthesizer

视觉集合程序合成器

Zehua Cheng, Wei Dai, Wenhu Zhang, Thomas Lukasiewicz, Jiahao Sun

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Institute of Logic and Computation, TU Wien(维也纳技术大学逻辑与计算研究所)

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 本文提出通过视觉程序合成解决复杂视觉推理问题,引入Set-VQA基准测试,显著提升回答准确性并提高透明度。

Comments 10 pages, IEEE International Conference on Multimedia and Expo 2026

Journal ref IEEE International Conference on Multimedia and Expo 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09478 2026-03-11 cs.MM 50%

MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning

MORE-R1: 通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取的分步推理

Xiang Yuan, Xu Chu, Xinrong Chen, Haochen Li, Zonghong Dai, Hongcheng Fan, Xiaoyue Yuan, Weiping Li, Tong Mo

专题命中 视觉推理 :vision-language model(abstract)

AI总结 MORE-R1通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取,提升推理能力与模型性能。

Comments Accepted by the 31st International Conference on Database Systems for Advanced Applications. This is the Accepted Manuscript (AM) version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 50%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07824 2026-03-10 cs.RO 50%

Reasoning Knowledge-Gap in Drone Planning via LLM-based Active Elicitation

通过基于大语言模型的主动获取解决无人机规划中的推理知识缺口

Zeyu Fang, Beomyeol Yu, Cheng Liu, Zeyuan Yang, Rongqian Chen, Yuxin Lin, Mahdi Imani, Tian Lan

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出基于大语言模型的主动信息获取框架,用于解决无人机规划中的推理知识缺口问题,通过结构化知识缺口和最小化人机交互提升复杂任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07263 2026-03-10 cs.SD eess.AS 50%

Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning

看见上下文:通过多模态推理实现丰富的视觉上下文感知语音识别

Wenjie Tian, Mingchen Shao, Bingshen Mu, Xuelong Geng, Chengyou Wang, Yujie Liao, Zhixian Zhao, Ziyu Zhang, Jingbin Hu, Mengqi Wei, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出VASR,通过多模态推理融合丰富视觉上下文,解决音频-视觉语音识别中的单模态主导问题,实现更准确的语音识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06243 2026-03-09 cs.IR 50%

MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation

MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力

Yu Wang, Yonghui Yang, Le Wu, Jiancan Wu, Hefei Xu, Hui Lin

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。

Comments 14 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05275 2026-03-06 cs.MM cs.CL cs.SD 50%

SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning

SarcasmMiner:一种双轨后训练框架,用于鲁棒的音频视觉讽刺推理

Zhu Li, Yongjian Chen, Huiyuan Lai, Xiyuan Gao, Shekhar Nayak, Matt Coler

机构 * Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰) Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)

专题命中 视觉推理 :grounding(abstract)

AI总结 SarcasmMiner通过双轨蒸馏和组相对策略优化提升多模态讽刺检测性能,实现F1值显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04363 2026-03-05 cs.RO 50%

ManipulationNet: An Infrastructure for Benchmarking Real-World Robot Manipulation with Physical Skill Challenges and Embodied Multimodal Reasoning

ManipulationNet: 一个用于基于现实世界机器人操作的基准测试基础设施,包含物理技能挑战和具身多模态推理

Yiting Chen, Kenneth Kimble, Edward H. Adelson, Tamim Asfour, Podshara Chanrungmaneekul, Sachin Chitta, Yash Chitambar, Ziyang Chen, Ken Goldberg, Danica Kragic, Hui Li, Xiang Li, Yunzhu Li, Aaron Prather, Nancy Pollard, Maximo A. Roa-Garzon, Robert Seney, Shuo Sha, Shihefeng Wang, Yu Xiang, Kaifeng Zhang, Yuke Zhu, Kaiyu Hang

机构 * Rice University(里士大学) U.S. National Institute of Standards and Technology(美国国家标准与技术研究院) Massachusetts Institute of Technology(麻省理工学院) Karlsruhe Institute of Technology(卡尔斯鲁厄技术大学) Autodesk Research(Autodesk研究) University of California, Berkeley(加州大学伯克利分校) KTH Royal Institute of Technology(皇家理工学院) Tsinghua University(清华大学) Columbia University(哥伦比亚大学) ASTM International(美国材料与试验协会) Carnegie Mellon University(卡内基梅隆大学) German Aerospace Center (DLR)(德国航空航天中心) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA Research(NVIDIA研究)

专题命中 视觉推理 :grounding(abstract)

AI总结 ManipulationNet通过标准化硬件和统一软件客户端,为机器人操作提供现实世界基准测试,促进物理技能和具身推理能力的系统性发展。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02099 2026-03-04 cs.CL 50%

Recursive Think-Answer Process for LLMs and VLMs

递归思考-回答过程用于LLMs和VLMs

Byung-Kwan Lee, Youngchae Chee, Yong Man Ro

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出递归思考-回答过程(R-TAP)以提升LLMs和VLMs的推理准确性,通过置信度生成器和双奖励机制实现迭代推理,减少错误输出并提高推理稳定性。

Comments CVPR 2026 Findings, Project page: https://litcoderr.github.io/rtap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01225 2026-03-03 cs.CL 50%

Can Thinking Models Think to Detect Hateful Memes?

思考模型能否通过思考来检测仇恨言论?

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Qatar University(卡塔尔大学) Qatar Computing Research Institute(卡塔尔计算研究中心)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文提出基于强化学习的后训练框架,通过任务特定奖励和GRPO目标提升基于思考的多模态模型在检测仇恨言论中的推理能力,实验表明在准确性、F1值和解释质量上均有显著提升。

Journal ref In Companion Proceedings of the ACM Web Conference 2026 (WWW Companion 26), April 13-17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11917 2026-03-03 cs.RO 50%

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

OneTwoVLA:一种具有自适应推理能力的统一视觉-语言-动作模型

Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 视觉推理 :grounding(abstract)

AI总结 OneTwoVLA通过自适应推理机制实现视觉-语言-动作统一,提升机器人在复杂任务中的规划、交互与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00994 2026-03-03 cs.HC 50%

VizQStudio: Iterative Visualization Literacy MCQs Design with Simulated Students

VizQStudio: 基于模拟学生的迭代可视化素养多选题设计

Zixin Chen, Yuhang Zeng, Sicheng Song, Yanna Lin, Xian Xu, Huamin Qu, Meng Xia

专题命中 视觉推理 :MLLM(abstract)

AI总结 VizQStudio通过模拟学生帮助教师迭代设计高质量可视化素养多选题,提升评估设计的灵活性和适应性。

Comments TVCG fast track (PVIS 2026 TVCG Track) under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22416 2026-02-27 cs.HC 50%

Seeing Graphs Like Humans: Benchmarking Computational Measures and MLLMs for Similarity Assessment

像人类一样看图:通过计算度量和MLLMs进行相似性评估的基准测试

Seokweon Jung, Jeongmin Rhee, Seoyoung Doh, Hyeon Jeon, Ghulam Jilani Quadri, Jinwook Seo

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文通过实验比较了计算度量和MLLMs在图相似性评估中的表现,发现MLLMs,特别是GPT-5,在匹配人类感知方面表现优异,能提供可解释的推理理由。

Comments 21 pages including 1 page of appendix, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21983 2026-02-26 cs.RO 50%

Humanizing Robot Gaze Shifts: A Framework for Natural Gaze Shifts in Humanoid Robots

使机器人目光转移人性化:一种在人形机器人中实现自然目光转移的框架

Jingchao Wei, Jingkai Qin, Yuxiao Cao, Jingcheng Huang, Xiangrui Zeng, Min Li, Zhouping Yin

机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(机械科学与工程学院,华中科技大学)

专题命中 视觉推理 :VLM(abstract)

AI总结 本文提出RGS框架,通过结合认知注意力机制与生物模仿运动生成,实现人形机器人自然且上下文合适的人类化目光转移。

Comments submitted to AIM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21854 2026-02-26 cs.CL 50%

FewMMBench: A Benchmark for Multimodal Few-Shot Learning

FewMMBench: 一种多模态少样本学习的基准测试

Mustafa Dogan, Ilker Kesen, Iacer Calixto, Aykut Erdem, Erkut Erdem

机构 * Aselsan Research(阿塞利桑研究)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 FewMMBench是一个用于评估多模态少样本学习能力的基准测试,通过系统分析不同任务类型、模型家族和提示策略,揭示指令调优模型在零样本性能上的优势及CoT推理的局限性。

Comments Preprint. 49 pages, 38 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13614 2026-02-24 cs.CL 50%

MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning

MemoTime: 带记忆的时序知识图增强大语言模型推理

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * UNSW Data61(新南威尔士大学Data61) CSIRO(澳大利亚联邦科学与工业研究组织) UNSW Sydney Australia(新南威尔士大学悉尼分校) Data61, CSIRO(Data61,澳大利亚联邦科学与工业研究组织)

专题命中 视觉推理 :grounding(abstract)

AI总结 MemoTime通过带记忆的时序知识图框架提升LLM的时序推理能力,解决多跳推理、多实体同步、运算符适应和经验重用等挑战,实现先进性能。

Comments Accepted by The Web Conference 2026 (WWW, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏