arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-04 至 2026-03-04 共收录 90 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2602.19517 2026-03-04 cs.AI cs.CE cs.CL cs.CV 81%

Classroom Final Exam: An Instructor-Tested Reasoning Benchmark

教室期末考试:一个由教师测试的推理基准

Chongyang Gao, Diji Yang, Shuyan Zhou, Xichen Yan, Luchuan Song, Shuo Li, Kezhen Chen

机构 * Northwestern University(西北大学) UC Santa Cruz(加州大学圣克鲁兹分校) Duke University(杜克大学) University of Birmingham(伯明翰大学) University of Rochester(罗切斯特大学) Analogy AI, Inc.(Analogy AI 公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CFE-Bench是一个由教师测试的多模态推理基准,用于评估大语言模型在STEM领域中的推理能力,发现前沿模型在多步骤解决方案中存在中间状态推导和保持的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02248 2026-03-04 cs.DB cs.CL cs.IR cs.LG 81%

HELIOS: Harmonizing Early Fusion, Late Fusion, and LLM Reasoning for Multi-Granular Table-Text Retrieval

HELIOS: 协调早期融合、后期融合和大语言模型推理以实现多粒度表格-文本检索

Sungho Park, Joohyung Yun, Jongwuk Lee, Wook-Shin Han

机构 * POSTECH(POSTECH大学) Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 HELIOS通过结合早期融合、后期融合和LLM推理,提升多粒度表格-文本检索性能,实验显示在召回率和nDCG上显著优于现有模型。

Comments 9 pages, 6 figures. Accepted at ACL 2025 main. Project page: https://helios-projectpage.github.io/

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 32424-32444, July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19373 2026-03-04 cs.CR cs.AI 79%

Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models

通过镜头进行Doxing:揭示多模态大推理模型中的位置相关隐私泄露

Weidi Luo, Tianyu Lu, Qiming Zhang, Xiaogeng Liu, Bin Hu, Yue Zhao, Jieyu Zhao, Song Gao, Patrick McDaniel, Zhen Xiang, Chaowei Xiao

机构 * University of Georgia(佐治亚大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) John Hopkins University(约翰·霍普金斯大学) University of Southern California(南加州大学) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了多模态大推理模型中的位置隐私泄露问题,提出DoxBench和GeoMiner框架,揭示模型在推断地理位置信息上的能力及隐私风险。

Comments Camera-ready version. Accepted as a poster at the 14th International Conference on Learning Representations (ICLR 2026). For official ICLR page, see https://iclr.cc/virtual/2026/poster/10006914

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02663 2026-03-04 cs.CL cs.CV 79%

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

利用多模态项目反应理论评估跨模态推理能力与问题特征

Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima, Naoto Inoue, Mayu Otani, Koh Takeuchi

机构 * Kyoto University(京都大学) CyberAgent The Institute of Statistical Mathematics(统计数学研究所) Tohoku University(东北大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 M3IRT通过分解模型能力和项目难度,提供了一种评估多模态推理能力的框架,有效提升基准测试的可靠性和质量。

Comments 24pages, 20 figures, accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17623 2026-03-04 cs.MM cs.CV 78%

Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?

合成感知:生成图像能否解锁潜在的视觉先验以用于以文本为中心的推理?

Yuesheng Huang, Peng Zhang, Xiaoxin Wu, Riliang Liu, Jiaqi Liang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文探讨生成图像能否解锁潜在视觉先验以提升文本中心推理,通过多模态融合架构和提示工程策略实现性能提升。

Comments Accepted as a poster at the International Conference on Machine Learning (ICML 2025) NewInML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02156 2026-03-04 cs.CL cs.AI cs.LG 75%

Adaptive Social Learning via Mode Policy Optimization for Language Agents

基于模式策略优化的自适应社会学习语言代理

Minzheng Wang, Yongbin Li, Haobo Wang, Xinghua Zhang, Nan Xu, Bingli Wu, Fei Huang, Haiyang Yu, Wenji Mao

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ASL框架和AMPO算法,通过多粒度推理模式设计和上下文感知切换,提升语言代理在动态社交互动中的自适应推理能力,实验显示在任务表现和思考链效率上优于现有方法。

Comments Proceedings of ICLR 2026. The code and data are available, see https://github.com/MozerWang/AMPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03170 2026-03-04 cs.CR cs.AI 70%

AttackSeqBench: Benchmarking the Capabilities of LLMs for Attack Sequences Understanding

AttackSeqBench: 对LLM在攻击序列理解能力的基准测试

Haokai Ma, Javier Yong, Yunshan Ma, Kuei Chen, Anis Yusof, Zhenkai Liang, Ee-Chien Chang

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AttackSeqBench通过系统评估LLM在攻击序列理解中的能力,揭示其在网络安全领域的优势与局限。

Comments 27 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21023 2026-03-04 cs.CL cs.AI cs.LG 67%

Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost

ParamΔ 用于直接权重混合:零成本的后训练大语言模型

Sheng Cao, Mingrui Wu, Karthik Prasad, Yuandong Tian, Zechun Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ParamΔ通过零成本方法实现基础模型的后训练能力迁移,提升模型性能与开发效率。

Comments Published as a conference paper at ICLR 2025

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12843 2026-03-04 cs.CL cs.AI 62%

NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions

NutriBench:一个用于评估大语言模型从餐食描述中估算营养的基准数据集

Andong Hua, Mehak Preet Dhaliwal, Laya Pullela, Ryan Burke, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 NutriBench通过评估大语言模型在餐食描述中估算营养的能力,为营养估算提供了新的研究方向和应用可能性。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02262 2026-03-04 cs.CR cs.AI cs.LG 62%

Silent Sabotage During Fine-Tuning: Few-Shot Rationale Poisoning of Compact Medical LLMs

细调过程中的无声破坏:紧凑型医学LLM的少样本推理污染

Jingyuan Xie, Wenjie Wang, Ji Wu, Jiandong Gao

机构 * Department of Electronics Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology, Beijing, China(北京信息科学国家研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种针对医学LLM在细调过程中的推理污染攻击,通过注入污染的推理样本导致模型在特定医学主题上的性能下降,揭示了细调阶段存在的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02222 2026-03-04 cs.LG cs.AI 62%

MedCalc-Bench Doesn't Measure What You Think: A Benchmark Audit and the Case for Open-Book Evaluation

MedCalc-Bench 并未衡量你所想的:一项基准审计与开放书考试的案例

Artus Krohn-Grimberghe

机构 * MedCalc

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MedCalc-Bench的基准审计揭示其主要衡量公式记忆和算术精度,而非临床推理,通过开放书提示显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03241 2026-03-04 cs.CV cs.AI 57%

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

UniG2U-Bench: 统一模型是否能提升多模态理解?

Zimo Wen, Boxiu Li, Wanbo Zhang, Junxiang Lei, Xiaoyu Chen, Yijia Fan, Qi Zhang, Yujiang Wang, Lili Qiu, Bo Li, Ziwei Liu, Caihua Shan, Yifan Yang, Yifei Shen

机构 * Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03002 2026-03-04 cs.AI 57%

SpatialText: A Pure-Text Cognitive Benchmark for Spatial Understanding in Large Language Models

SpatialText: 一种纯文本的认知基准,用于大型语言模型中的空间理解

Peiyao Jiang, Zequn Qin, Xi Li

机构 * Zhejiang University(浙江大学) School of Software Technology, Zhejiang University(软件技术学院,浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SpatialText通过双源方法为大型语言模型提供纯文本空间认知基准,揭示其在空间推理中的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02766 2026-03-04 cs.AI cs.MA 57%

EvoSkill: Automated Skill Discovery for Multi-Agent Systems

EvoSkill:多智能体系统的自动化技能发现

Salaheddin Alzubi, Noah Provenzano, Jaydon Bingham, Weiyuan Chen, Tu Vu

机构 * Sentient Virginia Tech(弗吉尼亚理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EvoSkill通过自进化框架自动发现和优化多智能体系统的技能,提升在OfficeQA和SealQA等基准测试中的性能,并展示技能在跨任务迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02684 2026-03-04 cs.CL cs.SI 57%

HateMirage: An Explainable Multi-Dimensional Dataset for Decoding Faux Hate and Subtle Online Abuse

HateMirage: 一个可解释的多维数据集用于解码虚假仇恨与微妙的在线虐待

Sai Kartheek Reddy Kasu, Shankar Biradar, Sunil Saumya, Md. Shad Akhtar

机构 * Indian Institute of Information Technology Dharwad(印度信息技术学院达尔瓦德) Manipal Institute of Technology, Manipal Academy of Higher Education(曼普及高等教育学院技术学院) Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术学院德里)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 HateMirage 是一个用于解码虚假仇恨与微妙在线虐待的多维数据集,通过多维解释框架提升仇恨言论的可解释性研究。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02557 2026-03-04 cs.CV cs.AI 57%

CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment

CAPT:基于混淆的提示微调以减少视觉-语言不一致

Maoyuan Shao, Yutong Gao, Xinyang Huang, Chuang Zhu, Lijuan Sun, Guoshun Nan

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Library of China, Beijing, China(中国国家图书馆) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CAPT通过引入混淆感知的提示微调框架,有效减少视觉-语言模型中的混淆误差,提升模型判别能力和泛化性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02540 2026-03-04 cs.AI 57%

A Neuropsychologically Grounded Evaluation of LLM Cognitive Abilities

基于神经心理学的大型语言模型认知能力评估

Faiz Ghifari Haznitrama, Faeyza Rishad Ardi, Alice Oh

机构 * School of Computing, KAIST, Daejeon, South Korea(韩国科学技术院计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出NeuroCognition基准测试,通过神经心理学测试评估LLM的认知能力,揭示其在图像和复杂任务上的不足,并展示其改进LLM的潜力。

Comments 26 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02528 2026-03-04 cs.AI cs.RO 57%

LLM-MLFFN: Multi-Level Autonomous Driving Behavior Feature Fusion via Large Language Model

LLM-MLFFN: 通过大语言模型的多级自动驾驶行为特征融合

Xiangyu Li, Tianyi Wang, Xi Cheng, Rakesh Chowdary Machineni, Zhaomiao Guo, Sikai Chen, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) Systems Engineering Program, Cornell University(康奈尔大学系统工程项目) Department of Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程系) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LLM-MLFFN通过大语言模型的多级特征融合提升自动驾驶行为分类的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02345 2026-03-04 cs.SE cs.AI cs.MA 57%

RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection

RIVA: 利用LLM代理进行可靠的配置漂移检测

Sami Abuzakuk, Lucas Crijns, Anne-Marie Kermarrec, Rafael Pires, Martijn de Vos

机构 * EPFL(瑞士洛桑联邦理工学院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 RIVA通过多代理系统和交叉验证技术,提高在工具响应错误时的IaC验证可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02230 2026-03-04 cs.HC cs.AI cs.CY 57%

The Gen AI Generation: Student Views of Awareness, Preparedness, and Concern

生成式人工智能:学生对意识、准备度与担忧的看法

Micaela Siraj, Jon Duke, Thomas Plötz

机构 * Georgia Institute of Technology Atlanta, United States of America(佐治亚理工学院亚特兰大分校,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨学生对生成式人工智能的意识、准备度和担忧,发现接触GenAI的学生成绩更高,但多数学生对伦理和就业影响表示担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02658 2026-03-04 cs.CV 50%

OmniFashion: Towards Generalist Fashion Intelligence via Multi-Task Vision-Language Learning

OmniFashion: 通过多任务视觉-语言学习实现通用时尚智能

Zhengwei Yang, Andi Long, Hao Li, Zechao Hu, Kui Jiang, Zheng Wang

机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心、人工智能研究院、计算机科学学院、武汉大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 OmniFashion通过多任务视觉-语言学习,构建百万级时尚数据集,实现统一的时尚对话范式,提升多任务推理和交互能力,推动通用时尚智能发展。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 9 篇

2602.04288 2026-03-04 cs.CL cs.AI cs.LG 82%

Contextual Drag: How Errors in the Context Affect LLM Reasoning

上下文拖累:上下文中的错误如何影响大语言模型的推理

Yun Cheng, Xingyu Zhu, Haoyu Zhao, Sanjeev Arora

机构 * Princeton University(普林斯顿大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现上下文中的错误会偏向下文生成的推理错误,导致性能下降,并指出缓解策略无法完全消除该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12264 2026-03-04 cs.AI 79%

Reducing Belief Deviation in Reinforcement Learning for Active Reasoning

减少强化学习中的信念偏差以实现主动推理

Deyu Zou, Yongqiang Chen, Jianxiang Wang, Haochen Yang, Mufei Li, James Cheng, Pan Li, Yu Gong

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出$\mathbf{T^3}$方法,通过跟踪信念偏差并截断训练轨迹,提升LLM在主动推理中的训练稳定性与性能表现。

Comments Published as a conference paper at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11369 2026-03-04 cs.CV 78%

Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment

推理作为表示:重新思考图像质量评估中的视觉强化学习

Shijie Zhao, Xuanyu Zhang, Weiqi Li, Junlin Li, Li Zhang, Tianfan Xue, Jian Zhang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出RALI算法,通过对比学习实现图像与通用文本表示的对齐,无需推理过程,显著降低参数和推理时间,提升图像质量评估的泛化性能。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21626 2026-03-04 cs.DC 71%

Multi-Layer Scheduling for MoE-Based LLM Reasoning

多层调度用于基于MoE的LLM推理

Yifan Sun, Gholamreza Haffari, Minxian Xu, Rajkumar Buyya, Adel N. Toosi

专题命中 其他推理 :reasoning(title)

AI总结 本研究提出多层调度框架,针对基于MoE的LLM推理优化,通过请求、引擎和专家层面调度策略,提升吞吐量和效率,实验表明在TTFT和TPOT延迟上分别减少17.8%和13.3%。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03074 2026-03-04 cs.HC cs.AI 57%

Design Generative AI for Practitioners: Exploring Interaction Approaches Aligned with Creative Practice

为实践者设计生成式AI:探索与创意实践对齐的交互方法

Xiaohan Peng, Wendy E. Mackay, Janin Koch

机构 * LISN Université Paris-Saclay, CNRS, Inria(LISN 巴黎-萨克雷大学,法国国家科学研究中心,法国国家信息与自动化技术研究所) UMR 9189 CRIStAL Univ. Lille, Inria, CNRS, Centrale Lille(UMR 9189 CRIStAL 利摩日大学,法国国家信息与自动化技术研究所,法国国家科学研究中心,利摩日中央理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出三种交互方法,帮助设计师在不同阶段引导生成式AI与创意实践对齐,强调动态协商与主动/被动角色的适应性。

Comments Accepted to ACM CHI 2026 Workshop on Bidirectional Human-AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09710 2026-03-04 cs.AI 57%

Echoing: Identity Failures when LLM Agents Talk to Each Other

回声:当大语言模型代理相互交谈时的身份失败

Sarath Shekkizhar, Romain Cosentino, Adam Earle, Silvio Savarese

机构 * Salesforce AI Research(Salesforce AI研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现LLM代理在相互对话中出现身份失败现象,即回声,通过实验表明回声率高达70%,并提出结构化响应作为缓解措施。

Comments Published at ICLR workshop. Related blog post: https://www.salesforce.com/blog/agent-to-agent-interaction/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04949 2026-03-04 cs.IR cs.AI 57%

Leverage Knowledge Graph and Large Language Model for Law Article Recommendation: A Case Study of Chinese Criminal Law

利用知识图谱和大语言模型进行法律文书推荐:中国刑法案例研究

Yongming Chen, Miner Chen, Ye Zhu, Juan Pei, Siyu Chen, Yu Zhou, Yi Wang, Yifan Zhou, Hao Li, Songan Zhang

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(未来技术全球研究院,上海交通大学) Donghua University(东华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结合知识图谱和大语言模型的法律文书推荐方法,通过构建案例增强的知识图谱和闭环框架,提升了推荐准确性,优于现有基线方法。

Comments Paper has been accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02701 2026-03-04 cs.CL 57%

Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization

图GRPO:通过群体相对策略优化稳定多智能体拓扑学习

Yueyang Cang, Xiaoteng Zhang, Erlu Zhao, Zehua Ji, Yuhang Liu, Yuchen He, Zhiyuan Ning, Chen Yijun, Wenge Que, Li Shi

机构 * Tsinghua University(清华大学) Donghua University(东华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 图GRPO通过群体相对策略优化稳定多智能体拓扑学习,提升训练稳定性并识别关键通信路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13251 2026-03-04 cs.CV 50%

Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs

映射流:揭示视频大语言模型中的隐藏信息路径

Minji Kim, Taekyung Kim, Bohyung Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究通过机理可解释性技术揭示视频大语言模型中信息流的隐藏路径,展示了时间推理机制及提升模型可解释性和泛化能力的贡献。

Comments ICLR 2026, 32 pages, 39 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏