arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-17 至 2026-02-17 共收录 166 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 41 篇

2602.13771 2026-02-17 cs.MM 50%

SRA: Semantic Relation-Aware Flowchart Question Answering

SRA: 语义关系感知的流程图问答

Xinyu Li, Bowei Zou, Yuchong Chen, Yifan Fan, Yu Hong

专题命中 推理评测 :reasoning(abstract)

AI总结 SRA通过利用大型语言模型检测节点间的语义关系,提升流程图问答的推理深度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16505 2026-02-17 cs.CV 50%

PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies

PRISMM-Bench: 一种基于同行评审的多模态不一致基准

Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨分校) Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 PRISMM-Bench是首个基于同行评审标记的多模态不一致基准,通过整理384个不一致点,设计三个任务评估模型跨模态检测和推理能力,揭示了多模态科学推理的挑战。

Comments Accepted at ICLR 2026. Project page https://da-luggas.github.io/prismm-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 14 篇

2602.14518 2026-02-17 cs.AI 85%

Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning

多模态长链推理中的知识冲突诊断

Jing Tang, Kun Wang, Haolang Lu, Hongjin Chen, KaiTao Chen, Zhongxiang Sun, Qiankun Li, Lingjuan Lyu, Guoshun Nan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Renmin University of China(中国人民大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本研究提出了一种统一的知识冲突概念,揭示了多模态长链推理中不同冲突类型的特征和处理机制,为诊断和控制推理失败提供了原理性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10645 2026-02-17 cs.CL 79%

ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference

ParoQuant: 基于成对旋转的量化方法用于高效推理大语言模型推理

Yesheng Liang, Haisheng Chen, Zihan Zhang, Song Han, Zhijian Liu

机构 * NVIDIA MIT(麻省理工学院) UC San Diego(加州大学圣地亚哥分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ParoQuant通过结合硬件高效旋转与通道缩放,有效解决推理LLMs中的异常值问题,实现更高的准确性和更低的开销。

Comments ICLR 2026 | Project page: https://paroquant.z-lab.ai | GitHub: https://github.com/z-lab/paroquant

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12916 2026-02-17 cs.CV cs.LG 77%

Reliable Thinking with Images

基于图像的可靠思考

Haobin Li, Yutong Yang, Yijie Lin, Xiang Dai, Mouxing Yang, Xi Peng

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Southwest China Institute of Electronic Technology(西南中国电子技术研究所) National Key Laboratory of Fundamental Algorithms(国家基础算法重点实验室) Models for Engineering Simulation, Sichuan University(工程模拟模型研究所,四川大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出RTWI方法,通过估计视觉提示和文本Co T的可靠性,以解决多模态推理中噪声思考问题,提升多模态大语言模型的性能。

Comments 26 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04942 2026-02-17 cs.LG cs.AI 73%

Privileged Information Distillation for Language Models

特权信息蒸馏用于语言模型

Emiliano Penaloza, Dheeraj Vattikonda, Nicolas Gontier, Alexandre Lacoste, Laurent Charlin, Massimo Caccia

机构 * McGill University(麦吉尔大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出π-Distill和OPSD两种方法,通过特权信息蒸馏提升语言模型在复杂代理环境中的表现,优于传统监督微调加强化学习的方法。

Comments Abstract border should have been purple

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14689 2026-02-17 cs.CR cs.AI cs.CL cs.LG 67%

Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks

揭示开放权重模型对预填充攻击的系统性漏洞

Lukas Struppek, Adam Gleave, Kellin Pelrine

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究揭示了开放权重模型对预填充攻击的系统性漏洞,通过评估多种策略发现其普遍易受攻击,强调了加强防御的必要性。

Comments 54 pages, 7 figures, 35 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14433 2026-02-17 cs.CY cs.AI cs.CL cs.HC 62%

Synthetic Reader Panels: Tournament-Based Ideation with LLM Personas for Autonomous Publishing

合成读者面板:基于比赛的创意生成与LLM角色用于自主出版

Fred Zimmerman

机构 * Nimble Books LLC(Nimble Books公司) Big Five Killer LLC(Big Five Killer公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出利用合成读者面板进行自主出版,通过LLM角色模拟多样化读者进行比赛评估,有效识别内容问题并提升高质量概念比例。

Comments 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21416 2026-02-17 cs.CL cs.LG 62%

Odin: Oriented Dual-module Integration for Text-rich Network Representation Learning

Odin:面向文本丰富网络表示学习的定向双模块集成

Kaifeng Hong, Yinglong Zhang, Xiaoying Hong, Xuewen Xia, Xing Xu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Odin通过定向双模块机制在Transformer中整合图结构,实现无跳跃的结构-文本整合,提升文本属性图表示学习性能。

Comments 32 pages, 2 figures

Journal ref Neurocomputing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04051 2026-02-17 cs.CL cs.AI 62%

High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning

高精度、少言 (HALT):通过能力对齐微调实现可靠的LLM

Tim Franzmeyer, Archie Sravankumar, Lijuan Liu, Yuning Mao, Rui Hou, Sinong Wang, Jakob N. Foerster, Luke Zettlemoyer, Madian Khabsa

机构 * University of Oxford(牛津大学) Anthropic(Anthropic公司) Meta University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HALT通过能力对齐微调提高LLM的响应正确性,使模型在四个领域中正确性提升至87%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05525 2026-02-17 cs.AI cs.LG physics.comp-ph physics.soc-ph 62%

Explainable AI: Learning from the Learners

可解释的人工智能:从学习者中学习

Ricardo Vinuesa, Steven L. Brunton, Gianmarco Mengaldo

机构 * National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出XAI结合因果推理,通过基础模型与可解释性方法的结合,实现从学习者中学习,提升科学和工程中的信任与问责

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13954 2026-02-17 cs.SD cs.AI 57%

Eureka-Audio: Triggering Audio Intelligence in Compact Language Models

Eureka-Audio: 在紧凑语言模型中触发音频智能

Dan Zhang, Yishu Lei, Jing Hu, Shuwei He, Songhe Deng, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Eureka-Audio通过紧凑架构和统一端到端设计,在低参数量下实现高性能音频理解,匹配甚至超越大模型表现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13953 2026-02-17 cs.LG 57%

QuRL: Efficient Reinforcement Learning with Quantized Rollout

QuRL: 量化回滚的高效强化学习

Yuhang Li, Reena Elangovan, Xin Dong, Priyadarshini Panda, Brucek Khailany

机构 * NVIDIA Research(NVIDIA研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 QuRL通过量化动作器和自适应截断范围技术,显著提升强化学习回滚效率,实现20%-80%的加速

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21285 2026-02-17 q-fin.GN cs.AI cs.CE econ.GN q-fin.EC 57%

A Financial Brain Scan of the LLM

对大型语言模型的金融脑扫描

Hui Chen, Antoine Didisheim, Mohammad, Pourmohammadi, Luciano Somoza, Hanqing Tian

机构 * University of Melbourne(墨尔本大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 通过

Comments 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14431 2026-02-17 cs.HC 50%

'I Spend All My Energy Preparing': Balancing AI Automation and Agency for Self-Regulated Learning in SmartFlash

我将全部精力用于准备:在SmartFlash中平衡AI自动化与自主性以促进自我调节学习

Hongming Li, Salah Esmaeiligoujar, Nazanin Adham, Hai Li, Rui Huang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了在SmartFlash中如何通过AI自动化与自主性平衡以促进自我调节学习,发现学生需要透明且可编辑的AI输出以保持认知所有权,并提出了设计原则以支持元认知发展。

Comments Accepted at the International Society of the Learning Sciences (ISLS) Annual Meeting 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13800 2026-02-17 cs.RO cs.HC 50%

Ontological grounding for sound and natural robot explanations via large language models

通过大语言模型实现声音和自然的机器人解释的本体论基础

Alberto Olivares-Alarcos, Muhammad Ahsan, Satrio Sanjaya, Hsien-I Lin, Guillem Alenyà

机构 * Institute of Electrical and Control Engineering, National Yang Ming Chiao Tung University(电子与控制工程研究所,国立阳明交通大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出结合本体推理与大语言模型的框架,以生成自然且语义准确的机器人解释,提升人机交互的透明度和可解释性。

Comments An extended abstract of this article is accepted for presentation at AAMAS 2026: Olivares-Alarcos, A., Muhammad, A., Sanjaya, S., Lin, H. and Alenyà, G. (2026). Blending ontologies and language models to generate sound and natural robot explanations. In Proceedings of the International Conference on Autonomous Agents and Multiagent Systems. IFAAMAS

详情

展开后加载摘要…

URL PDF HTML 收藏