arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-03 至 2026-03-03 共收录 259 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 25 篇

2505.21413 2026-03-03 cs.CL cs.AI 81%

RefTool: Reference-Guided Tool Creation for Knowledge-Intensive Reasoning

RefTool: 基于参考的工具创建用于知识密集型推理

Xiao Liu, Da Yin, Zirui Wu, Yansong Feng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) University of Chicago(芝加哥大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RefTool通过基于参考的工具创建框架,提升LLMs在知识密集型任务中的推理能力,实现更准确和高效的工具生成与应用。

Comments Accepted by ICLR 2026. Code is available at https://github.com/xxxiaol/RefTool

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02018 2026-03-03 cs.LG 80%

Geometric Reasoning in the Embedding Space

嵌入空间中的几何推理

Jan Hůla, David Mojžíšek, Jiří Janeček, David Herel, Mikoláš Janota

机构 * University of Ostrava(奥斯特拉瓦大学) Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出通过图神经网络和变换器在嵌入空间中进行几何推理,证明其能有效恢复网格结构并优于变换器。

Comments published version of the article in English

Journal ref Mojzisek, D., Hula, J., Janecek, J., Herel, D., & Janota, M. (2025). Geometric Reasoning in the Embedding Space. Machine Learning and Knowledge Extraction, 7(3), 93

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06292 2026-03-03 cs.CV cs.AI 79%

ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations

ChainMPQ: 交错文本图像推理链用于缓解关系幻觉

Yike Wu, Yiwei Wang, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学梅尔德分校) Ant Group(蚂蚁集团)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ChainMPQ通过交错文本和图像推理链,利用积累的记忆减少大型视觉语言模型的关系幻觉,提升关系推理能力。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21082 2026-03-03 cs.CL 79%

RPM: Reasoning-Level Personalization for Black-Box Large Language Models

RPM:面向黑盒大语言模型的推理层面个性化

Jieyong Kim, Tongyoung Kim, Soojin Yoon, Jaehyung Kim, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 RPM通过构建用户行为结构模型,实现黑盒大语言模型的推理层面个性化,提升个性化性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01293 2026-03-03 cs.LG cs.AI stat.ML 76%

Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models

数据质量和协同效应在预训练和后训练推理模型中的理论视角

Adel Javanmard, Baharan Mirzasoleiman, Vahab Mirrokni

专题命中 其他推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文通过理论分析揭示了预训练和后训练模型中数据质量与协同效应的关键机制,发现平衡预训练数据能激活潜在能力,SFT在挑战性小样本上表现最佳,而RL在大规模非困难数据上更有效。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01212 2026-03-03 cs.CL 74%

XAI-enhanced Comparative Opinion Mining via Aspect-based Scoring and Semantic Reasoning

基于XAI的比较意见挖掘:通过基于方面的评分和语义推理

Ngoc-Quang Le, T. Thanh-Lam Nguyen, Quoc-Trung Phu, Thi-Phuong Le, Duy-Cat Can, Hoang-Quynh Le

机构 * VNU University of Engineering(越南工程大学) Singapore Management University(新加坡管理大学) Centre Hospitalier Universitaire Vaudois(瓦乌多大学医院) University of Lausanne(洛桑大学)

专题命中 其他推理 :reasoning(title);分类 cs.CL

AI总结 本文提出XCom模型,通过基于方面的评分和语义推理提升比较性意见挖掘的可解释性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01651 2026-03-03 cs.CL cs.AI 62%

LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence

LexChronos:一个用于印度法理学中结构化事件时间线提取的代理框架

Anka Chandrahas Tummepalli, Preethu Rose Anish

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LexChronos通过双代理架构提取印度最高法院判决中的结构化事件时间线,提升法律文本理解和推理能力。

Comments Published in AILaw @ AAAI 2026 Conference

Journal ref AILaw @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01297 2026-03-03 cs.LG cs.CL 62%

I Can't Believe It's Not Robust: Catastrophic Collapse of Safety Classifiers under Embedding Drift

我难以相信它不稳健:在嵌入漂移下安全分类器的灾难性崩溃

Subramanyam Sahoo, Vinija Jain, Divya Chaudhary, Aman Chadha

机构 * Independent(独立研究者) Meta AI AWS Generative AI Innovation Center, Amazon Web Services(AWS生成式AI创新中心,亚马逊网络服务) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国) Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究发现嵌入漂移导致安全分类器性能大幅下降,揭示了生产AI安全架构的脆弱性并挑战了安全机制的转移假设。

Comments Accepted at the ICBINB: Where LLMs Need to Improve workshop at ICLR 2026. 12 pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04784 2026-03-03 cs.CL cs.AI 62%

Post-training Large Language Models for Diverse High-Quality Responses

在训练后为大型语言模型生成多样化高质量响应

Yilei Chen, Souradip Chakraborty, Lorenz Wolf, Yannis Paschalidis, Aldo Pacchiano

机构 * Boston University(波士顿大学) University of Maryland, College Park(马里兰大学学院公园分校) University College London(伦敦大学学院) Boston University Broad Institute of MIT and Harvard(MIT和哈佛大学波士顿大学Broad研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DQO方法,通过确定性点过程优化大型语言模型的质量和语义多样性,提升输出多样性而不影响性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02146 2026-03-03 cs.CL 57%

LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards

长上下文强化学习需要可验证的上下文奖励

Guanzheng Chen, Michael Qizhe Shieh, Lidong Bing

机构 * National University of Singapore(国立新加坡大学) MiroMind AI absolute AI

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 LongRLVR通过引入可验证的上下文奖励,解决长上下文强化学习中因稀疏奖励导致的梯度消失问题,显著提升大语言模型的推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01947 2026-03-03 cs.CV cs.AI 57%

physfusion: A Transformer-based Dual-Stream Radar and Vision Fusion Framework for Open Water Surface Object Detection

physfusion: 一种基于Transformer的双流雷达与视觉融合框架用于开放水域表面目标检测

Yuting Wan, Liguo Sun, Jiuwu Hao, Zao Zhang, Pin LV

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 PhysFusion通过物理引导雷达编码器和Transformer融合模块,实现开放水域表面目标的高效检测,取得高精度检测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01783 2026-03-03 cs.AI 57%

GAM-RAG: Gain-Adaptive Memory for Evolving Retrieval in Retrieval-Augmented Generation

GAM-RAG:基于增益的记忆用于演化检索的检索增强生成

Yifan Wang, Mingxuan Jiang, Zhihao Sun, Yixin Cao, Yicun Liu, Keyang Chen, Guangnan Ye, Hongfeng Chai

机构 * Fudan University(复旦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 GAM-RAG通过动态更新检索记忆提升检索增强生成的性能,减少计算成本,提高推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01135 2026-03-03 cs.AI 57%

FCN-LLM: Empower LLM for Brain Functional Connectivity Network Understanding via Graph-level Multi-task Instruction Tuning

FCN-LLM: 通过图级多任务指令微调赋能LLM理解脑功能连接网络

Xingcan Hu, Wei Wang, Li Xiao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 FCN-LLM通过图级多任务指令微调使LLM理解脑功能连接网络,提升其在临床任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19733 2026-03-03 cs.CL 57%

Breaking Barriers: Do Reinforcement Post Training Gains Transfer To Unseen Domains?

打破壁垒:强化学习后训练的增益是否能转移到未见领域?

Chuxuan Hu, Yuxuan Zhu, Antony Kellermann, Caleb Biddulph, Suppakit Waiwitlikhit, Jason Benn, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了强化学习后训练在不同领域中的泛化能力,发现其增益在不同推理模式的领域中不一致。

Comments ICLR 2026; 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17519 2026-03-03 cs.CR cs.CL 57%

Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives

链式诱饵:一种利用无约束合成叙述的通用 jailbreak 攻击框架

Wenhan Chang, Tianqing Zhu, Yu Zhao, Shuangyong Song, Ping Xiong, Wanlei Zhou

机构 * School of Information Engineering, Zhongnan University of Economics and Law(中南财经政法大学信息工程学院) TeleAI, Beijing(北京TeleAI) City University of Macau(澳门城市大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种基于无约束合成叙述的通用jailbreak攻击框架,通过任务转移生成诱饵问题链并利用辅助模型优化,实现对LLMs的高成功率攻击,并提出毒性和防御策略。

Comments 23 pages, 3 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00565 2026-03-03 cs.CV cs.AI cs.CR 57%

MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs

MIDAS: 多图像分散与语义重建用于对抗多模态大语言模型

Yilian Liu, Xiaojun Jia, Guoshun Nan, Jiuyang Lyu, Zhican Chen, Tao Guan, Shuyuan Luo, Zhongyi Zhai, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Guilin University of Electronic Technology(桂林电子科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 MIDAS通过多图像分散与语义重建技术,提升对抗多模态大语言模型的劫持性能,达到81.46%的平均攻击成功率。

Journal ref The Fourteenth International Conference on Learning Representations(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00364 2026-03-03 cs.CL 57%

Distribution-Aware Companding Quantization of Large Language Models

面向分布的扩增量化:大型语言模型

Athul Radhakrishnan, Siddhant Mohan, Mahima Sachdeva

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出一种多标记预测方法,通过提升样本效率和推理速度,显著提高大型语言模型在编码等生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00066 2026-03-03 cs.CY cs.AI 57%

Contesting Artificial Moral Agents

挑战人工道德代理

Aisha Aijaz

机构 * IIIT-Delhi(德里印度理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种5E框架,用于挑战人工道德代理的道德性,涵盖伦理、认识论、可解释性、经验和评估五个方面,并提供时间线以指导价值对齐的AI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00878 2026-03-03 cs.CV 50%

MMTA: Multi Membership Temporal Attention for Fine-Grained Stroke Rehabilitation Assessment

MMTA: 多成员时序注意机制用于细粒度笔画康复评估

Halil Ismail Helvaci, Justin Huber, Jihye Bae, Sen-ching Samson Cheung

机构 * Department of Electrical and Computer Engineering, University of Kentucky, Lexington, KY, USA(电气与计算机工程系,肯塔基大学,路易斯维尔,KY,美国) College of Medicine, University of Kentucky, Lexington, KY, USA(医学学院,肯塔基大学,路易斯维尔,KY,美国) Department of Electrical and Computer Engineering, University of California, Davis, CA, USA(电气与计算机工程系,加州大学戴维斯分校,CA,美国)

专题命中 其他推理 :reasoning(abstract)

AI总结 MMTA通过多成员时序注意机制提升细粒度笔画康复评估的精度和鲁棒性,适用于视频和可穿戴设备输入。

详情

展开后加载摘要…

URL PDF HTML 收藏