arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-02 至 2026-02-02 共收录 121 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 34 篇

2512.01017 2026-02-02 cs.AI 57%

ChartAnchor: Chart Grounding with Structural-Semantic Fidelity

ChartAnchor: 图表接地与结构-语义保真

Xinhang Li, Jingbo Zhou, Pengfei Luo, Yixiong Xiao, Tong Xu

机构 * Baidu Research(百度研究) USTC

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ChartAnchor提出一个综合图表接地基准测试,通过图表到代码生成和受控表格重建任务,评估模型在结构和数值层面的保真度,揭示MLLMs在数值精度和代码合成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22699 2026-02-02 cs.CL 57%

Models Know Models Best: Evaluation via Model-Preferred Formats

模型最擅长模型评估:通过模型偏好的格式进行评估

Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Dept. of Computer Science and Engineering, Seoul National University(计算机科学与工程系,首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种动态格式对齐策略,通过模型生成的信号确定最佳评估格式,提升零样本准确率,揭示模型潜在能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22595 2026-02-02 cs.AI 57%

Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR

学得更多,用得更少:不确定性一致性引导的查询选择用于RLVR

Hao Yi, Yulan Hu, Xin Li, Sheng Ouyang, Lizhong Ding, Yong Liu

机构 * Renmin University of China(中国人民大学) Gaoling School of Artificial Intelligence(北京人工智能学院) Amap, Alibaba Group(阿里集团阿里的地图部门) School of Computer Science & Technology(计算机科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于不确定性一致性的查询选择方法,通过改进RLVR的样本选择策略,减少查询预算,提升推理任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22575 2026-02-02 cs.CV cs.CL 57%

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream:面向移动场景的多模态助手实时流基准测试

Xudong Lu, Huankang Guan, Yang Bo, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Peiwen Sun, Xueying Li, Wei Zhang, Xue Yang, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(CUHK 多模态实验室) Huawei Research(华为研究) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22076 2026-02-02 cs.LG cs.DC 57%

Where Do the Joules Go? Diagnosing Inference Energy Consumption

焦耳去哪儿了?诊断推理能耗

Jae-Won Chung, Ruofan Wu, Jeff J. Ma, Mosharaf Chowdhury

机构 * University of Michigan \& The ML.ENERGY Initiative

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究通过大规模测量发现生成式AI中不同任务和硬件配置对能耗的影响差异,并提出框架解释能耗与利用率等隐含指标的关系,为优化数据中心能耗提供依据。

Comments The ML ENERGY Leaderboard v3.0 is open at https://ml.energy/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16993 2026-02-02 cs.DL cs.AI 57%

BibAgent: An Agentic Framework for Traceable Miscitation Detection in Scientific Literature

BibAgent: 一种用于科学文献中可追溯的误引检测代理框架

Peiran Li, Fangzhou Lin, Shuo Xing, Xiang Zheng, Xi Hong, Siyuan Yang, Jiashuo Sun, Zhengzhong Tu, Chaoqun Ni

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BibAgent是一种用于科学文献中可追溯误引检测的代理框架,通过整合检索、推理和自适应证据聚合,实现高效且透明的引文验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21903 2026-02-02 cs.SE cs.AI 57%

TOM-SWE: User Mental Modeling For Software Engineering Agents

TOM-SWE:软件工程代理的用户心理建模

Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06307 2026-02-02 cs.AI 57%

Can AI Make Energy Retrofit Decisions? An Evaluation of Large Language Models

人工智能能做出能源改造决策吗?大型语言模型的评估

Lei Shu, Dong Zhao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在住宅能源改造决策中的表现,发现其在技术目标上表现较好,但在社会技术决策上受限于经济权衡和本地环境,需进一步提升准确性与上下文处理能力。

Journal ref Buildings 2025, 15(22), 4081

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22483 2026-02-02 cs.CV 50%

Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage

头感知视觉裁剪:通过注意力引导的子图像增强细粒度VQA

Junfei Xie, Peng Pan, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 通过注意力引导的子图像增强细粒度VQA,提出无需训练的HAVC方法,利用优化的注意力头提升视觉定位精度。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22218 2026-02-02 cs.CV cs.DL 50%

What Lies Beneath: A Call for Distribution-based Visual Question & Answer Datasets

表下之物:对基于分布的视觉问答数据集的呼吁

Jill P. Naiman, Daniel J. Evans, JooYoung Seo

机构 * Information Science(信息科学) University of Illinois(伊利诺伊大学) Urbana-Champaign(厄巴纳-香槟) Illinois, USA(伊利诺伊斯州,美国)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文呼吁建立专门针对科学图表的VQA基准,通过生成合成图表并要求模型基于底层数据回答问题,以解决现有数据集未能捕捉的图表与数据间关系的推理挑战。

Comments Accepted to ACM/IEEE Joint Conference on Digital Libraries JCDL 2025, 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 21 篇

2601.22949 2026-02-02 cs.CL cs.CR 85%

Autonomous Chain-of-Thought Distillation for Graph-Based Fraud Detection

基于图的欺诈检测的自主链式思维蒸馏

Yuan Li, Jun Hu, Bryan Hooi, Bingsheng He, Cheng Chen

机构 * National University of Singapore(新加坡国立大学) ByteDance Inc.(字节跳动公司)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 FraudCoT通过自主链式思维推理和高效联合训练策略,提升基于图的欺诈检测性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22730 2026-02-02 cs.CV cs.AI 83%

ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model

ImgCoT:将长链推理压缩为紧凑的视觉标记以实现大语言模型的高效推理

Xiaoshu Chen, Sihang Zhou, Ke Liang, Taichun Zhou, Xinwang Liu

机构 * National University of Defense Technology(国防科技大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 ImgCoT通过将长链推理压缩为视觉标记,提升大语言模型的推理效率,同时保留全局结构和细节信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22398 2026-02-02 cs.CV cs.AI 83%

Jailbreaks on Vision Language Model via Multimodal Reasoning

通过多模态推理实现对视觉语言模型的逃逸攻击

Aarush Noheria, Yuguang Yao

机构 * Novi High School, MI, USA(诺维高中) Michigan State University, MI, USA(密歇根州立大学)

专题命中 其他推理 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模态推理的逃逸攻击框架,通过训练后链式推理和自适应噪声机制提高对视觉语言模型的安全过滤器的绕过能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19404 2026-02-02 cs.AI cs.LG 81%

RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization

RPO:基于部分推理优化的强化微调

Hongzhu Yi, Xinming Wang, Zhenghao zhang, Tianyu Zong, Yuanxiang Wang, Jun Xie, Tao Yu, Haopeng Jin, Kaixin Xu, Feng Chen, Jiahuan Chen, Yujia Yang, Zhenyu Guan, Bingkang Shi, Jungang Xu

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RPO通过部分推理优化显著降低训练时间,提升大型语言模型的训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22593 2026-02-02 cs.LG 79%

Heterogeneous Graph Alignment for Joint Reasoning and Interpretability

异构图对齐用于联合推理与可解释性

Zahra Moslemi, Ziyi Liang, Norbert Fortin, Babak Shahbaba

机构 * Department of Statistics, University of California, Irvine(统计学系,加州大学伊维特分校) Department of Neurobiology and Behavior, University of California, Irvine(神经生物学与行为系,加州大学伊维特分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出MGMT框架,通过元图实现异构图的联合推理与可解释性,优于现有方法并在神经科学应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25801 2026-02-02 cs.LG cs.AI cs.CL cs.CV 67%

Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习

Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Metis-SPECS通过基于偏好的自我蒸馏冷启动框架解耦多模态学习,提升泛化能力和下游RL表现。

Comments Published as a conference paper at ICLR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18292 2026-02-02 cs.LG cs.AI 62%

TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment

TriPlay-RL:三角色自我对抗强化学习用于大语言模型安全对齐

Zhewen Tan, Wenhan Yu, Jianfeng Si, Tongxin Liu, Kaiqi Guan, Huiyan Jin, Jiawen Tao, Xiaokun Yuan, Duohe Ma, Xiangzheng Zhang, Tong Yang, Lin Sun

机构 * Peking University(北京大学) Qiyuan Tech(启元科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TriPlay-RL通过三角色自我对抗强化学习,实现LLM安全对齐的高效且可扩展范式,提升攻击有效性、安全性能和评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06776 2026-02-02 cs.CL cs.AI 62%

From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs

从单个token到单个block:一种为扩散语言模型设计的原理性适应路径

Yuchuan Tian, Yuchen Liang, Shuo Zhang, Yingte Shu, Guangwen Yang, Wei He, Sibo Fang, Tianyu Guo, Kai Han, Chao Xu, Hanting Chen, Xinghao Chen, Yunhe Wang

机构 * Peking University(北京大学) Huawei Technologies(华为技术)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种原理性适应路径,将自回归模型适配到扩散语言模型,以提升其长上下文生成能力,并在7B类模型中取得最佳性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21969 2026-02-02 cs.CL cs.AI 62%

Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding

Token-Guard: 通过自检解码实现token级幻觉控制

Yifan Zhu, Huiqiang Rong, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Token-Guard通过自检解码技术,实现对大型语言模型中token级幻觉的有效控制,提升生成准确性与输出可靠性。

Comments Accepted by ICLR 2026 main conference

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10350 2026-02-02 cs.LG cs.AI 62%

Geometric Dynamics of Agentic Loops in Large Language Models

大语言模型中代理循环的几何动力学

Nicolas Tacheny

机构 * University of Mons(蒙斯大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示大语言模型中代理循环的动力学特性,通过几何方法分类其收缩、振荡或探索行为,并展示提示设计对动力学模式的控制作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23180 2026-02-02 cs.LG 57%

TriSpec: Ternary Speculative Decoding via Lightweight Proxy Verification

TriSpec: 通过轻量级代理验证实现三元推测解码

Haoyun Jiang, Junqi He, Feng Hong, Xinlong Yang, Jianwei Zhang, Zheng Li, Zhengyang Zhuge, Zhiyong Chen, Bo Han, Junyang Lin, Jiangchao Yao

机构 * CMIC, Shanghai Jiao Tong University(上海交通大学计算机学院) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) Hong Kong Baptist University(香港 Baptist大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 TriSpec通过引入轻量级代理验证机制,有效降低推测解码的验证成本,实现高达35%的加速并减少50%的目标模型调用次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23066 2026-02-02 cs.SD cs.AI 57%

Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection

向音频大语言模型中引入显式听觉证据感知以实现语音深度伪造检测

Xiaoxuan Guo, Yuankun Xie, Haonan Cheng, Jiayi Zhou, Jian Liu, Hengyan Huang, Long Ye, Qin Zhang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) Communication University of China(中国传媒大学) Machine Intelligence(人工智能) Key Laboratory of Media Audio & Video, Ministry of Education, Communication University of China(教育部媒体音频视频重点实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SDD-APALLM框架,通过结合原始音频与结构化频谱图,增强音频LLM对细粒度声学特征的感知能力,提升语音深度伪造检测的准确性和鲁棒性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22801 2026-02-02 cs.LG 57%

Clipping-Free Policy Optimization for Large Language Models

无需裁剪的策略优化用于大语言模型

Ömer Veysel Çağatan, Barış Akgün, Gözde Gül Şahin, Xuandong Zhao

机构 * KUIS AI Center, Koç University, Istanbul, Türkiye(Koç大学) Koç University, Istanbul, Türkiye(Koç大学) University of California, Berkeley, CA, USA(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 CFPO通过凸二次惩罚替代裁剪机制,实现稳定策略优化,适用于大语言模型的训练。

Comments 23 pages, 10 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07775 2026-02-02 cs.CL 57%

The Unintended Trade-off of AI Alignment:Balancing Hallucination Mitigation and Safety in LLMs

AI对齐中的意外权衡:在LLMs中平衡幻觉缓解与安全

Omar Mahmoud, Ali Khalil, Buddhika Laknath Semage, Thommen George Karimpanal, Santu Rana

机构 * Applied Artificial Intelligence Initiative(应用人工智能倡议) Deakin University(德肯大学) School of Information Technology(信息科技学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种方法,通过解耦幻觉和拒绝特征,平衡LLMs中的真实性与安全性,减少因提高真实性而削弱安全对齐的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22474 2026-02-02 cs.LG 57%

Unrewarded Exploration in Large Language Models Reveals Latent Learning from Psychology

大语言模型中的无奖励探索揭示了心理学中的潜在学习

Jian Xiong, Jingbo Zhou, Zihan Zhou, Yixiong Xiao, Le Zhang, Jingyong Ye, Rui Qian, Yang Zhou, Dejing Dou

机构 * Fudan University, China(复旦大学) Auburn University, USA(阿伯茨罕大学) Baidu Research, China(百度研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 研究发现大语言模型在无奖励探索阶段表现出潜在学习动态,通过实验验证其在无奖励和有奖励训练下的性能差异,并提出理论解释。

Comments 17pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06746 2026-02-02 cs.CV cs.AI 57%

AlignGemini: Generalizable AI-Generated Image Detection Through Task-Model Alignment

AlignGemini: 通过任务-模型对齐实现通用的AI生成图像检测

Ruoxin Chen, Jiahui Gao, Kaiqing Lin, Keyue Zhang, Yandan Zhao, Isabel Guan, Taiping Yao, Shouhong Ding

机构 * Tencent Youtu Lab East China University of Science Shenzhen University Hong Kong University of Science Department of XXX, University of YYY, Location, Country School of ZZZ, Institute of WWW, Location, Country

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 AlignGemini通过任务-模型对齐原则,结合语义和像素伪影检测,提升AI生成图像检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18616 2026-02-02 cs.CL 57%

What Helps Language Models Predict Human Beliefs: Demographics or Prior Stances?

什么有助于语言模型预测人类信念:人口统计学特征还是先前立场?

Joseph Malone, Rachith Aiyappa, Byunghwee Lee, Haewoon Kwak, Jisun An, Yong-Yeol Ahn

机构 * Center for Complex Networks and Systems Research, Indiana University(复杂网络与系统研究中心,印第安纳大学) School of Data Science, University of Virginia(数据科学学院,弗吉尼亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了语言模型预测人类信念时,人口统计学特征与先前立场对预测效果的影响,发现两者结合效果最佳,但不同信念领域中其相对价值存在差异。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23211 2026-02-02 cs.MA 50%

Multi-Agent Systems Should be Treated as Principal-Agent Problems

多智能体系统应被视为委托-代理问题

Paulius Rauba, Simonas Cepenas, Mihaela van der Schaar

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出将多智能体系统视为委托-代理问题,探讨信息不对称和目标不一致对系统行为的影响,并通过谋略现象分析其缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09455 2026-02-02 cs.CV 50%

Beyond Pixels: Leveraging the Language of Soccer to Improve Spatio-Temporal Action Detection in Broadcast Videos

超越像素:利用足球的语言来提升广播视频中的时空动作检测

Jeremie Ochin, Raphael Chekroun, Bogdan Stanciulescu, Sotiris Manitsaris

机构 * Centre for Robotics, Mines Paris - PSL(机器人中心,巴黎 Mines - PSL 高等学院) Footovision(Footovision 公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出通过引入去噪序列转换任务,利用足球战术规律提升广播视频中时空动作检测的精度和召回率。

Comments 12 pages, submitted to Advanced Concepts for Intelligent Vision Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22621 2026-02-02 cs.CY 50%

Ethical Risks of Large Language Models in Medical Consultation: An Assessment Based on Reproductive Ethics

大语言模型在医疗咨询中的伦理风险:基于生殖伦理的评估

Hanhui Xu, Jiacheng Ji, Haoan Jin, Han Ying, Mengyue Wu

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究评估了大语言模型在生殖伦理咨询中的伦理风险,发现其在安全性和同理心方面存在严重缺陷,需加强推理和伦理依据能力。

详情

展开后加载摘要…

URL PDF HTML 收藏