arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-16 至 2025-12-16 共收录 94 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 27 篇

2512.12756 2025-12-16 cs.CV 78%

FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning

FysicsWorld: 一个统一的全模态基准用于任意到任意的理解、生成和推理

Yue Jiang, Dingkang Yang, Minghao Han, Jinghang Han, Zizhi Chen, Yizhou Liu, Mingcheng Li, Peng Zhai, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(菲茨智能技术有限公司)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 FysicsWorld是一个统一的全模态基准,支持图像、视频、音频和文本之间的双向交互,通过16个主要任务和3,268个样本全面评估理解、生成和推理能力,揭示模型在多模态任务中的性能差异。

Comments The omni-modal benchmark report from Fysics AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13159 2025-12-16 cs.AI cs.CL 76%

SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning

SpeakRL: 在语言模型中协同推理、说话与行动以增强强化学习

Emre Can Acikgoz, Jinoh Oh, Jie Hao, Joo Hyuk Jeon, Heng Ji, Dilek Hakkani-Tür, Gokhan Tur, Xiang Li, Chengyuan Ma, Xing Fan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Alexa(亚马逊Alexa)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 SpeakRL通过强化学习提升语言模型的对话能力,通过奖励主动互动提高任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12596 2025-12-16 cs.CV cs.AI 74%

Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models

基于视觉语言模型的双阶段链式思考内容感知广告布局生成

Kei Yoshitake, Kento Hosono, Ken Kobayashi, Kazuhide Nakata

机构 * Institute of Science Tokyo(东京科学研究所) HAKUHODO Technologies Inc.(HAKUHODO技术公司)

专题命中 推理评测 :chain-of-thought(title);分类 cs.AI

AI总结 本文提出基于视觉语言模型的双阶段链式思考方法,用于生成高质量的广告布局,通过分析背景图像内容来提升布局质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11656 2025-12-16 cs.MA cs.AI cs.CL 73%

MALLM: Multi-Agent Large Language Models Framework

MALLM:多智能体大语言模型框架

Jonas Becker, Lars Benedikt Kaesberg, Niklas Bauer, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州实验室)

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 MALLM是一个开源框架,通过提供多种配置选项,系统分析多智能体辩论的组件,促进对智能体角色、响应生成器、讨论范式和决策协议的深入理解。

Comments Accepted at EMNLP 2025 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12868 2025-12-16 cs.CL cs.AI cs.LG 67%

Counting Clues: A Lightweight Probabilistic Baseline Can Match an LLM

计数线索:一个轻量级概率基线可以匹配LLM

Furong Jia, Yuan Pu, Finn Guo, Monica Agrawal

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种轻量级概率排名器FBPR,通过共现统计信息实现与LLM相当的性能,展示了概率基线在临床诊断中的互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14507 2025-12-16 cs.LG cs.AI cs.CL 67%

From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion

从剪枝到嫁接:通过可学习层融合实现动态知识再分配

Zehua Pei, Hui-Ling Zhen, Xianzhi Yu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Noah’s Ark Lab, Huawei, Hong Kong SAR(华为诺亚实验室,香港)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FuseGPT通过动态知识再分配和可学习层融合,实现更高效的模型压缩与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13070 2025-12-16 cs.AI cs.CL 66%

M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization

M-GRPO:通过动量锚定策略优化稳定大语言模型的自监督强化学习

Bizhe Bai, Hongming Wu, Peng Ye, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan(复旦大学未来信息技术学院) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI

AI总结 M-GRPO通过动量锚定策略优化和IQR过滤方法,稳定大语言模型的自监督强化学习训练,提升训练稳定性和性能。

Comments 7 pages, 5 figures,Accepted NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13330 2025-12-16 cs.CL cs.AI 62%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12424 2025-12-16 cs.CV cs.LG 57%

ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics

ViInfographicVQA:单图和多图越南信息图视觉问答基准测试

Tue-Thu Van-Dinh, Hoang-Duy Tran, Truong-Binh Duong, Mai-Hanh Pham, Binh-Nam Le-Nguyen, Quoc-Thai Nguyen

机构 * Neu.edu.vn

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ViInfographicVQA是首个针对越南信息图VQA的基准测试,通过单图和多图任务评估模型在复杂信息图中的视觉问答能力。

Comments 10 pages, 4 figures, Accepted to AI4Research @ AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12405 2025-12-16 cs.LG 57%

Can Graphs Improve Tabular Foundation Models?

图能否提升表格基础模型?

Franck Le, Keith Grueneberg, Erich Nahum, Vadim Sheinin

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 BOLERO通过引入轻量图先验提升预训练表格Transformer的性能,在分类和回归任务中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08808 2025-12-16 cs.LG 57%

TinyGraphEstimator: Adapting Lightweight Language Models for Graph Structure Inference

TinyGraphEstimator: 为图结构推断适应轻量级语言模型

Michal Podstawski

机构 * NASK National Research Institute(波兰国家研究 institute)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出TinyGraphEstimator数据集,评估轻量级语言模型在图结构推断中的能力,通过LoRA技术实现参数调优,证明小型模型在图推理任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04457 2025-12-16 cs.CL 57%

Do MLLMs Really Understand the Charts?

多模态大语言模型真的能理解图表吗?

Xiao Zhang, Dongyuan Li, Liuyu Xiang, Yao Zhang, Cheng Zhong, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) AAITC, CTO Organization, Lenovo(AAITC、CTO组织、联想) Lenovo(联想)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出 ChartVR-3B/7B 模型,通过 VR-RFT 策略提升图表视觉推理能力,并在 ChartVRBench 上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12461 2025-12-16 cs.CL 57%

Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models

GPT-OSS好吗?对OpenAI最新开源模型的综合评估

Ziqian Bi, Keyu Chen, Chiung-Yi Tseng, Danyang Zhang, Tianyang Wang, Hongying Luo, Lu Chen, Junming Huang, Jibin Guan, Junfeng Hao, Xinyuan Song, Junhao Song

机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院) University of Minnesota(明尼苏达大学) Emory University(埃默里大学) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17234 2025-12-16 cs.CL 57%

CLARIFID: Improving Radiology Report Generation by Reinforcing Clinically Accurate Impressions and Enforcing Detailed Findings

CLARIFID:通过强化临床准确印象和强制详细发现来改进放射报告生成

Kyeongkyu Lee, Seonghwan Yoon, Hongki Lim

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CLARIFID通过强化临床准确印象和强制详细发现,提升放射报告生成的临床效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13405 2025-12-16 cs.CL 57%

RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysis

RealHiTBench: 一个全面的现实感分层表格基准,用于评估基于LLM的表格分析

Pengzuo Wu, Yuhang Yang, Guangcheng Zhu, Chao Ye, Hong Gu, Xu Lu, Ruixuan Xiao, Bowen Bao, Yijing He, Liangyu Zha, Wentao Ye, Junbo Zhao, Haobo Wang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Institute of Computing Innovation, Zhejiang University(浙江大学计算机创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RealHiTBench是一个用于评估基于LLM的表格分析能力的综合现实感分层表格基准,通过多种输入格式和复杂结构的表格测试,验证了改进LLMs对表格层次结构感知的重要性。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12117 2025-12-16 cs.SE cs.LG 57%

Citation-Grounded Code Comprehension: Preventing LLM Hallucination Through Hybrid Retrieval and Graph-Augmented Context

基于引用的代码理解:通过混合检索和图增强上下文防止LLM幻觉

Jahidul Arafat

机构 * Department of Computer Science and Software Engineering, Auburn University, Alabama, USA(计算机科学与软件工程系,阿伯丁大学,阿拉巴马州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出混合检索与图增强上下文方法,通过系统评估实现92%引用准确率,有效防止LLM幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12059 2025-12-16 cs.AI 57%

The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification

预测批评者:利用大语言模型进行差预测识别

Luke Bhan, Hanyu Zhang, Andrew Gordon Wilson, Michael W. Mahoney, Chuck Arvin

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 利用大语言模型进行预测监控,通过识别不合理预测提升预测质量。

Comments Presented at AAAI 2026 AI4TS workshop and AABA4ET workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11997 2025-12-16 cs.AI 57%

Log Anomaly Detection with Large Language Models via Knowledge-Enriched Fusion

通过知识增强融合进行大规模语言模型的日志异常检测

Anfeng Peng, Ajesh Koyatan Chathoth, Stephen Lee

机构 * University of Pittsburgh(匹兹堡大学) Eaton Corporation(埃顿公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EnrichLog通过知识增强融合技术,提升日志异常检测的准确性和可解释性,适用于实际系统部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11871 2025-12-16 cs.CV cs.AI 57%

Automated Plant Disease and Pest Detection System Using Hybrid Lightweight CNN-MobileViT Models for Diagnosis of Indigenous Crops

基于混合轻量CNN-MobileViT模型的自动化植物病害和害虫检测系统用于本地作物诊断

Tekleab G. Gebremedhin, Hailom S. Asegede, Bruh W. Tesheme, Tadesse B. Gebremichael, Kalayu G. Redae

机构 * Department of Computer Science \& Engineering Department of Information Technology Mekelle University - Mekelle Institute of Technology, Ethiopia Email

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于混合轻量CNN-MobileViT模型的自动化植物病害检测系统,通过本地作物数据集验证了模型在边缘环境中的高效诊断能力。

Comments A preliminary version of this work was presented at the International Conference on Postwar Technology for Recovery and Sustainable Development (Feb. 2025). This manuscript substantially extends that work with expanded experiments and on-device deployment analysis. Code and dataset are publicly available at: https://github.com/Tekleab15/Automated_plant_disease_and_pest_detection_system

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12592 2025-12-16 cs.CY 50%

Beyond Static Scoring: Enhancing Assessment Validity via AI-Generated Interactive Verification

超越静态评分:通过AI生成的交互验证提升评估效度

Tom Lee, Sihoon Lee, Seonghun Kim

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出人机协作框架,通过AI生成的交互验证提升评估效度,解决传统静态评分无法捕捉过程证据的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12224 2025-12-16 cs.SE cs.CR 50%

Cluster-guided LLM-Based Anonymization of Software Analytics Data: Studying Privacy-Utility Trade-offs in JIT Defect Prediction

基于聚类的LLM软件分析数据匿名化:研究JIT缺陷预测中的隐私-效用权衡

Maaz Khan, Gul Sher Khan, Ahsan Raza, Pir Sami Ullah, Abdul Ali Bangash

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于LLM的聚类引导去标识化方法,用于JIT缺陷预测中的隐私-效用权衡研究,通过上下文感知参数配置提升隐私保护水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12107 2025-12-16 cs.CV 50%

EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography

EchoVLM:基于测量的多模态学习用于超声心动图

Yuheng Li, Yue Zhang, Abdoul Aziz Amadou, Yuxiang Lai, Jike Zhong, Tiziano Passerini, Dorin Comaniciu, Puneet Sharma

机构 * Georgia Institute of Technology(佐治亚理工学院) Siemens Healthineers(西门子医疗) Siemens Healthcare Limited(西门子医疗有限公司) Emory University(埃默里大学) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EchoVLM通过引入基于测量的多模态学习方法,实现了超声心动图的端到端解读,提升了疾病分类和视图识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11805 2025-12-16 cs.CY 50%

AI Integration In ERP Evaluation Across Trends and Architectures

人工智能在ERP评估中的整合:跨趋势与架构

Monu Sharma

专题命中 推理评测 :planning(abstract)

AI总结 本文提出了一种理论模型,将AI赋能的ERP性能评估指标与预测智能和自适应自动化相结合,以改进AI整合ERP的评估方法。

Comments 9 pages, 2 Figures. Journal of Information Systems Engineering and Management,2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2504.14642 2025-12-16 cs.CV 85%

Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension

Relation-R1: 逐步认知链式思维引导的强化学习用于统一关系理解

Lin Li, Wei Chen, Jiahui Li, Kwang-Ting Cheng, Long Chen

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 Relation-R1通过整合认知链式思维引导的强化学习,实现了对二元和N元关系的统一理解,提升了视觉-语义定位能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14829 2025-12-16 cs.CL 83%

Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps

通过反向学习推理步骤来衡量推理链的忠实性

Martin Tutek, Fateme Hashemi Chaleshtori, Ana Marasović, Yonatan Belinkov

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院) University of Utah(犹他大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 通过反向学习推理步骤来评估推理链的参数忠实性,揭示模型推理与预测之间的关系。

Comments Outstanding paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11909 2025-12-16 cs.AI 83%

Causal Strengths and Leaky Beliefs: Interpreting LLM Reasoning via Noisy-OR Causal Bayes Nets

因果强度与渗漏信念:通过噪声-或因果贝叶斯网络解读LLM推理

Hanna Dettki

机构 * New York University(纽约大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过噪声-或因果贝叶斯网络评估LLM和人类在因果推理任务中的表现,探讨其因果强度和信念差异。

Journal ref WiML Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12690 2025-12-16 cs.LG cs.CL cs.CV 81%

Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning

重新评估监督微调的作用:VLM推理中的实证研究

Yongcan Yu, Lingxiao He, Shuo Lu, Lijun Sheng, Yinuo Xu, Yanbo Wang, Kuangpu Guo, Jianjie Cheng, Meng Wang, Qianlong Xie, Xingxing Wang, Dapeng Hu, Jian Liang

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究院 & 模式识别与人工智能研究所,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Meituan(美团)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过实证分析发现,监督微调在VLM推理中具有重要作用,挑战了强化学习优于监督微调的主流观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06029 2025-12-16 cs.LG 79%

Lethe: Layer- and Time-Adaptive KV Cache Pruning for Reasoning-Intensive LLM Serving

Lethe:面向推理密集型大语言模型服务的层和时间自适应KV缓存剪枝

Hui Zeng, Daming Zhao, Pengfei Yang, WenXuan Hou, Tianyang Zheng, Hui Li, Weiye Ji, Jidong Zhai

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 Lethe通过引入时空自适应的KV缓存管理框架,在推理密集型大语言模型服务中实现高效的缓存剪枝,提升吞吐量的同时保持生成质量。

Comments aaai26 camera-ready version, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12701 2025-12-16 cs.CV cs.CL cs.LG 76%

Efficient Vision-Language Reasoning via Adaptive Token Pruning

通过自适应令牌修剪实现高效的视觉语言推理

Xue Li, Xiaonan Song, Henry Hu

机构 * Scholar42(学者42) InfiniPouch LLC(InfiniPouch公司) Labelbox, Inc.(Labelbox公司)

专题命中 其他推理 :reasoning(title);分类 cs.CL、cs.LG

AI总结 本研究提出自适应令牌修剪方法,通过动态保留关键令牌提升视觉语言模型的推理效率和稳定性,减少计算量并保持精度。

Comments 10 pages, 3 figures. Expanded version of an extended abstract accepted at NeurIPS 2025 Workshop on VLM4RWD. Presents methodology and preliminary experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18577 2025-12-16 q-fin.CP cs.AI cs.LG 62%

Advancing Financial Engineering with Foundation Models: Progress, Applications, and Challenges

用基础模型推进金融工程:进展、应用与挑战

Liyuan Chen, Shuoling Liu, Jiangpeng Yan, Xiaoyu Wang, Henglin Liu, Chuang Li, Kecheng Jiao, Jixuan Ying, Yang Veronica Liu, Qiang Yang, Xiu Li

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了金融基础模型(FFMs)的进展、应用与挑战,涵盖三种关键模态,并探讨了数据可用性、算法可扩展性和基础设施限制等关键问题。

Comments Accepted by [J]. Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏