arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-16 至 2025-12-16 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 27 篇

2508.01700 2025-12-16 cs.AI 85%

DeepVIS: Bridging Natural Language and Data Visualization Through Step-wise Reasoning

DeepVIS: 通过分步推理连接自然语言与数据可视化

Zhihao Shuai, Boyan Li, Siyu Yan, Yuyu Luo, Weikai Yang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 DeepVIS通过整合分步推理提升自然语言到可视化的质量,提供透明的推理过程以增强用户理解与调整能力。

Comments IEEE VIS 2025 full paper

Journal ref IEEE Transactions on Visualization and Computer Graphics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21320 2025-12-16 cs.CL 83%

SciReasoner: Laying the Scientific Reasoning Ground Across Disciplines

SciReasoner: 跨学科的科学推理基础

Yizhou Wang, Chen Tang, Han Deng, Jiabei Xiao, Jiaqi Liu, Jianyu Wu, Jun Yao, Pengze Li, Encheng Su, Lintao Wang, Guohang Zhuang, Yuchen Ren, Ben Fei, Ming Hu, Xin Chen, Dongzhan Zhou, Junjun He, Xiangyu Yue, Zhenfei Yin, Jiamin Wu, Qihao Zheng, Yuhao Zhou, Huihui Xu, Chenglong Ma, Yan Lu, Wenlong Zhang, Chunfeng Song, Philip Torr, Shixiang Tang, Xinzhu Ma, Wanli Ouyang, Lei Bai

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 SciReasoner通过跨学科学习提升科学推理能力,支持多种任务,增强跨领域泛化和准确性。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11830 2025-12-16 cs.LG cs.AI 81%

CR3G: Causal Reasoning for Patient-Centric Explanations in Radiology Report Generation

CR3G:用于放射学报告生成的患者导向因果推理

Satyam Kumar

机构 * IIT Bombay(博伊斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CR3G通过因果推理提升放射学报告生成的解释能力,增强AI诊断的可信度和实用性。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10576 2025-12-16 cs.CV 78%

HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs

HumanSense: 从多模态感知到通过推理的 empathetic 上下文感知响应

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Yi Yuan, Jingdong Chen, Le Wang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 HumanSense通过多阶段模态渐进强化学习提升MLLMs在多模态感知和交互任务中的性能,强调推理能力对共情反馈的重要性。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12756 2025-12-16 cs.CV 78%

FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning

FysicsWorld: 一个统一的全模态基准用于任意到任意的理解、生成和推理

Yue Jiang, Dingkang Yang, Minghao Han, Jinghang Han, Zizhi Chen, Yizhou Liu, Mingcheng Li, Peng Zhai, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(菲茨智能技术有限公司)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 FysicsWorld是一个统一的全模态基准,支持图像、视频、音频和文本之间的双向交互,通过16个主要任务和3,268个样本全面评估理解、生成和推理能力,揭示模型在多模态任务中的性能差异。

Comments The omni-modal benchmark report from Fysics AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13159 2025-12-16 cs.AI cs.CL 76%

SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning

SpeakRL: 在语言模型中协同推理、说话与行动以增强强化学习

Emre Can Acikgoz, Jinoh Oh, Jie Hao, Joo Hyuk Jeon, Heng Ji, Dilek Hakkani-Tür, Gokhan Tur, Xiang Li, Chengyuan Ma, Xing Fan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Alexa(亚马逊Alexa)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 SpeakRL通过强化学习提升语言模型的对话能力,通过奖励主动互动提高任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12596 2025-12-16 cs.CV cs.AI 74%

Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models

基于视觉语言模型的双阶段链式思考内容感知广告布局生成

Kei Yoshitake, Kento Hosono, Ken Kobayashi, Kazuhide Nakata

机构 * Institute of Science Tokyo(东京科学研究所) HAKUHODO Technologies Inc.(HAKUHODO技术公司)

专题命中 推理评测 :chain-of-thought(title);分类 cs.AI

AI总结 本文提出基于视觉语言模型的双阶段链式思考方法,用于生成高质量的广告布局,通过分析背景图像内容来提升布局质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11656 2025-12-16 cs.MA cs.AI cs.CL 73%

MALLM: Multi-Agent Large Language Models Framework

MALLM:多智能体大语言模型框架

Jonas Becker, Lars Benedikt Kaesberg, Niklas Bauer, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州实验室)

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 MALLM是一个开源框架,通过提供多种配置选项,系统分析多智能体辩论的组件,促进对智能体角色、响应生成器、讨论范式和决策协议的深入理解。

Comments Accepted at EMNLP 2025 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12868 2025-12-16 cs.CL cs.AI cs.LG 67%

Counting Clues: A Lightweight Probabilistic Baseline Can Match an LLM

计数线索:一个轻量级概率基线可以匹配LLM

Furong Jia, Yuan Pu, Finn Guo, Monica Agrawal

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种轻量级概率排名器FBPR,通过共现统计信息实现与LLM相当的性能,展示了概率基线在临床诊断中的互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14507 2025-12-16 cs.LG cs.AI cs.CL 67%

From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion

从剪枝到嫁接:通过可学习层融合实现动态知识再分配

Zehua Pei, Hui-Ling Zhen, Xianzhi Yu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Noah’s Ark Lab, Huawei, Hong Kong SAR(华为诺亚实验室,香港)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FuseGPT通过动态知识再分配和可学习层融合,实现更高效的模型压缩与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13070 2025-12-16 cs.AI cs.CL 66%

M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization

M-GRPO:通过动量锚定策略优化稳定大语言模型的自监督强化学习

Bizhe Bai, Hongming Wu, Peng Ye, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan(复旦大学未来信息技术学院) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI

AI总结 M-GRPO通过动量锚定策略优化和IQR过滤方法,稳定大语言模型的自监督强化学习训练,提升训练稳定性和性能。

Comments 7 pages, 5 figures,Accepted NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13330 2025-12-16 cs.CL cs.AI 62%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12424 2025-12-16 cs.CV cs.LG 57%

ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics

ViInfographicVQA:单图和多图越南信息图视觉问答基准测试

Tue-Thu Van-Dinh, Hoang-Duy Tran, Truong-Binh Duong, Mai-Hanh Pham, Binh-Nam Le-Nguyen, Quoc-Thai Nguyen

机构 * Neu.edu.vn

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ViInfographicVQA是首个针对越南信息图VQA的基准测试,通过单图和多图任务评估模型在复杂信息图中的视觉问答能力。

Comments 10 pages, 4 figures, Accepted to AI4Research @ AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12405 2025-12-16 cs.LG 57%

Can Graphs Improve Tabular Foundation Models?

图能否提升表格基础模型?

Franck Le, Keith Grueneberg, Erich Nahum, Vadim Sheinin

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 BOLERO通过引入轻量图先验提升预训练表格Transformer的性能,在分类和回归任务中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08808 2025-12-16 cs.LG 57%

TinyGraphEstimator: Adapting Lightweight Language Models for Graph Structure Inference

TinyGraphEstimator: 为图结构推断适应轻量级语言模型

Michal Podstawski

机构 * NASK National Research Institute(波兰国家研究 institute)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出TinyGraphEstimator数据集,评估轻量级语言模型在图结构推断中的能力,通过LoRA技术实现参数调优,证明小型模型在图推理任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04457 2025-12-16 cs.CL 57%

Do MLLMs Really Understand the Charts?

多模态大语言模型真的能理解图表吗?

Xiao Zhang, Dongyuan Li, Liuyu Xiang, Yao Zhang, Cheng Zhong, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) AAITC, CTO Organization, Lenovo(AAITC、CTO组织、联想) Lenovo(联想)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出 ChartVR-3B/7B 模型,通过 VR-RFT 策略提升图表视觉推理能力,并在 ChartVRBench 上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12461 2025-12-16 cs.CL 57%

Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models

GPT-OSS好吗?对OpenAI最新开源模型的综合评估

Ziqian Bi, Keyu Chen, Chiung-Yi Tseng, Danyang Zhang, Tianyang Wang, Hongying Luo, Lu Chen, Junming Huang, Jibin Guan, Junfeng Hao, Xinyuan Song, Junhao Song

机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院) University of Minnesota(明尼苏达大学) Emory University(埃默里大学) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17234 2025-12-16 cs.CL 57%

CLARIFID: Improving Radiology Report Generation by Reinforcing Clinically Accurate Impressions and Enforcing Detailed Findings

CLARIFID:通过强化临床准确印象和强制详细发现来改进放射报告生成

Kyeongkyu Lee, Seonghwan Yoon, Hongki Lim

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CLARIFID通过强化临床准确印象和强制详细发现,提升放射报告生成的临床效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13405 2025-12-16 cs.CL 57%

RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysis

RealHiTBench: 一个全面的现实感分层表格基准,用于评估基于LLM的表格分析

Pengzuo Wu, Yuhang Yang, Guangcheng Zhu, Chao Ye, Hong Gu, Xu Lu, Ruixuan Xiao, Bowen Bao, Yijing He, Liangyu Zha, Wentao Ye, Junbo Zhao, Haobo Wang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Institute of Computing Innovation, Zhejiang University(浙江大学计算机创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RealHiTBench是一个用于评估基于LLM的表格分析能力的综合现实感分层表格基准,通过多种输入格式和复杂结构的表格测试,验证了改进LLMs对表格层次结构感知的重要性。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12117 2025-12-16 cs.SE cs.LG 57%

Citation-Grounded Code Comprehension: Preventing LLM Hallucination Through Hybrid Retrieval and Graph-Augmented Context

基于引用的代码理解:通过混合检索和图增强上下文防止LLM幻觉

Jahidul Arafat

机构 * Department of Computer Science and Software Engineering, Auburn University, Alabama, USA(计算机科学与软件工程系,阿伯丁大学,阿拉巴马州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出混合检索与图增强上下文方法,通过系统评估实现92%引用准确率,有效防止LLM幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12059 2025-12-16 cs.AI 57%

The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification

预测批评者:利用大语言模型进行差预测识别

Luke Bhan, Hanyu Zhang, Andrew Gordon Wilson, Michael W. Mahoney, Chuck Arvin

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 利用大语言模型进行预测监控,通过识别不合理预测提升预测质量。

Comments Presented at AAAI 2026 AI4TS workshop and AABA4ET workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11997 2025-12-16 cs.AI 57%

Log Anomaly Detection with Large Language Models via Knowledge-Enriched Fusion

通过知识增强融合进行大规模语言模型的日志异常检测

Anfeng Peng, Ajesh Koyatan Chathoth, Stephen Lee

机构 * University of Pittsburgh(匹兹堡大学) Eaton Corporation(埃顿公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EnrichLog通过知识增强融合技术,提升日志异常检测的准确性和可解释性,适用于实际系统部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11871 2025-12-16 cs.CV cs.AI 57%

Automated Plant Disease and Pest Detection System Using Hybrid Lightweight CNN-MobileViT Models for Diagnosis of Indigenous Crops

基于混合轻量CNN-MobileViT模型的自动化植物病害和害虫检测系统用于本地作物诊断

Tekleab G. Gebremedhin, Hailom S. Asegede, Bruh W. Tesheme, Tadesse B. Gebremichael, Kalayu G. Redae

机构 * Department of Computer Science \& Engineering Department of Information Technology Mekelle University - Mekelle Institute of Technology, Ethiopia Email

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于混合轻量CNN-MobileViT模型的自动化植物病害检测系统,通过本地作物数据集验证了模型在边缘环境中的高效诊断能力。

Comments A preliminary version of this work was presented at the International Conference on Postwar Technology for Recovery and Sustainable Development (Feb. 2025). This manuscript substantially extends that work with expanded experiments and on-device deployment analysis. Code and dataset are publicly available at: https://github.com/Tekleab15/Automated_plant_disease_and_pest_detection_system

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12592 2025-12-16 cs.CY 50%

Beyond Static Scoring: Enhancing Assessment Validity via AI-Generated Interactive Verification

超越静态评分:通过AI生成的交互验证提升评估效度

Tom Lee, Sihoon Lee, Seonghun Kim

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出人机协作框架,通过AI生成的交互验证提升评估效度,解决传统静态评分无法捕捉过程证据的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12224 2025-12-16 cs.SE cs.CR 50%

Cluster-guided LLM-Based Anonymization of Software Analytics Data: Studying Privacy-Utility Trade-offs in JIT Defect Prediction

基于聚类的LLM软件分析数据匿名化:研究JIT缺陷预测中的隐私-效用权衡

Maaz Khan, Gul Sher Khan, Ahsan Raza, Pir Sami Ullah, Abdul Ali Bangash

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于LLM的聚类引导去标识化方法,用于JIT缺陷预测中的隐私-效用权衡研究,通过上下文感知参数配置提升隐私保护水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12107 2025-12-16 cs.CV 50%

EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography

EchoVLM:基于测量的多模态学习用于超声心动图

Yuheng Li, Yue Zhang, Abdoul Aziz Amadou, Yuxiang Lai, Jike Zhong, Tiziano Passerini, Dorin Comaniciu, Puneet Sharma

机构 * Georgia Institute of Technology(佐治亚理工学院) Siemens Healthineers(西门子医疗) Siemens Healthcare Limited(西门子医疗有限公司) Emory University(埃默里大学) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EchoVLM通过引入基于测量的多模态学习方法,实现了超声心动图的端到端解读,提升了疾病分类和视图识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11805 2025-12-16 cs.CY 50%

AI Integration In ERP Evaluation Across Trends and Architectures

人工智能在ERP评估中的整合:跨趋势与架构

Monu Sharma

专题命中 推理评测 :planning(abstract)

AI总结 本文提出了一种理论模型,将AI赋能的ERP性能评估指标与预测智能和自适应自动化相结合,以改进AI整合ERP的评估方法。

Comments 9 pages, 2 Figures. Journal of Information Systems Engineering and Management,2025

详情

展开后加载摘要…

URL PDF HTML 收藏