arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-03 至 2025-12-03 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 25 篇

2502.13127 2025-12-03 cs.CL 89%

Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning

通过监督的链式思维推理促进长上下文理解

Jingyang Lin, Andy Wong, Tian Xia, Shenghua He, Hui Wei, Mei Han, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) PAII Inc.(PAII公司) University of California, Merced(加州梅尔德大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出基于属性的代理推理框架PAI,通过生成包含中间推理步骤的合成数据集LongFinanceQA,提升LLMs在金融领域的长上下文理解能力。

Comments Main Conference of EMNLP 2025, Project Page: https://long-pai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02914 2025-12-03 cs.AI cs.CL cs.LG 82%

Martingale Score: An Unsupervised Metric for Bayesian Rationality in LLM Reasoning

马尔可夫得分:一种用于大语言模型推理中贝叶斯理性性的无监督度量标准

Zhonghao He, Tianyi Qiu, Hirokazu Shirado, Maarten Sap

机构 * University of Cambridge(剑桥大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出马尔可夫得分,用于评估大语言模型推理中的贝叶斯理性性,通过检测信念更新的违反情况来衡量求真能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02306 2025-12-03 cs.AI cs.CL cs.CR cs.CV cs.LG 82%

OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning

OmniGuard:统一的多模态防护机制与刻意推理

Boyu Zhu, Xiaofei Wen, Wenjie Jacky Mo, Tinghui Zhu, Yanan Xie, Peng Qi, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02942 2025-12-03 cs.CV cs.AI 79%

Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench

基于视频科学基准的视频生成科学理解与推理评估

Lanxiang Hu, Abhilash Shankarampeta, Yixin Huang, Zilin Dai, Haoyang Yu, Yujie Zhao, Haoqiang Kang, Daniel Zhao, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02699 2025-12-03 cs.AI 79%

Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding

学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解

Hyeongseop Rha, Jeong Hun Yeo, Junil Won, Se Jin Park, Yong Man Ro

机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02790 2025-12-03 cs.CV 78%

UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits

UnicEdit-10M: 一个通过统一验证打破规模-质量壁垒的数据集和基准

Keming Ye, Zhipeng Huang, Canmiao Fu, Qingyang Liu, Jiani Cai, Zheqi Lv, Chen Li, Jing Lyu, Zhou Zhao, Shengyu Zhang

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 UnicEdit-10M通过统一验证方法构建大规模高质量数据集和基准,解决图像编辑中规模与质量的矛盾,评估模型在空间和知识推理中的表现。

Comments 31 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02841 2025-12-03 cs.CL cs.AI cs.HC cs.LG 75%

Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages

跨语言提示引导性:迈向跨语言的准确且稳健的大语言模型行为

Lechen Zhang, Yusheng Zhou, Tolga Ergen, Lajanugen Logeswaran, Moontae Lee, David Jurgens

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) LG AI Research(LG人工智能研究)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种统一的四维评估框架,通过大规模实验揭示了提示组件对跨语言行为的影响,并开发了提示优化框架以提升多语言LLM的准确性和稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06540 2025-12-03 cs.LG cs.AI stat.ML 73%

Sloth: scaling laws for LLM skills to predict multi-benchmark performance across families

Sloth: LLM技能的缩放定律用于跨家族预测多基准性能

Felipe Maia Polo, Seamus Somerstep, Leshem Choshen, Yuekai Sun, Mikhail Yurochkin

机构 * Department of Statistics, University of Michigan(密歇根大学统计学系) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI实验室,IBM研究) Computer Science and Artificial Intelligence Laboratory, MIT(MIT计算机科学与人工智能实验室) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 Sloth提出一种基于低维潜在技能的LLM缩放定律,通过跨基准相关性提升预测准确性,减少多家族训练需求。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02719 2025-12-03 cs.CL cs.AI cs.CV cs.LG q-bio.NC 67%

Emergent Bayesian Behaviour and Optimal Cue Combination in LLMs

涌现的贝叶斯行为与LLMs中的最优线索整合

Julian Ma, Jun Wang, Zafeirios Fountas

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示LLMs在多模态整合中表现出贝叶斯策略,但准确性不等于鲁棒性,提出贝叶斯一致性分数以评估不确定性处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02624 2025-12-03 cs.CV 67%

PPTBench: Towards Holistic Evaluation of Large Language Models for PowerPoint Layout and Design Understanding

PPTBench: 向大语言模型在PowerPoint布局和设计理解的全面评估迈进

Zheng Huang, Xukai Liu, Tianyu Hu, Kai Zhang, Ye Liu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 PPTBench通过全面评估大语言模型在PowerPoint布局和设计理解上的能力,揭示了当前模型在视觉布局推理和生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03026 2025-12-03 cs.CL cs.AI 62%

The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models

道德一致性流水线:面向大语言模型的持续道德评估

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Negar Shahabi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔大学SWAT实验室) Concordia Institute for Information Systems Engineering, Concordia University(Concordia大学信息系统工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MoCoP通过闭环框架持续评估大语言模型的道德一致性,揭示伦理与毒性间的强负相关,推动自主AI系统中计算道德研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02810 2025-12-03 cs.RO cs.AI cs.LG 62%

Phase-Adaptive LLM Framework with Multi-Stage Validation for Construction Robot Task Allocation: A Systematic Benchmark Against Traditional Optimization Algorithms

具有多阶段验证的相适应LLM框架用于施工机器人任务分配:与传统优化算法的系统基准测试

Shyam prasad reddy Kaitha, Hongrui Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LTAA框架,结合LLM推理与结构化验证,实现施工机器人任务分配的高效协调,展示LLM在任务分配中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02689 2025-12-03 cs.CL cs.AI 62%

An Empirical Survey of Model Merging Algorithms for Social Bias Mitigation

对缓解社会偏见的模型合并算法的实证调查

Daiki Shirafuji, Tatsuhiko Saito, Yasutomo Kimura

机构 * Mitsubishi Electric Corporation(三菱电机公司) Otaru University of Commerce(大岛商业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文实证分析了七种模型合并算法在缓解社会偏见中的效果,发现SLERP在平衡偏见减少与性能方面表现最佳。

Comments Accepted in PACLIC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18659 2025-12-03 stat.ML cs.AI cs.LG stat.ME 62%

Adaptive Prediction-Powered AutoEval with Reliability and Efficiency Guarantees

具有可靠性和效率保证的自适应预测-驱动AutoEval

Sangwoo Park, Matteo Zecchin, Osvaldo Simeone

机构 * Department of Engineering(工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出R-AutoEval+框架,通过自适应构造模型评估变量,实现模型评估的可靠性保障和样本效率提升。

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07646 2025-12-03 cs.CL cs.AI 62%

On the Temporal Question-Answering Capabilities of Large Language Models Over Anonymized Data

大型语言模型在匿名数据上的时间问答能力研究

Alfredo Garrachón Ruiz, Tomás de la Rosa, Daniel Borrajo

机构 * AI Research, JP Morgan Chase(人工智能研究, 花旗集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型在匿名数据上的时间推理能力,开发了RATA数据集并比较了多种方法,发现需要集成方法而非单一LLM。

Comments 18 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02405 2025-12-03 cs.CV cs.AI cs.LG 62%

WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate

WISE: 加权迭代专家社会用于鲁棒多模态多智能体辩论

Anoop Cherian, River Doyle, Eyal Ben-Dov, Suhas Lohit, Kuan-Chuan Peng

机构 * Mitsubishi Electric Research Labs(三菱电机研究实验室) Cambridge Rindge and Latin School(剑桥林恩和拉丁学校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WISE框架,通过多模态多智能体辩论提升视觉语言推理任务的准确性,实验显示在多个数据集上提升了2-7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02363 2025-12-03 cs.CL cs.AI 62%

Memory-Augmented Knowledge Fusion with Safety-Aware Decoding for Domain-Adaptive Question Answering

具有安全意识解码的记忆增强知识融合用于领域自适应问答

Lei Fu, Xiang Chen, Kaige Gao Xinyue Huang, Kejian Tong

机构 * Independent Researcher(独立研究者) Boston University(波士顿大学) Binghamton University(伯克利大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过记忆增强和安全意识解码提升领域自适应问答的准确性和安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02299 2025-12-03 cs.CL cs.AI 62%

HealthContradict: Evaluating Biomedical Knowledge Conflicts in Language Models

HealthContradict: 评估语言模型在生物医学知识中的矛盾

Boya Zhang, Alban Bornet, Rui Yang, Nan Liu, Douglas Teodoro

机构 * Faculty of Medicine, University of Geneva(日内瓦大学医学院) Department of Biomedical Informatics, Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学 Yong Loo Lin 医学院生物医学信息学系) Department of Biostatistics & Bioinformatics, Duke University Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所生物统计学与生物信息学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HealthContradict数据集评估语言模型在处理生物医学知识矛盾时的推理能力,揭示模型在正确上下文利用与错误上下文抵抗方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01282 2025-12-03 cs.CL cs.AI 62%

Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement Learning

Kardia-R1: 通过Rubric-as-Judge强化学习释放大语言模型以通过评分标准进行推理,以实现情感支持的理解与共情

Jiahao Yuan, Zhiqing Cui, Hanqing Wang, Yuansheng Gao, Yucheng Zhou, Usman Naseem

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Kardia-R1通过Rubric-as-Judge强化学习框架,提升大语言模型在情感支持中的理解与共情能力,通过评分标准引导训练以实现更准确的情感推理和个性化响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02625 2025-12-03 cs.CR cs.AI 57%

CryptoQA: A Large-scale Question-answering Dataset for AI-assisted Cryptography

CryptoQA: 一个大规模问答数据集,用于人工智能辅助密码学

Mayar Elfares, Pascal Reisert, Tilman Dietz, Manpa Barman, Ahmed Zaki, Ralf Küsters, Andreas Bulling

机构 * University of Stuttgart(斯图加特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CryptoQA是一个大规模问答数据集,旨在评估和训练LLMs在密码学任务中的能力,揭示LLMs在形式推理和数学知识上的不足,推动密码学研究的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26012 2025-12-03 cs.AI 57%

AutoSurvey2: Empowering Researchers with Next Level Automated Literature Surveys

AutoSurvey2:赋能研究人员的下一代自动化文献综述

Siyi Wu, Chiaxin Liang, Ziqian Bi, Leyi Zhao, Tianyang Wang, Junhao Song, Yichao Zhang, Keyu Chen, Benji Peng, Xinyuan Song

机构 * University of Texas at Arlington(德克萨斯理工大学) AI Agent Lab(人工智能代理实验室) Indiana University(印第安纳大学) Ohio State University(俄亥俄州立大学) Imperial College London(伦敦帝国理工学院) Georgia Institute of Technology(佐治亚理工学院) Appcubic(Appcubic公司) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AutoSurvey2通过多阶段流程实现自动化文献综述生成,结合检索增强合成与结构化评估,提升综述的连贯性与相关性,为学术写作提供可扩展解决方案。

Comments TKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11275 2025-12-03 cs.MM cs.AI cs.CY 57%

TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs

TCC-Bench:评估多模态大语言模型对传统中国文化理解能力的基准测试

Pengju Xu, Yan Wang, Shuyuan Zhang, Xuan Zhou, Xin Li, Yue Yuan, Fengzhao Li, Shunyuan Zhou, Xingyu Wang, Yi Zhang, Haiying Zhao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TCC-Bench通过双语视觉问答基准评估多模态大语言模型对传统中国文化理解能力,揭示其在文化相关视觉内容推理上的挑战。

Comments There are issues with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02230 2025-12-03 cs.AI 57%

Benchmarking LLM Agents for Wealth-Management Workflows

对财富管理流程的LLM代理进行基准测试

Rory Milsom

机构 * Rory Milsom(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过构建12个任务对的基准,评估通用LLM代理在财富管理任务中的准确性和经济性,发现其性能受自主性水平和工作流程可靠性影响显著。

Comments 56 pages, 8 figures, The University of Edinburgh

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22154 2025-12-03 cs.AI 57%

WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios

WearVQA: 一个用于评估智能眼镜等可穿戴设备上多模型AI助手视觉问答能力的基准测试

Eun Chang, Zhuangqun Huang, Yiwei Liao, Sagar Ravi Bhavsar, Amogh Param, Tammy Stark, Adel Ahmadyan, Xiao Yang, Jiaqi Wang, Ahsan Abdullah, Giang Nguyen, Akil Iyer, David Hall, Elissa Li, Shane Moon, Nicolas Scheffer, Kirmani Ahmed, Babak Damavandi, Rakesh Wanga, Anuj Kumar, Rohit Patel, Xin Luna Dong

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 WearVQA是一个评估可穿戴设备上多模型AI助手视觉问答能力的基准测试,通过真实场景下的图像-问题-答案三元组,评估其在复杂视觉输入和现实任务中的表现。

Comments 11 pages, 5 figures, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02492 2025-12-03 cs.CV 50%

YingVideo-MV: Music-Driven Multi-Stage Video Generation

YingVideo-MV: 基于音乐的多阶段视频生成

Jiahui Chen, Weida Wang, Runhua Shi, Huan Yang, Chaofan Ding, Zihao Chen

机构 * AI Lab, GiantNetwork(人工智能实验室)

专题命中 推理评测 :planning(abstract)

AI总结 YingVideo-MV通过整合音频语义分析、时间感知扩散模型和摄像机运动控制模块,实现了基于音乐的高质量视频生成。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏