arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-03 至 2025-12-03 共收录 79 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 2 篇

2512.02631 2025-12-03 cs.LG 70%

SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization

SeeNav-Agent: 通过视觉提示和分步策略优化增强视觉语言导航

Zhengcheng Wang, Zichuan Lin, Yijun Yang, Haobo Fu, Deheng Ye

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 SeeNav-Agent通过视觉提示和分步策略优化提升视觉语言导航性能,实验显示其在导航成功率上优于现有模型。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 4 篇

2512.02217 2025-12-03 cs.LG physics.app-ph 79%

Uncertainty Reasoning with Photonic Bayesian Machines

基于光子贝叶斯机器的不确定性推理

F. Brückerhoff-Plückelmann, H. Borras, S. U. Hulyal, L. Meyer, X. Ji, J. Hu, J. Sun, B. Klein, F. Ebert, J. Dijkstra, L. McRae, P. Schmidt, T. J. Kippenberg, H. Fröning, W. Pernice

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究提出一种基于光子技术的贝叶斯机器,利用混沌光源实现高速不确定性推理,应用于血细胞图像分类与域外检测,提升可信AI系统的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02882 2025-12-03 cs.LG cs.AI cs.CL 67%

OptPO: Optimal Rollout Allocation for Test-time Policy Optimization

OptPO:测试时间策略优化的最优回放分配

Youkang Wang, Jian Wang, Rubing Chen, Tianyi Zeng, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OptPO通过自适应分配推理预算,结合贝叶斯序列概率比率检验实现测试时间策略优化,减少回放开销并提高准确性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02710 2025-12-03 cs.CE 67%

Beyond N-grams: A Hierarchical Reward Learning Framework for Clinically-Aware Medical Report Generation

超越n-gram:一种面向临床意识的医疗报告生成层次奖励学习框架

Yuan Wang, Shujian Gao, Jiaxiang Liu, Songtao Jiang, Haoxiang Xia, Xiaotian Zhang, Zhaolu Kang, Yemin Wang, Zuozhu Liu

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 本文提出HiMed-RL框架,通过层次化奖励学习提升医疗报告生成的临床质量与事实准确性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02807 2025-12-03 cs.CL 57%

SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment

SR-GRPO:稳定秩作为大语言模型对齐的内在几何奖励

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 SR-GRPO通过稳定秩作为内在几何奖励信号,无需外部监督提升大语言模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 8 篇

2504.21370 2025-12-03 cs.AI 85%

ShorterBetter: Guiding Reasoning Models to Find Optimal Inference Length for Efficient Reasoning

ShorterBetter: 引导推理模型寻找最优推理长度以实现高效推理

Jingyang Yi, Jiazheng Wang, Sida Li

机构 * Data Science Institute, The University of Chicago(芝加哥大学数据科学研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 ShorterBetter通过强化学习引导推理模型自主学习最优推理长度,提升推理效率并减少输出长度。

Comments updated project website

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02185 2025-12-03 cs.CL cs.AI cs.LG 85%

Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models

在行动前剪枝:面向推理语言模型的自反思结构剪枝

Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Guanchu Wang, Minwoo Lee, Shu-ping Yeh, Li Yang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Minnesota(明尼苏达大学) Intel Corporation(英特尔公司)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RESP通过自反思结构化剪枝框架,在保持推理连贯性的同时显著提升稀疏度下的性能

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02389 2025-12-03 cs.AI cs.LG 84%

Synthetic Error Injection Fails to Elicit Self-Correction In Language Models

合成错误注入无法在语言模型中引发自我修正

David X. Wu, Shreyas Kapur, Anant Sahai, Stuart Russell

机构 * ucb(伯克利大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现合成错误注入无法有效提升语言模型的自我修正能力,揭示了策略性强化学习在激发自我修正方面的独特优势。

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02835 2025-12-03 cs.CV cs.AI cs.CL 81%

ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning

ReVSeg:通过强化学习激励视频分割的推理链

Yifan Li, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Xin Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) LIGHTSPEED

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ReVSeg通过强化学习优化视频分割的多步推理链,实现可解释的推理轨迹和先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06192 2025-12-03 cs.DB cs.AI cs.CL cs.LG 67%

SQLBarber: A System Leveraging Large Language Models to Generate Customized and Realistic SQL Workloads

SQLBarber: 借助大型语言模型生成定制化和真实SQL工作负载的系统

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SQLBarber利用大型语言模型生成定制化且真实的SQL工作负载,通过声明式接口和贝叶斯优化器高效生成符合目标成本分布的查询。

Comments Accepted by SIGMOD 2026; extended version with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02720 2025-12-03 cs.AI cs.LG 62%

StockMem: An Event-Reflection Memory Framework for Stock Forecasting

StockMem: 一种用于股票预测的事件反射内存框架

He Wang, Wenyilin Xiao, Songqiao Han, Hailiang Huang

机构 * Shanghai University of Finance and Economics(上海金融学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 StockMem通过事件反射双层内存框架,有效整合事件信息与价格动态,提升股票预测的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02228 2025-12-03 cs.AI cs.LG 62%

STRIDE: A Systematic Framework for Selecting AI Modalities -- Agentic AI, AI Assistants, or LLM Calls

STRIDE:一种选择AI模态的系统框架——代理AI、AI助手或LLM调用

Shubhi Asthana, Bing Zhang, Chad DeLuca, Ruchi Mahindru, Hima Patel

机构 * IBM Research – Almaden(IBM阿尔马登研究实验室) IBM Research – Yorktown(IBM约克镇研究实验室) IBM Research – India(IBM印度研究实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 STRIDE提供了一种系统框架,帮助选择AI模态,通过评估任务动态性决定是否使用自主代理,提升效率并降低成本。

Comments 10 pages, 4 Figures, 5 Tables Paper presented at NeurIPS 2025 LAW workshop: Bridging Language, Agent, and World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22307 2025-12-03 cs.AI cs.LG 62%

Enhanced Conditional Generation of Double Perovskite by Knowledge-Guided Language Model Feedback

通过知识引导语言模型反馈增强双钙钛矿的条件生成

Inhyo Lee, Junhyeong Lee, Jongwon Park, KyungTae Lim, Seunghwa Ryu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种多智能体框架,通过知识引导的文本梯度提升双钙钛矿生成的稳定性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 25 篇

2502.13127 2025-12-03 cs.CL 89%

Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning

通过监督的链式思维推理促进长上下文理解

Jingyang Lin, Andy Wong, Tian Xia, Shenghua He, Hui Wei, Mei Han, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) PAII Inc.(PAII公司) University of California, Merced(加州梅尔德大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出基于属性的代理推理框架PAI,通过生成包含中间推理步骤的合成数据集LongFinanceQA,提升LLMs在金融领域的长上下文理解能力。

Comments Main Conference of EMNLP 2025, Project Page: https://long-pai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02914 2025-12-03 cs.AI cs.CL cs.LG 82%

Martingale Score: An Unsupervised Metric for Bayesian Rationality in LLM Reasoning

马尔可夫得分:一种用于大语言模型推理中贝叶斯理性性的无监督度量标准

Zhonghao He, Tianyi Qiu, Hirokazu Shirado, Maarten Sap

机构 * University of Cambridge(剑桥大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出马尔可夫得分,用于评估大语言模型推理中的贝叶斯理性性,通过检测信念更新的违反情况来衡量求真能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02306 2025-12-03 cs.AI cs.CL cs.CR cs.CV cs.LG 82%

OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning

OmniGuard:统一的多模态防护机制与刻意推理

Boyu Zhu, Xiaofei Wen, Wenjie Jacky Mo, Tinghui Zhu, Yanan Xie, Peng Qi, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02942 2025-12-03 cs.CV cs.AI 79%

Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench

基于视频科学基准的视频生成科学理解与推理评估

Lanxiang Hu, Abhilash Shankarampeta, Yixin Huang, Zilin Dai, Haoyang Yu, Yujie Zhao, Haoqiang Kang, Daniel Zhao, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02699 2025-12-03 cs.AI 79%

Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding

学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解

Hyeongseop Rha, Jeong Hun Yeo, Junil Won, Se Jin Park, Yong Man Ro

机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02790 2025-12-03 cs.CV 78%

UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits

UnicEdit-10M: 一个通过统一验证打破规模-质量壁垒的数据集和基准

Keming Ye, Zhipeng Huang, Canmiao Fu, Qingyang Liu, Jiani Cai, Zheqi Lv, Chen Li, Jing Lyu, Zhou Zhao, Shengyu Zhang

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 UnicEdit-10M通过统一验证方法构建大规模高质量数据集和基准,解决图像编辑中规模与质量的矛盾,评估模型在空间和知识推理中的表现。

Comments 31 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02841 2025-12-03 cs.CL cs.AI cs.HC cs.LG 75%

Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages

跨语言提示引导性:迈向跨语言的准确且稳健的大语言模型行为

Lechen Zhang, Yusheng Zhou, Tolga Ergen, Lajanugen Logeswaran, Moontae Lee, David Jurgens

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) LG AI Research(LG人工智能研究)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种统一的四维评估框架,通过大规模实验揭示了提示组件对跨语言行为的影响,并开发了提示优化框架以提升多语言LLM的准确性和稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06540 2025-12-03 cs.LG cs.AI stat.ML 73%

Sloth: scaling laws for LLM skills to predict multi-benchmark performance across families

Sloth: LLM技能的缩放定律用于跨家族预测多基准性能

Felipe Maia Polo, Seamus Somerstep, Leshem Choshen, Yuekai Sun, Mikhail Yurochkin

机构 * Department of Statistics, University of Michigan(密歇根大学统计学系) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI实验室,IBM研究) Computer Science and Artificial Intelligence Laboratory, MIT(MIT计算机科学与人工智能实验室) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 Sloth提出一种基于低维潜在技能的LLM缩放定律,通过跨基准相关性提升预测准确性,减少多家族训练需求。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02719 2025-12-03 cs.CL cs.AI cs.CV cs.LG q-bio.NC 67%

Emergent Bayesian Behaviour and Optimal Cue Combination in LLMs

涌现的贝叶斯行为与LLMs中的最优线索整合

Julian Ma, Jun Wang, Zafeirios Fountas

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示LLMs在多模态整合中表现出贝叶斯策略,但准确性不等于鲁棒性,提出贝叶斯一致性分数以评估不确定性处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02624 2025-12-03 cs.CV 67%

PPTBench: Towards Holistic Evaluation of Large Language Models for PowerPoint Layout and Design Understanding

PPTBench: 向大语言模型在PowerPoint布局和设计理解的全面评估迈进

Zheng Huang, Xukai Liu, Tianyu Hu, Kai Zhang, Ye Liu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 PPTBench通过全面评估大语言模型在PowerPoint布局和设计理解上的能力,揭示了当前模型在视觉布局推理和生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03026 2025-12-03 cs.CL cs.AI 62%

The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models

道德一致性流水线:面向大语言模型的持续道德评估

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Negar Shahabi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔大学SWAT实验室) Concordia Institute for Information Systems Engineering, Concordia University(Concordia大学信息系统工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MoCoP通过闭环框架持续评估大语言模型的道德一致性,揭示伦理与毒性间的强负相关,推动自主AI系统中计算道德研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02810 2025-12-03 cs.RO cs.AI cs.LG 62%

Phase-Adaptive LLM Framework with Multi-Stage Validation for Construction Robot Task Allocation: A Systematic Benchmark Against Traditional Optimization Algorithms

具有多阶段验证的相适应LLM框架用于施工机器人任务分配:与传统优化算法的系统基准测试

Shyam prasad reddy Kaitha, Hongrui Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LTAA框架,结合LLM推理与结构化验证,实现施工机器人任务分配的高效协调,展示LLM在任务分配中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02689 2025-12-03 cs.CL cs.AI 62%

An Empirical Survey of Model Merging Algorithms for Social Bias Mitigation

对缓解社会偏见的模型合并算法的实证调查

Daiki Shirafuji, Tatsuhiko Saito, Yasutomo Kimura

机构 * Mitsubishi Electric Corporation(三菱电机公司) Otaru University of Commerce(大岛商业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文实证分析了七种模型合并算法在缓解社会偏见中的效果,发现SLERP在平衡偏见减少与性能方面表现最佳。

Comments Accepted in PACLIC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18659 2025-12-03 stat.ML cs.AI cs.LG stat.ME 62%

Adaptive Prediction-Powered AutoEval with Reliability and Efficiency Guarantees

具有可靠性和效率保证的自适应预测-驱动AutoEval

Sangwoo Park, Matteo Zecchin, Osvaldo Simeone

机构 * Department of Engineering(工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出R-AutoEval+框架,通过自适应构造模型评估变量,实现模型评估的可靠性保障和样本效率提升。

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07646 2025-12-03 cs.CL cs.AI 62%

On the Temporal Question-Answering Capabilities of Large Language Models Over Anonymized Data

大型语言模型在匿名数据上的时间问答能力研究

Alfredo Garrachón Ruiz, Tomás de la Rosa, Daniel Borrajo

机构 * AI Research, JP Morgan Chase(人工智能研究, 花旗集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型在匿名数据上的时间推理能力,开发了RATA数据集并比较了多种方法,发现需要集成方法而非单一LLM。

Comments 18 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02405 2025-12-03 cs.CV cs.AI cs.LG 62%

WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate

WISE: 加权迭代专家社会用于鲁棒多模态多智能体辩论

Anoop Cherian, River Doyle, Eyal Ben-Dov, Suhas Lohit, Kuan-Chuan Peng

机构 * Mitsubishi Electric Research Labs(三菱电机研究实验室) Cambridge Rindge and Latin School(剑桥林恩和拉丁学校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WISE框架,通过多模态多智能体辩论提升视觉语言推理任务的准确性,实验显示在多个数据集上提升了2-7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02363 2025-12-03 cs.CL cs.AI 62%

Memory-Augmented Knowledge Fusion with Safety-Aware Decoding for Domain-Adaptive Question Answering

具有安全意识解码的记忆增强知识融合用于领域自适应问答

Lei Fu, Xiang Chen, Kaige Gao Xinyue Huang, Kejian Tong

机构 * Independent Researcher(独立研究者) Boston University(波士顿大学) Binghamton University(伯克利大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过记忆增强和安全意识解码提升领域自适应问答的准确性和安全性

详情

展开后加载摘要…

URL PDF HTML 收藏