arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-17 至 2025-09-17 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 7 篇

2509.13310 2025-09-17 cs.CL 57%

Scaling Agents via Continual Pre-training

Liangcai Su, Zhen Zhang, Guangyu Li, Zhuo Chen, Chenxi Wang, Maojia Song, Xinyu Wang, Kuan Li, Jialong Wu, Xuanzhong Chen, Zile Qiao, Zhongwang Zhang, Huifeng Yin, Shihao Cai, Runnan Fang, Zhengwei Tao, Wenbiao Yin, Chenxiong Qian, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12867 2025-09-17 cs.LG cs.CV 57%

Tool-R1: Sample-Efficient Reinforcement Learning for Agentic Tool Use

Yabo Zhang, Yihan Zeng, Qingyun Li, Zhen Hu, Kavin Han, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12810 2025-09-17 cs.AI 57%

H$^2$R: Hierarchical Hindsight Reflection for Multi-Task LLM Agents

Shicheng Ye, Chao Yu, Kaiqiang Ke, Chengdong Xu, Yinqi Wei

机构 * Sun Yat-sen University(中山大学) The University of Sydney(悉尼大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 17 篇

2506.17088 2025-09-17 cs.CL 85%

Chain-of-Thought Prompting Obscures Hallucination Cues in Large Language Models: An Empirical Evaluation

Jiahao Cheng, Tiancheng Su, Jia Yuan, Guoxiu He, Jiawei Liu, Xinqi Tao, Jingwen Xie, Huaxia Li

机构 * East China Normal University(东中国师范大学) Wuhan University(武汉大学) Xiaohongshu Inc.(小红书公司)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13131 2025-09-17 cs.AI 83%

Reasoning with Preference Constraints: A Benchmark for Language Models in Many-to-One Matching Markets

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi

机构 * Université de Montréal(蒙特利尔大学) Mila McGill(麦吉尔大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13160 2025-09-17 cs.LG cs.AI 81%

FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning

Liang Hu, Jianpeng Jiao, Jiashuo Liu, Yanle Ren, Zhoufutu Wen, Kaiyuan Zhang, Xuanliang Zhang, Xiang Gao, Tianci He, Fei Hu, Yali Liao, Zaiyuan Wang, Chenghao Yang, Qianyu Yang, Mingren Yin, Zhiyuan Zeng, Ge Zhang, Xinyi Zhang, Xiying Zhao, Zhenwei Zhu, Hongseok Namkoong, Wenhao Huang, Yuwen Tang

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12743 2025-09-17 cs.AI cs.CL 81%

Zero-shot Graph Reasoning via Retrieval Augmented Framework with LLMs

Hanqing Li, Kiran Sheena Jyothi, Henry Liang, Sharika Mahadevan, Diego Klabjan

机构 * Northwestern University(西北大学) EXL Service(EXL服务) Vail Systems(Vail系统) Netflix

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12371 2025-09-17 cs.CL cs.AI 81%

MORABLES: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables

Matteo Marcuzzo, Alessandro Zangari, Andrea Albarelli, Jose Camacho-Collados, Mohammad Taher Pilehvar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12060 2025-09-17 cs.AI 79%

When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models

Wei Cai, Shujuan Liu, Jian Zhao, Ziyan Shi, Yusheng Zhao, Yuchen Yuan, Tianle Zhang, Chi Zhang, Xuelong Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13244 2025-09-17 cs.CL 70%

Evaluating LLM Alignment on Personality Inference from Real-World Interview Data

Jianfeng Zhu, Julina Maharjan, Xinyu Li, Karin G. Coifman, Ruoming Jin

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12866 2025-09-17 cs.CV 67%

Leveraging Large Language Models to Effectively Generate Visual Data for Canine Musculoskeletal Diagnoses

Martin Thißen, Thi Ngoc Diep Tran, Barbara Esteve Ratsch, Ben Joel Schönbein, Ute Trapp, Beate Egner, Romana Piat, Elke Hergenröther

机构 * Darmstadt University of Applied Sciences(达姆施塔特应用技术大学) Veterinary Academy of Higher Learning(兽医高等学习学院) European University of Technology(欧洲技术大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

Journal ref Computer Science Research Notes 3501(1) (2025) 27-38

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13282 2025-09-17 cs.CL cs.CV cs.LG 62%

ChartGaze: Enhancing Chart Understanding in LVLMs with Eye-Tracking Guided Attention Refinement

Ali Salamatian, Amirhossein Abaskohi, Wan-Cyuan Fan, Mir Rayat Imtiaz Hossain, Leonid Sigal, Giuseppe Carenini

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05066 2025-09-17 cs.CL cs.AI 62%

ToM-SSI: Evaluating Theory of Mind in Situated Social Interactions

Matteo Bortoletto, Constantin Ruhdorfer, Andreas Bulling

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13268 2025-09-17 cs.LG 57%

LLMs for energy and macronutrients estimation using only text data from 24-hour dietary recalls: a parameter-efficient fine-tuning experiment using a 10-shot prompt

Rodrigo M Carrillo-Larco

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.LG

Comments https://github.com/rodrigo-carrillo/LLMs-Macronutrient-Estimation-NHANES-Adolescents

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12720 2025-09-17 cs.CL 57%

HistoryBankQA: Multilingual Temporal Question Answering on Historical Events

Biswadip Mandal, Anant Khandelwal, Manish Gupta

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12395 2025-09-17 cs.SE cs.AI 57%

Evaluating Large Language Models for Functional and Maintainable Code in Industrial Settings: A Case Study at ASML

Yash Mundhra, Max Valk, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) ASML(ASML公司)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

Comments Accepted in the 40th IEEE/ACM International Conference on Automated Software Engineering, ASE 2025 (Industry track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09315 2025-09-17 cs.RO cs.CV cs.LG 57%

TransDiffuser: Diverse Trajectory Generation with Decorrelated Multi-modal Representation for End-to-end Autonomous Driving

Xuefeng Jiang, Yuan Ma, Pengxiang Li, Leimeng Xu, Xin Wen, Kun Zhan, Zhongpu Xia, Peng Jia, Xianpeng Lang, Sheng Sun

机构 * LiAuto Inc(LiAuto公司) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动研究所)

专题命中 推理评测 :planning(abstract);分类 cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22388 2025-09-17 cs.CL 57%

Why Stop at One Error? Benchmarking LLMs as Data Science Code Debuggers for Multi-Hop and Multi-Bug Errors

Zhiyu Yang, Shuo Wang, Yukun Yan, Yang Deng

机构 * Singapore Management University(新加坡管理大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 Main, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12638 2025-09-17 cs.CE 50%

FinSentLLM: Multi-LLM and Structured Semantic Signals for Enhanced Financial Sentiment Forecasting

Zijian Zhang, Rong Fu, Yangfan He, Xinze Shen, Yanlong Wang, Xiaojing Du, Haochen You, Jiazhao Shi, Simon Fong

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20890 2025-09-17 cs.CR 50%

PromptSleuth: Detecting Prompt Injection via Semantic Intent Invariance

Mengxiao Wang, Yuxuan Zhang, Guofei Gu

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 9 篇

2502.12067 2025-09-17 cs.CL cs.AI 86%

TokenSkip: Controllable Chain-of-Thought Compression in LLMs

Heming Xia, Chak Tou Leong, Wenjie Wang, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算学系,香港理工大学)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 (Long Paper), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12908 2025-09-17 cs.CL cs.AI 81%

All Roads Lead to Rome: Graph-Based Confidence Estimation for Large Language Model Reasoning

Caiqi Zhang, Chang Shu, Ehsan Shareghi, Nigel Collier

机构 * University of Cambridge(剑桥大学) Monash University(墨尔本大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12754 2025-09-17 cs.RO cs.AI cs.HC cs.LG 62%

Toward Ownership Understanding of Objects: Active Question Generation with Large Language Model and Probabilistic Generative Model

Saki Hashimoto, Shoichi Hasegawa, Tomochika Ishikawa, Akira Taniguchi, Yoshinobu Hagiwara, Lotfi El Hafi, Tadahiro Taniguchi

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Submitted to AROB-ISBC 2026 (Journal Track option)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13288 2025-09-17 cs.AI cs.RO 57%

Shapes of Cognition for Computational Cognitive Modeling

Marjorie McShane, Sergei Nirenburg, Sanjay Oruganti, Jesse English

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13255 2025-09-17 cs.CV cs.AI cs.IR eess.IV 57%

ResidualViT for Efficient Temporally Dense Video Encoding

Mattia Soldan, Fabian Caba Heilbron, Bernard Ghanem, Josef Sivic, Bryan Russell

机构 * KAUST(科威特科学与技术王国(KAUST)) CIIRC CTU(布拉格技术大学智能信息与计算研究中心(CIIRC CTU)) Adobe Research(Adobe研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13235 2025-09-17 cs.AI 57%

A Scenario-Driven Cognitive Approach to Next-Generation AI Memory

Linyue Cai, Yuyang Cheng, Xiaoding Shao, Huiming Wang, Yong Zhao, Wei Zhang, Kang Li

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Cyber Science and Engineering, Sichuan University(四川大学网络科学与工程学院) West China Biomedical Big Data Center, Sichuan University West China Hospital(四川大学华西生物医学大数据中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13025 2025-09-17 cs.SE cs.AI 57%

GView: A Survey of Binary Forensics via Visual, Semantic, and AI-Enhanced Analysis

Raul Zaharia, Dragoş Gavriluţ, Gheorghiţă Mutu

机构 * Al. I. Cuza University \& Bitdefender, Iași, Romania

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

Comments In Proceedings FROM 2025, arXiv:2509.11877

Journal ref EPTCS 427, 2025, pp. 134-140

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12589 2025-09-17 cs.AI 57%

Redefining CX with Agentic AI: Minerva CQ Case Study

Garima Agrawal, Riccardo De Maria, Kiran Davuluri, Daniele Spera, Charlie Read, Cosimo Spera, Jack Garrett, Don Miller

机构 * Minerva CQ AI Research Division(Minerva CQ人工智能研究部)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14172 2025-09-17 cs.CL 57%

The Strawberry Problem: Emergence of Character-level Understanding in Tokenized Language Models

Adrian Cosma, Stefan Ruseti, Emilian Radoi, Mihai Dascalu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 Main as Oral Presentation (Top 15% of accepted papers)

详情

展开后加载摘要…

URL PDF HTML 收藏