arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-17 至 2025-09-17 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2506.17088 2025-09-17 cs.CL 85%

Chain-of-Thought Prompting Obscures Hallucination Cues in Large Language Models: An Empirical Evaluation

Jiahao Cheng, Tiancheng Su, Jia Yuan, Guoxiu He, Jiawei Liu, Xinqi Tao, Jingwen Xie, Huaxia Li

机构 * East China Normal University(东中国师范大学) Wuhan University(武汉大学) Xiaohongshu Inc.(小红书公司)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13131 2025-09-17 cs.AI 83%

Reasoning with Preference Constraints: A Benchmark for Language Models in Many-to-One Matching Markets

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi

机构 * Université de Montréal(蒙特利尔大学) Mila McGill(麦吉尔大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13160 2025-09-17 cs.LG cs.AI 81%

FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning

Liang Hu, Jianpeng Jiao, Jiashuo Liu, Yanle Ren, Zhoufutu Wen, Kaiyuan Zhang, Xuanliang Zhang, Xiang Gao, Tianci He, Fei Hu, Yali Liao, Zaiyuan Wang, Chenghao Yang, Qianyu Yang, Mingren Yin, Zhiyuan Zeng, Ge Zhang, Xinyi Zhang, Xiying Zhao, Zhenwei Zhu, Hongseok Namkoong, Wenhao Huang, Yuwen Tang

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12743 2025-09-17 cs.AI cs.CL 81%

Zero-shot Graph Reasoning via Retrieval Augmented Framework with LLMs

Hanqing Li, Kiran Sheena Jyothi, Henry Liang, Sharika Mahadevan, Diego Klabjan

机构 * Northwestern University(西北大学) EXL Service(EXL服务) Vail Systems(Vail系统) Netflix

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12371 2025-09-17 cs.CL cs.AI 81%

MORABLES: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables

Matteo Marcuzzo, Alessandro Zangari, Andrea Albarelli, Jose Camacho-Collados, Mohammad Taher Pilehvar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12060 2025-09-17 cs.AI 79%

When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models

Wei Cai, Shujuan Liu, Jian Zhao, Ziyan Shi, Yusheng Zhao, Yuchen Yuan, Tianle Zhang, Chi Zhang, Xuelong Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13244 2025-09-17 cs.CL 70%

Evaluating LLM Alignment on Personality Inference from Real-World Interview Data

Jianfeng Zhu, Julina Maharjan, Xinyu Li, Karin G. Coifman, Ruoming Jin

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12866 2025-09-17 cs.CV 67%

Leveraging Large Language Models to Effectively Generate Visual Data for Canine Musculoskeletal Diagnoses

Martin Thißen, Thi Ngoc Diep Tran, Barbara Esteve Ratsch, Ben Joel Schönbein, Ute Trapp, Beate Egner, Romana Piat, Elke Hergenröther

机构 * Darmstadt University of Applied Sciences(达姆施塔特应用技术大学) Veterinary Academy of Higher Learning(兽医高等学习学院) European University of Technology(欧洲技术大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

Journal ref Computer Science Research Notes 3501(1) (2025) 27-38

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13282 2025-09-17 cs.CL cs.CV cs.LG 62%

ChartGaze: Enhancing Chart Understanding in LVLMs with Eye-Tracking Guided Attention Refinement

Ali Salamatian, Amirhossein Abaskohi, Wan-Cyuan Fan, Mir Rayat Imtiaz Hossain, Leonid Sigal, Giuseppe Carenini

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05066 2025-09-17 cs.CL cs.AI 62%

ToM-SSI: Evaluating Theory of Mind in Situated Social Interactions

Matteo Bortoletto, Constantin Ruhdorfer, Andreas Bulling

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13268 2025-09-17 cs.LG 57%

LLMs for energy and macronutrients estimation using only text data from 24-hour dietary recalls: a parameter-efficient fine-tuning experiment using a 10-shot prompt

Rodrigo M Carrillo-Larco

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.LG

Comments https://github.com/rodrigo-carrillo/LLMs-Macronutrient-Estimation-NHANES-Adolescents

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12720 2025-09-17 cs.CL 57%

HistoryBankQA: Multilingual Temporal Question Answering on Historical Events

Biswadip Mandal, Anant Khandelwal, Manish Gupta

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12395 2025-09-17 cs.SE cs.AI 57%

Evaluating Large Language Models for Functional and Maintainable Code in Industrial Settings: A Case Study at ASML

Yash Mundhra, Max Valk, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) ASML(ASML公司)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

Comments Accepted in the 40th IEEE/ACM International Conference on Automated Software Engineering, ASE 2025 (Industry track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09315 2025-09-17 cs.RO cs.CV cs.LG 57%

TransDiffuser: Diverse Trajectory Generation with Decorrelated Multi-modal Representation for End-to-end Autonomous Driving

Xuefeng Jiang, Yuan Ma, Pengxiang Li, Leimeng Xu, Xin Wen, Kun Zhan, Zhongpu Xia, Peng Jia, Xianpeng Lang, Sheng Sun

机构 * LiAuto Inc(LiAuto公司) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动研究所)

专题命中 推理评测 :planning(abstract);分类 cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22388 2025-09-17 cs.CL 57%

Why Stop at One Error? Benchmarking LLMs as Data Science Code Debuggers for Multi-Hop and Multi-Bug Errors

Zhiyu Yang, Shuo Wang, Yukun Yan, Yang Deng

机构 * Singapore Management University(新加坡管理大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 Main, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12638 2025-09-17 cs.CE 50%

FinSentLLM: Multi-LLM and Structured Semantic Signals for Enhanced Financial Sentiment Forecasting

Zijian Zhang, Rong Fu, Yangfan He, Xinze Shen, Yanlong Wang, Xiaojing Du, Haochen You, Jiazhao Shi, Simon Fong

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20890 2025-09-17 cs.CR 50%

PromptSleuth: Detecting Prompt Injection via Semantic Intent Invariance

Mengxiao Wang, Yuxuan Zhang, Guofei Gu

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏