arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-07 至 2025-10-07 共收录 131 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 14 篇

2510.03349 2025-10-07 cs.LG cs.AI cs.CL physics.ao-ph 82%

AgentCaster: Reasoning-Guided Tornado Forecasting

Michael Chen

机构 * Department of Computing + Mathematical Sciences(计算与数学科学系) California Institute of Technology(加州理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04128 2025-10-07 cs.AI cs.CL 81%

Internal states before wait modulate reasoning patterns

Dmitrii Troitskii, Koyena Pal, Chris Wendler, Callum Stuart McDougall, Neel Nanda

机构 * Independent(独立研究者) Northeastern University(东北大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03859 2025-10-07 cs.AI cs.LG 81%

Adaptive and Explainable AI Agents for Anomaly Detection in Critical IoT Infrastructure using LLM-Enhanced Contextual Reasoning

Raghav Sharma, Manan Mehta

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02663 2025-10-07 cs.AI 79%

Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning Models

Yongjiang Liu, Haoxi Li, Xiaosong Ma, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

Comments 21 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03611 2025-10-07 cs.CL cs.AI cs.LG 67%

Can an LLM Induce a Graph? Investigating Memory Drift and Context Length

Raquib Bin Yousuf, Aadyant Khatri, Shengzhe Xu, Mandar Sharma, Naren Ramakrishnan

机构 * Department of Computer Science, Virginia Tech, Alexandria, VA(计算机科学系,弗吉尼亚理工大学,亚历山大,VA)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 2025 IEEE International Conference on Knowledge Graph (ICKG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16706 2025-10-07 cs.LG cs.AI cs.CL cs.SE 67%

DISC: Dynamic Decomposition Improves LLM Inference Scaling

Jonathan Light, Wei Cheng, Benjamin Riviere, Wu Yue, Masafumi Oyamada, Mengdi Wang, Yisong Yue, Santiago Paternain, Haifeng Chen

机构 * Rensselaer Polytechnic Institute(拉特克利夫理工学院) NEC Laboratories America(NEC美洲实验室) Princeton University(普林斯顿大学) California Institute of Technology(加州理工学院) NEC Corporation(NEC公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, Accepted to NeurIPS 2025 (Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04588 2025-10-07 cs.AI 57%

Perfect AI Mimicry and the Epistemology of Consciousness: A Solipsistic Dilemma

Shurui Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04401 2025-10-07 cs.CV cs.AI 57%

Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting

Xuyang Guo, Zekai Huang, Zhenmei Shi, Zhao Song, Jiahao Zhang

机构 * Guilin University of Electronic Technology(桂林电子科技大学) The Ohio State University(俄亥俄州立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04039 2025-10-07 cs.CV cs.AI 57%

\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding

Bin Lei, Nuo Xu, Ali Payani, Mingyi Hong, Chunhua Liao, Yu Cao, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Cisco Research(思科研究) Lawrence Livermore National Labs(劳伦斯利弗莫尔国家实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03680 2025-10-07 cs.AI 57%

Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs

Bumjun Kim, Dongjae Jeon, Dueun Kim, Wonje Jeung, Albert No

机构 * Artificial Intelligence Department of Yonsei University(延世大学人工智能系) Computer Science Department of Yonsei University(延世大学计算机科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments 25 pages. Project page available at~\url{https://ai-isl.github.io/rainbow-padding}

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25622 2025-10-07 cs.LG 57%

Layer-wise dynamic rank for compressing large language models

Zhendong Mi, Bian Sun, Grace Li Zhang, Shaoyi Huang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Carnegie Mellon University(卡内基梅隆大学) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18710 2025-10-07 cs.AI 57%

Autonomous Data Agents: A New Opportunity for Smart Data

Yanjie Fu, Dongjie Wang, Wangyang Ying, Xinyuan Wang, Xiangliang Zhang, Huan Liu, Jian Pei

机构 * Arizona State University(亚利桑那州立大学) University of Kansas(堪萨斯大学) University of Notre Dame(圣母大学) Duke University(杜克大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 35 篇

2510.05003 2025-10-07 cs.CL cs.AI 88%

Resource-Efficient Fine-Tuning of LLaMA-3.2-3B for Medical Chain-of-Thought Reasoning

Imran Mansha

机构 * Department of Information Technology(信息科技系) The Islamia University of Bahawalpur(巴哈瓦尔普尔伊斯兰大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

Comments 6 pages, 2 figures. Submitted to arXiv for open access

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04477 2025-10-07 cs.CV cs.AI cs.CL cs.LG 87%

MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models

Soo Yong Kim, Suin Cho, Vincent-Daniel Yun, Gyeongyeon Hwang

机构 * A.I.MATICS Inc(A.I.MATICS公司) Boston University(波士顿大学) University of Southern California(南加州大学) Heuron(Heuron公司) MODULABS, Open Neural Networks Research Lab(MODULABS,开放神经网络研究实验室)

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23882 2025-10-07 cs.AI cs.CR 85%

Quant Fever, Reasoning Blackholes, Schrodinger's Compliance, and More: Probing GPT-OSS-20B

Shuyi Lin, Tian Lu, Zikai Wang, Bo Wen, Yibo Zhao, Cheng Tan

机构 * Northeastern University(东北大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05278 2025-10-07 cs.CL cs.AI 81%

Micro-Act: Mitigating Knowledge Conflict in LLM-based RAG via Actionable Self-Reasoning

Nan Huo, Jinyang Li, Bowen Qin, Ge Qu, Xiaolong Li, Xiaodong Li, Chenhao Ma, Reynold Cheng

机构 * The University of Hong Kong(香港大学) BAAI(百度人工智能研究院) Xiamen University(厦门大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03913 2025-10-07 cs.CL 79%

PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian

Mohammad Amin Abbasi, Hassan Naderi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16929 2025-10-07 cs.CL 79%

K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling

Yongrui Chen, Yi Huang, Yunchang Liu, Shenyu Zhang, Junhao He, Tongtong Wu, Guilin Qi, Tianxing Wu

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及 interdisciplinary 应用关键实验室(东南大学)) China Mobile Research Institute(中国移动研究院) Department of Data Science & AI, Monash University, Australia(莫纳什大学数据科学与人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted in Neurips 2025 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11334 2025-10-07 cs.AI 77%

Program Synthesis Benchmark for Visual Programming in XLogoOnline Environment

Chao Wen, Jacqueline Staub, Adish Singla

专题命中 推理评测 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

Comments ACL'25 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04338 2025-10-07 cs.CL 70%

Evaluation of Clinical Trials Reporting Quality using Large Language Models

Mathieu Laï-king, Patrick Paroubek

机构 * Université Paris-Saclay, CNRS, LISN(巴黎-萨克雷大学、法国国家科学研究中心、LISN)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Journal ref Revue TAL 65.2, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09123 2025-10-07 cs.AI cs.CV 70%

OpenCUA: Open Foundations for Computer-Use Agents

Xinyuan Wang, Bowen Wang, Dunjie Lu, Junlin Yang, Tianbao Xie, Junli Wang, Jiaqi Deng, Xiaole Guo, Yiheng Xu, Chen Henry Wu, Zhennan Shen, Zhuokai Li, Ryan Li, Xiaochuan Li, Junda Chen, Boyuan Zheng, Peihang Li, Fangyu Lei, Ruisheng Cao, Yeqiao Fu, Dongchan Shin, Martin Shin, Jiarui Hu, Yuyan Wang, Jixuan Chen, Yuxiao Ye, Danyang Zhang, Dikang Du, Hao Hu, Huarong Chen, Zaida Zhou, Haotian Yao, Ziwei Chen, Qizheng Gu, Yipu Wang, Heng Wang, Diyi Yang, Victor Zhong, Flood Sung, Y. Charles, Zhilin Yang, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(香港大学XLANG实验室) Moonshot AI Stanford University(斯坦福大学) University of Waterloo(滑铁卢大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments Updata author list, modify first page format, correct typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18525 2025-10-07 cs.CL cs.AI cs.LG 67%

ClinicRealm: Re-evaluating Large Language Models with Conventional Machine Learning for Non-Generative Clinical Prediction Tasks

Yinghao Zhu, Junyi Gao, Zixiang Wang, Weibin Liao, Xiaochen Zheng, Lifang Liang, Miguel O. Bernabeu, Yasha Wang, Lequan Yu, Chengwei Pan, Ewen M. Harrison, Liantao Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code: https://github.com/yhzhu99/ehr-llm-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03688 2025-10-07 cs.AI cs.CL cs.LG 67%

AgentBench: Evaluating LLMs as Agents

Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) The Ohio State University(俄亥俄州立大学) UC Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03399 2025-10-07 cs.AI cs.CL cs.CY cs.LG 67%

Know Thyself? On the Incapability and Implications of AI Self-Recognition

Xiaoyan Bai, Aryan Shrivastava, Ari Holtzman, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Our code is available, see https://github.com/ChicagoHAI/self-recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07048 2025-10-07 cs.CV 67%

Comprehensive Evaluation of Large Multimodal Models for Nutrition Analysis: A New Benchmark Enriched with Contextual Metadata

Bruce Coburn, Jiangpeng He, Megan E. Rollo, Satvinder S. Dhaliwal, Deborah A. Kerr, Fengqing Zhu

机构 * Purdue University(普渡大学) Indiana University(印第安纳大学) Curtin University(Curtin大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

Comments The extended full version of the accepted paper in 2025 IEEE BHI conference with title: Evaluating Large Multimodal Models for Nutrition Analysis: A New Benchmark Enriched with Contextual Metadata. Dataset is available at: https://skynet.ecn.purdue.edu/~coburn6/ACETADA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05040 2025-10-07 cs.LG cs.AI 62%

Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts

Jihoon Lee, Hoyeon Moon, Kevin Zhai, Arun Kumar Chithanar, Anit Kumar Sahu, Soummya Kar, Chul Lee, Souradip Chakraborty, Amrit Singh Bedi

机构 * Yonsei University(延世大学) Oracle(Oracle公司) CMU(卡内基梅隆大学) UMD(马里兰大学) UCF(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04980 2025-10-07 cs.AI cs.CL 62%

LLM-Hanabi: Evaluating Multi-Agent Gameplays with Theory-of-Mind and Rationale Inference in Imperfect Information Collaboration Game

Fangzhou Liang, Tianshi Zheng, Chunkit Chan, Yauwai Yim, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Wordplay

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04506 2025-10-07 cs.CL cs.AI cs.IR 62%

GRACE: Generative Representation Learning via Contrastive Policy Optimization

Jiashuo Sun, Shixuan Liu, Zhaochen Su, Xianrui Zhong, Pengcheng Jiang, Bowen Jin, Peiran Li, Weijia Shi, Jiawei Han

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Australian National University(澳大利亚国立大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 23 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04374 2025-10-07 cs.LG cs.AI cs.CY 62%

GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks

Tejal Patwardhan, Rachel Dias, Elizabeth Proehl, Grace Kim, Michele Wang, Olivia Watkins, Simón Posada Fishman, Marwan Aljubeh, Phoebe Thacker, Laurance Fauconnet, Natalie S. Kim, Patrick Chao, Samuel Miserendino, Gildas Chabot, David Li, Michael Sharman, Alexandra Barr, Amelia Glaese, Jerry Tworek

机构 * OpenAI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04320 2025-10-07 cs.CL cs.LG 62%

Read the Scene, Not the Script: Outcome-Aware Safety for LLMs

Rui Wu, Yihao Quan, Zeru Shi, Zhenting Wang, Yanshu Li, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏