arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-11 至 2025-11-11 共收录 141 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 11 篇

2502.12767 2025-11-11 cs.CL cs.AI 81%

R2-KG: General-Purpose Dual-Agent Framework for Reliable Reasoning on Knowledge Graphs

Sumin Jo, Junseong Choi, Jiho Kim, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00762 2025-11-11 cs.AI 79%

Do We Truly Need So Many Samples? Multi-LLM Repeated Sampling Efficiently Scales Test-Time Compute

Jianhao Chen, Zishuo Xun, Bocheng Zhou, Han Qi, Hangfan Zhang, Qiaosheng Zhang, Yang Chen, Wei Hu, Yuzhong Qu, Wanli Ouyang, Shuyue Hu

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Auckland(奥克兰大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI

Journal ref AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06722 2025-11-11 cs.CV cs.AI cs.CL 79%

Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View

Jianyu Qi, Ding Zou, Wenrui Yan, Rui Ma, Jiaxu Li, Zhijie Zheng, Zhiguo Yang, Rongchang Zhao

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accpeted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05563 2025-11-11 cs.LG cs.AI 79%

Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models

Sanghyun Lee, Seungryong Kim, Jongho Park, Dongmin Park

机构 * KAIST(韩国科学技术院) University of California, Berkeley(加州大学伯克利分校) KRAFTON

专题命中 测试时计算 :planning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07384 2025-11-11 cs.CL cs.AI cs.LG 67%

Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence

Sean McLeish, Ang Li, John Kirchenbauer, Dayal Singh Kalra, Brian R. Bartoldson, Bhavya Kailkhura, Avi Schwarzschild, Jonas Geiping, Tom Goldstein, Micah Goldblum

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of North Carolina(北卡罗来纳大学) ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、马克斯·普朗克智能系统研究所、图宾根人工智能中心) Columbia University(哥伦比亚大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments code: https://github.com/mcleish7/retrofitting-recurrence, models: https://huggingface.co/collections/tomg-group-umd/retrofitting-recurrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03262 2025-11-11 cs.CL cs.LG 62%

REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization

Jian Hu, Jason Klein Liu, Haotian Xu, Wei Shen

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments refactor

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05589 2025-11-11 cs.LG cs.AI 62%

CoPRIS: Efficient and Stable Reinforcement Learning via Concurrency-Controlled Partial Rollout with Importance Sampling

Zekai Qu, Yinxu Pan, Ao Sun, Chaojun Xiao, Xu Han

机构 * OpenBMB(开放智能实验室) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22812 2025-11-11 cs.CL 57%

EditGRPO: Reinforcement Learning with Post-Rollout Edits for Clinically Accurate Chest X-Ray Report Generation

Kai Zhang, Christopher Malon, Lichao Sun, Martin Renqiang Min

机构 * NEC Laboratories America(NEC美国实验室) Lehigh University(莱特大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17714 2025-11-11 cs.CV 50%

F2RVLM: Boosting Fine-grained Fragment Retrieval for Multi-Modal Long-form Dialogue with Vision Language Model

Hanbo Bi, Zhiqiang Yuan, Zexi Jia, Jiapei Zhang, Chongyang Li, Peixiang Luo, Ying Deng, Xiaoyue Duan, Jinchao Zhang

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 19 篇

2511.06437 2025-11-11 cs.AI cs.CL cs.LG 87%

Optimizing Chain-of-Thought Confidence via Topological and Dirichlet Risk Analysis

Abhishek More, Anthony Zhang, Nicole Bonilla, Ashvik Vivekan, Kevin Zhu, Parham Sharafoleslami, Maheep Chaudhary

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06380 2025-11-11 cs.AI cs.LG 81%

What Makes Reasoning Invalid: Echo Reflection Mitigation for Large Language Models

Chen He, Xun Jiang, Lei Wang, Hao Yang, Chong Peng, Peng Yan, Fumin Shen, Xing Xu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05978 2025-11-11 cs.LG cs.AI cs.DC cs.PF 81%

Kunlun Anomaly Troubleshooter: Enabling Kernel-Level Anomaly Detection and Causal Reasoning for Large Model Distributed Inference

Yuyang Liu, Jingjing Cai, Jiayi Ren, Peng Zhou, Danyang Zhang, Yin Du, Shijian Li

机构 * Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Preprint version, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05528 2025-11-11 cs.AI 79%

SMAGDi: Socratic Multi Agent Interaction Graph Distillation for Efficient High Accuracy Reasoning

Aayush Aluru, Myra Malik, Samarth Patankar, Spencer Kim, Kevin Zhu, Sean O'Brien, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

Comments Multi-Turn Interactions in Large Language Models (MTI-LLM) Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00299 2025-11-11 cs.AI 79%

Collaborative LLM Numerical Reasoning with Local Data Protection

Min Zhang, Yuzhe Lu, Yun Zhou, Panpan Xu, Lin Lee Cheong, Chang-Tien Lu, Haozhu Wang

机构 * AWS AI(AWS人工智能)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

Comments Accepted to AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07364 2025-11-11 cs.LG cs.AI cs.CL 67%

Self-Evaluating LLMs for Multi-Step Tasks: Stepwise Confidence Estimation for Failure Detection

Vaibhav Mavi, Shubh Jaroria, Weiqi Sun

机构 * Dyania Health(Dyania健康)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06859 2025-11-11 cs.LG cs.AI 62%

TuckA: Hierarchical Compact Tensor Experts for Efficient Fine-Tuning

Qifeng Lei, Zhiyong Yang, Qianqian Xu, Cong Hua, Peisong Wen, Qingming Huang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06776 2025-11-11 cs.LG cs.AI 62%

Data Trajectory Alignment for LLM Domain Adaptation: A Two-Phase Synthesis Framework for Telecommunications Mathematics

Zhicheng Zhou, Jing Li, Suming Qiu, Junjie Huang, Linyuan Qiu, Zhijie Sun

机构 * Global Technical Service (GTS) Huawei Technologies Co., Ltd(华为技术有限公司全球技术服务部)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01934 2025-11-11 cs.LG cs.AI 62%

Tool Zero: Training Tool-Augmented LLMs via Pure RL from Scratch

Yirong Zeng, Xiao Ding, Yutai Hou, Yuxian Wang, Li Du, Juyi Dai, Qiuyang Ding, Duyu Tang, Dandan Tu, Weiwen Liu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology SCIR Lab(哈尔滨工业大学SCIR实验室) Huawei Technologies Co., Ltd(华为技术有限公司) Shanghai Jiao Tong University(上海交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

Comments EMNLP 2025 finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12477 2025-11-11 cs.AI cs.CL cs.HC 62%

Towards Conversational AI for Human-Machine Collaborative MLOps

George Fatouros, Georgios Makridis, George Kousiouris, John Soldatos, Anargyros Tsadimas, Dimosthenis Kyriazis

机构 * Innov-Acts Ltd(Innov-Acts公司) Dept. of Digital Systems(数字系统系) University of Piraeus(比雷埃克斯大学) Dept. of Informatics and Telematics(信息与电信学系) Harokopio University(哈罗科比奥大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 5 figures

Journal ref 2025 21st International Conference on Distributed Computing in Smart Systems and the Internet of Things (DCOSS-IoT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06344 2025-11-11 cs.CL cs.AI 62%

TimeSense:Making Large Language Models Proficient in Time-Series Analysis

Zhirui Zhang, Changhua Pei, Tianyi Gao, Zhe Xie, Yibo Hao, Zhaoyang Yu, Longlong Xu, Tong Xiao, Jing Han, Dan Pei

机构 * Tsinghua University(清华大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ZTE Corporation(中兴通讯)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06490 2025-11-11 cs.CV cs.AI 57%

Zooming into Comics: Region-Aware RL Improves Fine-Grained Comic Understanding in Vision-Language Models

Yule Chen, Yufan Ren, Sabine Süsstrunk

机构 * School of Computer and Communication Sciences, EPFL(瑞士联邦理工学院计算机与通信科学学院) Department of Computer Science and Engineering, Chalmers University of Technology(楚科奇技术大学计算机科学与工程系) IVRL, EPFL(EPFL智能机器人实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05931 2025-11-11 cs.AI cs.SE 57%

Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement

Hiroaki Hayashi, Bo Pang, Wenting Zhao, Ye Liu, Akash Gokul, Srijan Bansal, Caiming Xiong, Semih Yavuz, Yingbo Zhou

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00457 2025-11-11 cs.AI 57%

GraphChain: Large Language Models for Large-scale Graph Analysis via Tool Chaining

Chunyu Wei, Wenji Hu, Xingjia Hao, Xin Wang, Yifan Yang, Yueguo Chen, Yang Tian, Yunhai Wang

机构 * Renmin University of China(中国人民大学) Guangxi University(广西大学) Beijing Jiaotong University(北京交通大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10114 2025-11-11 cs.CL 57%

LinearRAG: Linear Graph Retrieval Augmented Generation on Large-scale Corpora

Luyao Zhuang, Shengyuan Chen, Yilin Xiao, Huachi Zhou, Yujing Zhang, Hao Chen, Qinggang Zhang, Xiao Huang

机构 * The Department of Computing, Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学计算机系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02073 2025-11-11 cs.AI 57%

Large model retrieval enhancement framework for construction site risk identification

Jiawei Li, Chengye Yang, Yaochen Zhang, Weilin Sun, Lei Meng, Xiangxu Meng

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06360 2025-11-11 cs.CV 50%

AesTest: Measuring Aesthetic Intelligence from Perception to Production

Guolong Wang, Heng Huang, Zhiqiang Zhang, Wentian Li, Feilong Ma, Xin Jin

机构 * University of International Business and Economics(国际商务经济大学) University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd(华为技术有限公司) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 复杂问题求解 :reasoning(abstract)

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05855 2025-11-11 cs.RO 50%

Gentle Manipulation Policy Learning via Demonstrations from VLM Planned Atomic Skills

Jiayu Zhou, Qiwei Wu, Jian Li, Zhe Chen, Xiaogang Xiong, Renjing Xu

专题命中 复杂问题求解 :planning(abstract)

Comments Accepted for the 40th Annual AAAI Conference on Artificial Intelligence (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20263 2025-11-11 cs.CV 50%

Vector-Quantized Vision Foundation Models for Object-Centric Learning

Rongzhen Zhao, Vivienne Wang, Juho Kannala, Joni Pajarinen

机构 * Aalto University(阿alto大学) University of Oulu(奥卢大学)

专题命中 复杂问题求解 :reasoning(abstract)

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 34 篇

2405.18004 2025-11-11 cs.CV 89%

SkinCaRe: A Multimodal Dermatology Dataset Annotated with Medical Caption and Chain-of-Thought Reasoning

Yuhao Shen, Liyuan Sun, Yan Xu, Wenbin Liu, Shuping Zhang, Shawn Afvari, Zhongyi Han, Jiaoyan Song, Yongzhi Ji, Tao Lu, Xiaonan He, Xin Gao, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK–Shenzhen)(数据科学学院,香港中文大学(深圳)) Computer Science Program, CEMSE Division, King Abdullah University of Science and Technology (KAUST)(计算机科学项目,科学与工程学院,国王 Abdullah 科学技术大学) Center of Excellence on Smart Health, KAUST(智能健康卓越中心,国王 Abdullah 科学技术大学) Center of Excellence for Generative AI, KAUST(生成式人工智能卓越中心,国王 Abdullah 科学技术大学) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(皮肤科,北京安贞医院,首都医科大学) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(皮肤科,天津整合皮肤科研究院,天津中医药大学附属医院) Department of Dermatology, Beijing Aerospace General Hospital(皮肤科,北京航天总医院) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院) DermAssure, LLC(DermAssure 公司) School of Medicine, New York Medical College(医学院,纽约医学院) Capital Medical University(首都医科大学) Department of Dermatology, Second Hospital of Jilin University(皮肤科,吉林大学第二医院) Emergency Critical Care Center, Beijing AnZhen Hospital, Capital Medical University(急诊重症中心,北京安贞医院,首都医科大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04913 2025-11-11 cs.LG cs.CL 88%

Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study

Yongyu Mu, Jiali Zeng, Bei Li, Xinyan Guan, Fandong Meng, Jie Zhou, Tong Xiao, Jingbo Zhu

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc.(腾讯人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.LG

Comments Working in process

详情

展开后加载摘要…

URL PDF HTML 收藏