arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-03 至 2025-10-03 共收录 222 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 44 篇

2503.03238 2025-10-03 cs.CL cs.AI 79%

FANS -- Formal Answer Selection for Natural Language Math Reasoning Using Lean4

Jiarui Yao, Ruida Wang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14459 2025-10-03 cs.CL cs.AI cs.IR 79%

Reasoning over User Preferences: Knowledge Graph-Augmented LLMs for Explainable Conversational Recommendations

Zhangchi Qiu, Linhao Luo, Shirui Pan, Alan Wee-Chung Liew

机构 * School of ICT, Griffith University(格里菲斯大学信息与通信技术学院) Department of Data Science and AI, Monash University(莫纳什大学数据科学与人工智能系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by ICDM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01924 2025-10-03 cs.AI cs.MA 77%

To Mask or to Mirror: Human-AI Alignment in Collective Reasoning

Crystal Qian, Aaron Parisi, Clémentine Bouleau, Vivian Tsai, Maël Lebreton, Lucas Dixon

机构 * Google DeepMind(谷歌DeepMind) Paris School of Economics(巴黎经济学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01639 2025-10-03 cs.AI 77%

Understanding the Geospatial Reasoning Capabilities of LLMs: A Trajectory Recovery Perspective

Thinh Hung Truong, Jey Han Lau, Jianzhong Qi

机构 * School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01591 2025-10-03 cs.CL 77%

CLUE: Non-parametric Verification from Experience via Hidden-State Clustering

Zhenwen Liang, Ruosen Li, Yujun Zhou, Linfeng Song, Dian Yu, Xinya Du, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01530 2025-10-03 cs.AI 77%

LOGicalThought: Logic-Based Ontological Grounding of LLMs for High-Assurance Reasoning

Navapat Nananukul, Yue Zhang, Ryan Lee, Eric Boxer, Jonathan May, Vibhav Giridhar Gogate, Jay Pujara, Mayank Kejriwal

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01526 2025-10-03 cs.CL q-fin.CP 77%

One More Question is Enough, Expert Question Decomposition (EQD) Model for Domain Quantitative Reasoning

Mengyu Wang, Sotirios Sabanis, Miguel de Carvalho, Shay B. Cohen, Tiejun Ma

机构 * The University of Edinburgh(爱丁堡大学) National Technical University of Athens(雅典技术大学) Archimedes/Athena Research Centre(阿基米德/雅典研究中心) University of Aveiro(阿维罗大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01241 2025-10-03 cs.CL 77%

SKYLENAGE Technical Report: Mathematical Reasoning and Contest-Innovation Benchmarks for Multi-Level Math Evaluation

Hu Wei, Ze Xu, Boyu Yang, Linlin Miao, Weiqi Zhai, Yihan Li, Zixuan Li, Zhijun Wang, Boya Wang, Jianwei Yu, Jialing Yuan, Xiaoyue Zhang, Cheng He, Minglei Chen, Zifan Zhang, Qianhui Li, Wei Wang, Xiang Xu

机构 * SKYLENAGE

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21499 2025-10-03 cs.CL cs.PL 77%

On Code-Induced Reasoning in LLMs

Abdul Waheed, Zhen Wu, Carolyn Rosé, Daphne Ippolito

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02157 2025-10-03 cs.HC 75%

Agentic Reasoning and Refinement through Semantic Interaction

Xuxin Tang, Rehema Abulikemu, Eric Krokos, Kirsten Whitley, Xuan Wang, Chris North

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01528 2025-10-03 cs.AI cs.LG 73%

Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation

Daniel Zhao, Abhilash Shankarampeta, Lanxiang Hu, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04782 2025-10-03 cs.CL cs.LG 73%

Reason to Rote: Rethinking Memorization in Reasoning

Yupei Du, Philipp Mondorf, Silvia Casola, Yuekun Yao, Robert Litschko, Barbara Plank

机构 * Department of ICS, Utrecht University(信息科学与计算系,乌特勒支大学) MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Saarland Informatics Campus, Saarland University(萨尔兰州信息科学校区,萨尔兰州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Main. 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01831 2025-10-03 cs.CL 70%

Syntactic Blind Spots: How Misalignment Leads to LLMs Mathematical Errors

Dane Williamson, Yangfeng Ji, Matthew Dwyer

机构 * Department of Computer Science(计算机科学系) University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 14 pages, 5 Tables, 9 Figures; Accepted to MathNLP 2025: The 3rd Workshop on Mathematical Natural Language Processing (co-located with EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15337 2025-10-03 cs.CL 70%

Reasoning Models are Test Exploiters: Rethinking Multiple-Choice

Narun Raman, Taylor Lundy, Kevin Leyton-Brown

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21285 2025-10-03 cs.CL 70%

Double-Checker: Enhancing Reasoning of Slow-Thinking LLMs via Self-Critical Fine-Tuning

Xin Xu, Tianhao Chen, Fan Zhang, Wanlong Liu, Pengxiang Li, Ajay Kumar Jaiswal, Yuchen Yan, Jishan Hu, Yang Wang, Hao Chen, Shiwei Liu, Shizhe Diao, Can Yang, Lu Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Electronic Science and Technology of China(电子科技大学) Dalian University of Technology(大连理工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) University of Oxford(牛津大学) NVIDIA(NVIDIA公司) University of Surrey(萨里大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02263 2025-10-03 cs.AI cs.CL cs.LG 67%

RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems

Yuxiao Qu, Anikait Singh, Yoonho Lee, Amrith Setlur, Ruslan Salakhutdinov, Chelsea Finn, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18228 2025-10-03 cs.MA 67%

Implementing Agents in JavaScript

Timotheus Kampik

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments This chapter will eventually by published in the book "Agents and Multi-Agent Systems Development -- Platforms, Toolkits, Technologies", edited by Collier, Mascardi, and Ricci

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01524 2025-10-03 cs.CV cs.AI cs.LG 62%

WALT: Web Agents that Learn Tools

Viraj Prabhu, Yutong Dai, Matthew Fernandez, Jing Gu, Krithika Ramakrishnan, Yanqi Luo, Silvio Savarese, Caiming Xiong, Junnan Li, Zeyuan Chen, Ran Xu

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21998 2025-10-03 cs.AI cs.LG 62%

GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments

Hanlin Zhu, Tianyu Guo, Song Mei, Stuart Russell, Nikhil Ghosh, Alberto Bietti, Jiantao Jiao

机构 * UC Berkeley(加州大学伯克利分校) Flatiron Institute(Flatiron研究所) Nvidia(英伟达)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

Comments 39 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00768 2025-10-03 cs.AI cond-mat.mtrl-sci cs.CL 62%

Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling

Lee Hyun, Sohee Yoon, Jinwoo Park, Sue In Chae, Seongeon Park, Jooyeon Ahn, Yebin Jung, Youjung Chung, Hogeun Chang, Sujin Park, Myeonginn Kang, Jina Kim, Ho-Gyeong Kim, Myeonghun Jeong

机构 * Materials AI Lab (AI Center), Samsung Electronics(材料AI实验室(AI中心),三星电子) Samsung Advanced Institute of Technology (SAIT)(三星先进技术研究所(SAIT))

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02204 2025-10-03 cs.CL 57%

Say One Thing, Do Another? Diagnosing Reasoning-Execution Gaps in VLM-Powered Mobile-Use Agents

Lingzhong Dong, Ziqi Zhou, Shuaibo Yang, Haiyue Sheng, Pengzhou Cheng, Zongru Wu, Zheng Wu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01681 2025-10-03 cs.CV cs.AI 57%

Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning

Xuchen Li, Xuzhao Li, Jiahui Gao, Renjie Pi, Shiyu Hu, Wentao Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) ZGCA(北京智感科技有限公司) HKU(香港大学) HKUST(香港科技大学) NTU(国立台湾大学) PKU(北京大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01586 2025-10-03 cs.AI 57%

AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning

Zhenyu Pan, Yiting Zhang, Zhuo Liu, Yolo Yunlong Tang, Zeliang Zhang, Haozheng Luo, Yuwei Han, Jianshu Zhang, Dennis Wu, Hong-Yu Chen, Haoran Lu, Haoyang Fang, Manling Li, Chenliang Xu, Philip S. Yu, Han Liu

机构 * Northwestern University(西北大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01539 2025-10-03 cs.LG 57%

Executable Counterfactuals: Improving LLMs' Causal Reasoning Through Code

Aniket Vashishtha, Qirun Dai, Hongyuan Mei, Amit Sharma, Chenhao Tan, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Chicago(芝加哥大学) TTIC Microsoft Research India(微软印度研究院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01991 2025-10-03 cs.CV 50%

4DGS-Craft: Consistent and Interactive 4D Gaussian Splatting Editing

Lei Liu, Can Wang, Zhenghao Chen, Dong Xu

专题命中 推理与问题求解 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01623 2025-10-03 cs.CV cs.RO 50%

VLA-R1: Enhancing Reasoning in Vision-Language-Action Models

Angen Ye, Zeyu Zhang, Boyuan Wang, Xiaofeng Wang, Dapeng Zhang, Zheng Zhu

机构 * GigaAI CASIA Tsinghua University(清华大学)

专题命中 推理与问题求解 :post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 53 篇

2510.01226 2025-10-03 cs.CL cs.AI 91%

ClaimCheck: Real-Time Fact-Checking with Small Language Models

Akshith Reddy Putta, Jacob Devasier, Chengkai Li

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01398 2025-10-03 cs.AI 89%

Automating Data-Driven Modeling and Analysis for Engineering Applications using Large Language Model Agents

Yang Liu, Zaid Abulawi, Abhiram Garimidi, Doyeong Lim

机构 * Department of Nuclear Engineering, Texas A\&M University(核工程系,德克萨斯A&M大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01244 2025-10-03 cs.CL 89%

Feasibility of Structuring Stress Documentation Using an Ontology-Guided Large Language Model

Hyeoneui Kim, Jeongha Kim, Huijing Xu, Jinsun Jung, Sunghoon Kang, Sun Joo Jang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04512 2025-10-03 cs.AI 89%

Schema Generation for Large Knowledge Graphs Using Large Language Models

Bohui Zhang, Yuan He, Lydia Pintscher, Albert Meroño Peñuela, Elena Simperl

机构 * King’s College London(伦敦国王学院) University of Oxford(牛津大学) Wikimedia Deutschland(维基媒体德国) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏