arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19037 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19037 篇

2512.12042 2025-12-16 cs.CL 81%

Benchmarking Contextual Understanding for In-Car Conversational Systems

车载对话系统上下文理解评估

Philipp Habicht, Lev Sorokin, Abdullah Saydemir, Ken E. Friedl, Andrea Stocco

机构 * Humboldt University of Berlin(柏林洪堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过LLM和提示技术评估车载对话系统上下文理解,发现非推理模型在成本效率上表现最佳,DeepSeek-R1达到高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12200 2025-12-10 cs.AI cs.AR 81%

PRO-V-R1: Reasoning Enhanced Programming Agent for RTL Verification

PRO-V-R1:基于推理增强的RTL验证编程代理

Yujie Zhao, Zhijing Wu, Boqin Yuan, Zhongming Yu, Hejia Zhang, Wentao Ni, Chia-Tung Ho, Haoxing Ren, Jishen Zhao

机构 * University of California San Diego(加州大学圣地亚哥分校) NVIDIA(NVIDIA公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 PRO-V-R1是一种基于推理增强的开源框架,通过结合LLM推理与编程工具,提升RTL验证的功能正确性和故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20781 2025-12-10 cs.SE cs.AI 81%

Using LLMs in Generating Design Rationale for Software Architecture Decisions

在软件架构决策中使用LLMs生成设计理由

Xiyu Zhou, Ruiyin Li, Peng Liang, Beiqi Zhang, Mojtaba Shahin, Zengyang Li, Chen Yang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) RMIT University(皇家墨尔本理工大学) School of Computer Science, Central China Normal University(中央师范大学计算机学院) School of Artificial Intelligence, Shenzhen Polytechnic University(深圳职业技术学院人工智能学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究评估了LLMs在生成软件架构决策设计理由方面的性能,通过实验和访谈探讨了不同提示策略的效果及实际应用的可行性。

Comments Preprint accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06867 2025-12-09 cs.AI 81%

Do Persona-Infused LLMs Affect Performance in a Strategic Reasoning Game?

带有个性特征的LLM是否会影响战略推理游戏中的表现?

John Licato, Stephen Steinle, Brayden Hollis

机构 * Bellini College of Artificial Intelligence, Cybersecurity and Computing(人工智能、网络安全与计算学院) University of South Florida(佛罗里达州立大学) Information Directorate(信息 Directorate) Air Force Research Library(空军研究图书馆)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了个性提示对战略推理游戏表现的影响,提出了一种基于心理测量原理的启发式生成方法,通过中介过程提升启发式策略的可靠性。

Comments Accepted at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03276 2025-12-04 cs.LG 81%

Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval

太迟回忆:多模态知识检索中双跳问题的解释

Constantin Venhoff, Ashkan Khakzar, Sonia Joseph, Philip Torr, Neel Nanda

机构 * University of Oxford(牛津大学) McGill University(麦吉尔大学) Meta MATS

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了多模态知识检索中双跳问题的影响,发现VLMs在处理视觉输入时过晚解决实体表示导致事实回忆性能下降,并提出通过修补和提示方法恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01155 2025-12-03 cs.SE cs.AI 81%

Beyond Greenfield: The D3 Framework for AI-Driven Productivity in Brownfield Engineering

超越Greenfield:面向Brownfield工程的D3框架:AI驱动的生产力框架

Krishna Kumaar Sharma

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出D3框架,通过双代理提示架构提升Brownfield工程中LLM的应用效果,实验证明在遗留系统探索、文档重建等任务中,AI辅助显著提升生产力和减少认知负荷。

Comments 53 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17238 2025-12-03 cs.LG 81%

Training a Scientific Reasoning Model for Chemistry

为化学训练一个推理模型

Siddharth M. Narayanan, James D. Braza, Ryan-Rhys Griffiths, Albert Bou, Geemi Wellawatte, Mayk Caldas Ramos, Ludovico Mitchener, Samuel G. Rodriques, Andrew D. White

机构 * FutureHouse Inc.(FutureHouse公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种基于强化学习的推理模型,用于化学领域,能高效处理多种化学任务,超越现有模型和人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01725 2025-12-02 cs.CL 81%

Beware of Reasoning Overconfidence: Pitfalls in the Reasoning Process for Multi-solution Tasks

警惕推理过度自信:多解任务中推理过程的陷阱

Jiannan Guan, Qiguang Chen, Libo Qin, Dengyun Peng, Jinhao Liu, Liangyu Huo, Jian Xie, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学) Du Xiaoman (Beijing) Science Technology Co., Ltd.(杜小蔓(北京)科技有限公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文指出LLMs在多解任务中存在推理过度自信问题,通过引入MuSoBench基准测试发现Short-CoT方法存在过度自信,而Long-CoT方法通过迭代探索缓解此问题,并提出认知刚性假说解释其成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00305 2025-12-02 cs.AI 81%

ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning

ChartPoint: 通过 grounding 反射引导 MLLMs 进行图表推理

Zhengzhuo Xu, SiNan Du, Yiyan Qi, SiwenLu, Chengjin Xu, Chun Yuan, Jian Guo

机构 * Tsinghua University(清华大学) International Digital Economy Academy(国际数字经济学院) Beihang University(北航) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 ChartPoint通过引入 grounding 反射机制,提升 MLLMs 在图表推理中的表现,开发了两个指令微调模型,在多个图表基准上取得显著提升。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20693 2025-11-27 cs.AI cs.MA 81%

$A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators

$A^2Flow$:通过自适应抽象运算符自动化代理工作流生成

Mingming Zhao, Xiaokang Wei, Yuanqi Shao, Kaiwen Zhou, Lin Yang, Siwei Rao, Junhui Zhan, Zhitang Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 $A^2Flow$通过自适应抽象运算符实现代理工作流的自动化生成,提升性能并降低资源消耗。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19719 2025-11-26 cs.CL 81%

Can LLMs Faithfully Explain Themselves in Low-Resource Languages? A Case Study on Emotion Detection in Persian

LLMs能否在低资源语言中忠实解释自己?一种波斯语情感检测的案例研究

Mobina Mehrazar, Mohammad Amin Yousefi, Parisa Abolfath Beygi, Behnam Bahrak

机构 * School of Electrical and Computer Engineering College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,德黑兰大学) Computer Science Department, University of British Columbia, Vancouver, Canada(计算机科学系,不列颠哥伦比亚大学) Tehran Institute for Advanced Studies, Khatam University, Tehran, Iran(德黑兰高级研究学院,卡坦大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究评估了LLMs在低资源语言波斯语情感分类中的解释忠实性,发现模型生成的解释与人类判断不一致,强调了改进解释方法的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04736 2025-11-24 cs.AI 81%

The promise and limits of LLMs in constructing proofs and hints for logic problems in intelligent tutoring systems

大型语言模型在智能辅导系统中构建证明和提示的潜力与限制

Sutapa Dey Tithi, Arun Kumar Ramesh, Clara DiMarco, Xiaoyi Tian, Nazia Alam, Kimia Fazeli, Tiffany Barnes

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究评估了大型语言模型在智能辅导系统中构建逻辑证明和生成提示的潜力与限制,发现DeepSeek-V3在证明构建上表现优异,但生成的提示在解释原因和背景方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14131 2025-11-19 cs.AI 81%

Run, Ruminate, and Regulate: A Dual-process Thinking System for Vision-and-Language Navigation

Yu Zhong, Zihao Zhang, Rui Zhang, Lingdong Huang, Haihan Gao, Shuo Wang, Da Li, Ruijian Han, Jiaming Guo, Shaohui Peng, Di Huang, Yunji Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00844 2025-11-18 cs.CV cs.LG 81%

PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary Tasks

Abdelrahman Elskhawy, Mengze Li, Nassir Navab, Benjamin Busam

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07690 2025-11-12 cs.AI 81%

Towards AI-Assisted Generation of Military Training Scenarios

Soham Hans, Volkan Ustun, Benjamin Nye, James Sterrett, Matthew Green

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17377 2025-11-11 cs.CL 81%

Robustness of Neurosymbolic Reasoners on First-Order Logic Problems

Hannah Bansal, Kemal Kurniawan, Lea Frermann

机构 * RMIT University(皇家墨尔本理工大学) The University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to ALA Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25187 2025-10-30 cs.CL 81%

Testing Cross-Lingual Text Comprehension In LLMs Using Next Sentence Prediction

Ritesh Sunil Chavan, Jack Mostow

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石溪大学) School of Computer Science(计算机科学学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20014 2025-10-28 cs.CL 81%

Does Rationale Quality Matter? Enhancing Mental Disorder Detection via Selective Reasoning Distillation

Hoyun Song, Huije Lee, Jisu Shin, Sukmin Cho, Changgeon Ko, Jong C. Park

机构 * School of Computing(计算学院) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20205 2025-10-24 cs.AI 81%

Merge and Conquer: Evolutionarily Optimizing AI for 2048

Maggie Bai, Ava Kim Cohen, Eleanor Koss, Charlie Lichtenbaum

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25033 2025-10-24 cs.CV cs.LG 81%

VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning

Wenhao Li, Qiangchang Wang, Xianjing Meng, Zhibin Wu, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computing and Artificial Intelligence, Shandong University of Finance and Economics(山东财经大学计算机与人工智能学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13214 2025-10-16 cs.AI 81%

Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning

Zehui Ling, Deshu Chen, Yichi Zhang, Yuchen Liu, Xigui Li, Xin Guo, Yuan Cheng

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22131 2025-10-15 cs.CL 81%

Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-Reflection

Zhuoyang Wu, Xinze Li, Zhenghao Liu, Yukun Yan, Zhiyuan Liu, Minghe Yu, Cheng Yang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) School of Computer Science, Beijing University of Posts and Telecommunications, China(北京邮电大学计算机科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);small language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10013 2025-10-14 cs.CL 81%

Path Drift in Large Reasoning Models:How First-Person Commitments Override Safety

Yuyi Huang, Runzhe Zhan, Lidia S. Chao, Ailin Tao, Derek F. Wong

机构 * The Second Affiliated Hospital, Guangdong Provincial Key Laboratory of Allergy and Clinical Immunology, Guangzhou Medical University(广东省过敏与临床免疫学重点实验室,广州医科大学第二附属医院) NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系NLP2CT实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);RLHF(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10698 2025-10-14 cs.LG cs.CV 81%

CrunchLLM: Multitask LLMs for Structured Business Reasoning and Outcome Prediction

Rabeya Tus Sadia, Qiang Cheng

机构 * Department of Computer Science University of Kentucky(计算机科学系 俄亥俄大学) Department of Computer Science, Institute for Biomedical Informatics University of Kentucky(计算机科学系 生物医学信息学研究所 俄亥俄大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18824 2025-10-09 cs.SE cs.AI 81%

Understanding Software Engineering Agents: A Study of Thought-Action-Result Trajectories

Islem Bouzenia, Michael Pradel

机构 * CISPA Helmholtz Center for Information Security Germany(CISPA海德堡信息安全中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments ACCEPTED FOR ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06093 2025-10-08 cs.AI 81%

Classical AI vs. LLMs for Decision-Maker Alignment in Health Insurance Choices

Mallika Mainali, Harsha Sureshbabu, Anik Sen, Christopher B. Rauch, Noah D. Reifsnyder, John Meyer, J. T. Turner, Michael W. Floyd, Matthew Molineaux, Rosina O. Weber

机构 * Information Science, Drexel University, Philadelphia, PA 19104 USA Parallax Advanced Research, 4035 Colonel Glenn Hwy, Beavercreek, OH 45431 USA Knexus Research, 174 Waterfront Street, Suite 310, National Harbor, Oxon Hill, MD 20745 USA Information Science \& Computer Science, Drexel University, Philadelphia, PA 19104 USA

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 15 pages, 3 figures. Accepted at the Twelfth Annual Conference on Advances in Cognitive Systems (ACS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04542 2025-10-07 cs.AI 81%

Code World Models for General Game Playing

Wolfgang Lehrach, Daniel Hennes, Miguel Lazaro-Gredilla, Xinghua Lou, Carter Wendelken, Zun Li, Antoine Dedieu, Jordi Grau-Moya, Marc Lanctot, Atil Iscen, John Schultz, Marcus Chiam, Ian Gemp, Piotr Zielinski, Satinder Singh, Kevin P. Murphy

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00880 2025-10-02 cs.CL 81%

HalluGuard: Evidence-Grounded Small Reasoning Models to Mitigate Hallucinations in Retrieval-Augmented Generation

Loris Bergeron, Ioana Buhnila, Jérôme François, Radu State

机构 * Banque de Luxembourg(卢森堡银行) Center for Data Science in Humanities, Chosun University(人文数据科学中心,全州大学) ATILF, University of Lorraine–CNRS(ATILF,洛林大学–CNRS) SnT, University of Luxembourg(SnT,卢森堡大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23285 2025-10-01 cs.AI 81%

Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning

Yifei Chen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24217 2025-09-30 cs.LG cs.NA math.NA 81%

MDD-Thinker: Towards Large Reasoning Models for Major Depressive Disorder Diagnosis

Yuyang Sha, Hongxin Pan, Gang Luo, Caijuan Shi, Jing Wang, Kefeng Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏