arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-18 至 2025-09-18 共收录 154 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 27 篇

2309.10092 2025-09-18 cs.RO cs.AI 89%

Conformal Temporal Logic Planning using Large Language Models

Jun Wang, Jiaming Tong, Kaiyuan Tan, Yevgeniy Vorobeychik, Yiannis Kantaros

机构 * Washington University in St Louis(华盛顿大学圣路易斯分校) University of Zurich(苏黎世大学) Vanderbilt University(范德比尔特大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments accepted by ACM Transactions on Cyber-Physical Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10408 2025-09-18 cs.LG cs.CL 88%

Out-of-Context Reasoning in Large Language Models

Jonathan Shaki, Emanuele La Malfa, Michael Wooldridge, Sarit Kraus

机构 * Bar-Ilan University(巴伊兰大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21137 2025-09-18 cs.CL 86%

How Does Cognitive Bias Affect Large Language Models? A Case Study on the Anchoring Effect in Price Negotiation Simulations

Yoshiki Takenami, Yin Jou Huang, Yugo Murawaki, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments 18 pages, 2 figures. Accepted to EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13351 2025-09-18 cs.AI cs.CL 86%

Teaching LLMs to Plan: Logical Chain-of-Thought Instruction Tuning for Symbolic Planning

Pulkit Verma, Ngoc La, Anthony Favier, Swaroop Mishra, Julie A. Shah

专题命中 推理与问题求解 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11176 2025-09-18 cs.CL 85%

LogiDynamics: Unraveling the Dynamics of Inductive, Abductive and Deductive Logical Inferences in LLM Reasoning

Tianshi Zheng, Jiayang Cheng, Chunyang Li, Haochen Shi, Zihao Wang, Jiaxin Bai, Yangqiu Song, Ginny Y. Wong, Simon See

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19546 2025-09-18 cs.CL cs.AI 84%

Language Models Identify Ambiguities and Exploit Loopholes

Jio Choi, Mohit Bansal, Elias Stengel-Eskin

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 camera-ready; Code: https://github.com/esteng/ambiguous-loophole-exploitation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08364 2025-09-18 cs.AI 83%

Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation

Enci Zhang, Xingang Yan, Wei Lin, Tianxiang Zhang, Qianchun Lu

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments 14 pages, 3 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11963 2025-09-18 cs.CL 83%

NeedleBench: Evaluating LLM Retrieval and Reasoning Across Varying Information Densities

Mo Li, Songyang Zhang, Taolin Zhang, Haodong Duan, Yunxin Liu, Kai Chen

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments v3: Revisions with added experiments, clarifications, and related work updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23759 2025-09-18 cs.CL cs.AI cs.CV cs.LG 82%

Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint

Heekyung Lee, Jiaxin Ge, Tsung-Han Wu, Minwoo Kang, Trevor Darrell, David M. Chan

机构 * POSTECH University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20742 2025-09-18 cs.CV cs.AI cs.CL 81%

Structured Preference Optimization for Vision-Language Long-Horizon Task Planning

Xiwen Liang, Min Lin, Weiqi Ruan, Rongtao Xu, Yuecheng Liu, Jiaqi Chen, Bingqian Lin, Yuzheng Zhuang, Xiaodan Liang

专题命中 推理与问题求解 :preference optimization(title,abstract);分类 cs.CL、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08627 2025-09-18 cs.SE 80%

NL in the Middle: Code Translation with LLMs and Intermediate Representations

Chi-en Amy Tai, Pengyu Nie, Lukasz Golab, Alexander Wong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13334 2025-09-18 cs.AI cs.LG 79%

FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness

Anand Swaroop, Akshat Nallani, Saksham Uboweja, Adiliia Uzdenova, Michael Nguyen, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma, Maheep Chaudhary

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03725 2025-09-18 cs.RO 78%

Meta-Optimization and Program Search using Language Models for Task and Motion Planning

Denis Shcherba, Eckart Cobo-Briesewitz, Cornelius V. Braun, Marc Toussaint

机构 * TU Berlin(柏林技术大学)

专题命中 推理与问题求解 :language model(title);foundation model(abstract)

Comments 8 pages main text, 11 pages appendix, accepted at the 9th Annual Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18216 2025-09-18 cs.SE cs.CR cs.LG 77%

Evaluating and Improving the Robustness of Security Attack Detectors Generated by LLMs

Samuele Pasini, Jinhan Kim, Tommaso Aiello, Rocio Cabrera Lozoya, Antonino Sabetta, Paolo Tonella

机构 * Samuele Pasini Universit\`a della Svizzera italiana, Switzerland Jinhan Kim Universit\`a della Svizzera italiana, Switzerland Tommaso Aiello SAP Labs France, France Rocio Cabrera Lozoya SAP Labs France, France Antonino Sabetta SAP Labs France, France Paolo Tonella Universit\`a della Svizzera italiana, Switzerland

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12147 2025-09-18 cs.CL 77%

MAgICoRe: Multi-Agent, Iterative, Coarse-to-Fine Refinement for Reasoning

Justin Chih-Yao Chen, Archiki Prasad, Swarnadeep Saha, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 (Camera-Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13758 2025-09-18 cs.SE 75%

A Study on Thinking Patterns of Large Reasoning Models in Code Generation

Kevin Halim, Sin G. Teo, Ruitao Feng, Zhenpeng Chen, Yang Gu, Chong Wang, Yang Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13879 2025-09-18 cs.CL cs.AI cs.IR 73%

Combining Evidence and Reasoning for Biomedical Fact-Checking

Mariano Barone, Antonio Romano, Giuseppe Riccio, Marco Postiglione, Vincenzo Moscato

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) Northwestern University(西北大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13683 2025-09-18 cs.CL cs.AI 73%

Improving Context Fidelity via Native Retrieval-Augmented Reasoning

Suyuchen Wang, Jinlin Wang, Xinyu Wang, Shiqi Li, Xiangru Tang, Sirui Hong, Xiao-Wen Chang, Chenglin Wu, Bang Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10857 2025-09-18 cs.CL cs.AI 73%

Mirror-Consistency: Harnessing Inconsistency in Majority Voting

Siyuan Huang, Zhiyuan Ma, Jintao Du, Changhua Meng, Weiqiang Wang, Zhouhan Lin

机构 * Shanghai Jiaotong University(上海交通大学) Tiansuan Lab, Ant Group Co., Ltd.(蚂蚁集团天算实验室) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14034 2025-09-18 cs.CL 70%

Enhancing Multi-Agent Debate System Performance via Confidence Expression

Zijie Lin, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP'25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14180 2025-09-18 cs.CL cs.AI cs.LG 67%

Synthesizing Behaviorally-Grounded Reasoning Chains: A Data-Generation Framework for Personal Finance LLMs

Akhil Theerthala

机构 * Perfios Software Solutions(Perfios软件解决方案)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages, 11 figures. The paper presents a novel framework for generating a personal finance dataset. The resulting fine-tuned model and dataset are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14142 2025-09-18 cs.CV 67%

MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook

Peng Xu, Shengwu Xiong, Jiajun Zhang, Yaxiong Chen, Bowen Zhou, Chen Change Loy, David A. Clifton, Kyoung Mu Lee, Luc Van Gool, Ruiming He, Ruilin Yao, Xinwei Long, Jirui Huang, Kai Tian, Sa Yang, Yihua Shao, Jin Feng, Yue Zhong, Jiakai Zhou, Cheng Tang, Tianyu Zou, Yifang Zhang, Junming Liang, Guoyou Li, Zhaoxiang Wang, Qiang Zhou, Yichen Zhao, Shili Xiong, Hyeongjin Nam, Jaerin Lee, Jaeyoung Chung, JoonKyu Park, Junghun Oh, Kanggeon Lee, Wooseok Lee, Juneyoung Ro, Turghun Osman, Can Hu, Chaoyang Liao, Cheng Chen, Chengcheng Han, Chenhao Qiu, Chong Peng, Cong Xu, Dailin Li, Feiyu Wang, Feng Gao, Guibo Zhu, Guopeng Tang, Haibo Lu, Han Fang, Han Qi, Hanxiao Wu, Haobo Cheng, Hongbo Sun, Hongyao Chen, Huayong Hu, Hui Li, Jiaheng Ma, Jiang Yu, Jianing Wang, Jie Yang, Jing He, Jinglin Zhou, Jingxuan Li, Josef Kittler, Lihao Zheng, Linnan Zhao, Mengxi Jia, Muyang Yan, Nguyen Thanh Thien, Pu Luo, Qi Li, Shien Song, Shijie Dong, Shuai Shao, Shutao Li, Taofeng Xue, Tianyang Xu, Tianyi Gao, Tingting Li, Wei Zhang, Weiyang Su, Xiaodong Dong, Xiao-Jun Wu, Xiaopeng Zhou, Xin Chen, Xin Wei, Xinyi You, Xudong Kang, Xujie Zhou, Xusheng Liu, Yanan Wang, Yanbin Huang, Yang Liu, Yang Yang, Yanglin Deng, Yashu Kang, Ye Yuan, Yi Wen, Yicen Tian, Yilin Tao, Yin Tang, Yipeng Lin, Yiqing Wang, Yiting Xi, Yongkang Yu, Yumei Li, Yuxin Qin, Yuying Chen, Yuzhe Cen, Zhaofan Zou, Zhaohong Liu, Zhehao Shen, Zhenglin Du, Zhengyang Li, Zhenni Huang, Zhenwei Shao, Zhilong Song, Zhiyong Feng, Zhiyu Wang, Zhou Yu, Ziang Li, Zihan Zhai, Zijian Zhang, Ziyang Peng, Ziyun Xiao, Zongshu Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments ICCV 2025 MARS2 Workshop and Challenge "Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond''

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13337 2025-09-18 cs.CY 67%

Behind India's ChatGPT Conversations: A Retrospective Analysis of 238 Unedited User Prompts

Kalyani Khona

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments 11 pages, 1 table. Behavioral analysis of authentic ChatGPT usage patterns among English-speaking urban professionals in India using retrospective prompt collection methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13597 2025-09-18 cs.CR cs.AI 57%

Agentic JWT: A Secure Delegation Protocol for Autonomous AI Agents

Abhishek Goswami

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

Comments 17 pages, 6 figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13547 2025-09-18 cs.AI cs.HC 57%

AI Agents with Human-Like Collaborative Tools: Adaptive Strategies for Enhanced Problem-Solving

Harper Reed, Michael Sugimura, Angelo Zangari

机构 * Research(2389研究机构) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

Comments 16 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13769 2025-09-18 cs.CV 50%

AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving

Yuechen Luo, Fang Li, Shaoqing Xu, Zhiyi Lai, Lei Yang, Qimao Chen, Ziang Luo, Zixun Xie, Shengyin Jiang, Jiaxin Liu, Long Chen, Bing Wang, Zhi-xin Yang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 推理与问题求解 :SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 41 篇

2509.13868 2025-09-18 cs.SE 92%

Are Prompts All You Need? Evaluating Prompt-Based Large Language Models (LLM)s for Software Requirements Classification

Manal Binkhonain, Reem Alfayaz

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 33 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05262 2025-09-18 cs.CL 90%

Do Large Language Models Truly Grasp Addition? A Rule-Focused Diagnostic Using Two-Integer Arithmetic

Yang Yan, Yu Lu, Renjun Xu, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted by EMNLP'25 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15871 2025-09-18 cs.CY cs.AI cs.CL 90%

A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare

Manar Aljohani, Jun Hou, Sindhura Kommu, Xuan Wang

机构 * Virginia Tech(维吉尼亚理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13535 2025-09-18 cs.SE 89%

Crash Report Enhancement with Large Language Models: An Empirical Study

S M Farah Al Fahim, Md Nakhla Rafi, Zeyang Ma, Dong Jae Kim, Tse-Hsun, Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏