arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18875 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18875 篇

2411.10541 2024-11-19 cs.CL cs.LG 88%

Does Prompt Formatting Have Any Impact on LLM Performance?

Jia He, Mukund Rungta, David Koleczek, Arshdeep Sekhon, Franklin X Wang, Sadid Hasan

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Submitted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16247 2024-11-12 cs.AI cs.CL 88%

AutoManual: Constructing Instruction Manuals by LLM Agents via Interactive Environmental Learning

Minghao Chen, Yihang Li, Yanting Yang, Shiyu Yu, Binbin Lin, Xiaofei He

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11200 2024-11-01 cs.LG cs.CL 88%

AvaTaR: Optimizing LLM Agents for Tool Usage via Contrastive Reasoning

Shirley Wu, Shiyu Zhao, Qian Huang, Kexin Huang, Michihiro Yasunaga, Kaidi Cao, Vassilis N. Ioannidis, Karthik Subbian, Jure Leskovec, James Zou

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments NeurIPS 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09136 2024-11-01 cs.CL cs.LG 88%

Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs

Xuan Zhang, Chao Du, Tianyu Pang, Qian Liu, Wei Gao, Min Lin

专题命中 推理与问题求解 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22597 2024-10-31 cs.LG cs.AI 88%

Are Large-Language Models Graph Algorithmic Reasoners?

Alexander K Taylor, Anthony Cuturrufo, Vishal Yathish, Mingyu Derek Ma, Wei Wang

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

Comments 9 pages, 13 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12375 2024-10-17 cs.AI cond-mat.dis-nn cond-mat.mes-hall cond-mat.mtrl-sci cs.CL 88%

PRefLexOR: Preference-based Recursive Language Modeling for Exploratory Optimization of Reasoning and Agentic Thinking

Markus J. Buehler

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);small language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12639 2024-10-03 cs.CL cs.AI 88%

Ask-before-Plan: Proactive Language Agents for Real-World Planning

Xuan Zhang, Yang Deng, Zifeng Ren, See-Kiong Ng, Tat-Seng Chua

专题命中 推理与问题求解 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08642 2024-10-02 cs.AI cs.LG 88%

CPL: Critical Plan Step Learning Boosts LLM Generalization in Reasoning Tasks

Tianlong Wang, Junzhe Chen, Xueting Han, Jing Bai

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01817 2024-06-13 cs.AI cs.LG 88%

LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks

Subbarao Kambhampati, Karthik Valmeekam, Lin Guan, Mudit Verma, Kaya Stechly, Siddhant Bhambri, Lucas Saldyt, Anil Murthy

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Journal ref Proceedings of the 41 st International Conference on Machine Learning, Vienna, Austria. PMLR 235, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02143 2024-06-05 cs.CL cs.AI 88%

Competition-Level Problems are Effective LLM Evaluators

Yiming Huang, Zhenghao Lin, Xiao Liu, Yeyun Gong, Shuai Lu, Fangyu Lei, Yaobo Liang, Yelong Shen, Chen Lin, Nan Duan, Weizhu Chen

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01960 2024-04-23 cs.CL cs.AI 88%

Language Models as Knowledge Bases for Visual Word Sense Disambiguation

Anastasia Kritharoula, Maria Lymperaiou, Giorgos Stamou

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

Journal ref KBC-LM workshop@ ISWC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03480 2024-04-16 cs.RO cs.AI cs.CL 88%

Can an Embodied Agent Find Your "Cat-shaped Mug"? LLM-Guided Exploration for Zero-Shot Object Navigation

Vishnu Sashank Dorbala, James F. Mullen, Dinesh Manocha

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 10 pages

Journal ref IEEE Robotics and Automation Letters 9.5 (2024) 4083-4090

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17390 2024-04-09 cs.CL cs.AI 88%

Customizing Language Model Responses with Contrastive In-Context Learning

Xiang Gao, Kamalika Das

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

Comments Accepted to appear at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00246 2024-04-02 cs.CL cs.AI cs.HC 88%

Your Co-Workers Matter: Evaluating Collaborative Capabilities of Language Models in Blocks World

Guande Wu, Chen Zhao, Claudio Silva, He He

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);language agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08281 2024-03-27 cs.CL cs.AI 88%

Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models

Ning Ding, Yulin Chen, Ganqu Cui, Xingtai Lv, Weilin Zhao, Ruobing Xie, Bowen Zhou, Zhiyuan Liu, Maosong Sun

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08901 2024-02-16 cs.CL cs.AI 88%

Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning

Xijie Huang, Li Lyna Zhang, Kwang-Ting Cheng, Fan Yang, Mao Yang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15164 2024-02-15 cs.CL cs.AI 88%

LINC: A Neurosymbolic Approach for Logical Reasoning by Combining Language Models with First-Order Logic Provers

Theo X. Olausson, Alex Gu, Benjamin Lipkin, Cedegao E. Zhang, Armando Solar-Lezama, Joshua B. Tenenbaum, Roger Levy

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

Comments EMNLP Main 2023 (Outstanding Paper Award)

Journal ref Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, pages 5153-5176, Singapore. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13849 2024-01-26 cs.CL cs.AI 88%

TPD: Enhancing Student Language Model Reasoning via Principle Discovery and Guidance

Haorui Wang, Rongzhi Zhang, Yinghao Li, Lingkai Kong, Yuchen Zhuang, Xiusi Chen, Chao Zhang

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11556 2023-04-25 cs.CL cs.AI 88%

Divide and Prompt: Chain of Thought Prompting for Text-to-SQL

Xiping Liu, Zhao Tan

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10435 2023-01-30 cs.CL cs.AI 88%

PAL: Program-aided Language Models

Luyu Gao, Aman Madaan, Shuyan Zhou, Uri Alon, Pengfei Liu, Yiming Yang, Jamie Callan, Graham Neubig

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

Comments The first three authors contributed equally. Our code and data are publicly available at http://reasonwithpal.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26977 2026-07-30 cs.CL 新提交 88%

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包

Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。

Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22756 2026-04-28 cs.IR cs.AI 88%

Your Reviews Replicate You: LLM-Based Agents as Customer Digital Twins for Conjoint Analysis

你的评价复制你:基于大语言模型的代理作为联合分析的客户数字双胞胎

Bin Xuan, Jungmin Hwang, Hakyeon Lee

机构 * Department of Data Science(数据科学系) Seoul National University of Science and Technology(首尔科学技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型构建的客户数字双胞胎进行联合分析,通过聚合用户评论历史和检索增强生成技术,实现了高效准确的偏好预测,验证了其在市场研究中的可行性。

Comments 12 pages, 3 figures + This abstract introduces an LLM-based Customer Digital Twin framework that replaces human respondents in conjoint analysis with RAG-enhanced customer agents, validated at 87.73% accuracy on Reddit user data, and positions the contribution as a scalable alternative to traditional preference elicitation methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09008 2025-02-27 cs.CL 88%

SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction

Ling Yang, Zhaochen Yu, Tianjun Zhang, Minkai Xu, Joseph E. Gonzalez, Bin Cui, Shuicheng Yan

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments ICLR 2025. Project: https://github.com/YangLing0818/SuperCorrect-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-08-21 cs.CV 版本更新 88%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: https://github.com/Chikit-WONG/spatialGraph

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14026 2026-08-19 cs.CE 版本更新 88%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11461 2026-08-17 cs.RO 版本更新 88%

CoViLLM: An Adaptive Human-Robot Collaborative Assembly Framework Using Large Language Models

CoViLLM:一种利用大语言模型的自适应人机协作装配框架

Jiabao Zhao, Jonghan Lim, Hongliang Li, Ilya Kovalenko

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出CoViLLM框架,结合深度相机定位、人类操作员分类和大语言模型,实现定制化和新产品的自适应装配,通过NIST装配任务板验证,实验表明该框架提升了人机协作的灵活性。

Comments 6 pages, 7 figures. Accepted to ASME MSEC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12920 2026-08-14 cs.CV 新提交 88%

TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos

TennisVAR:一种基于击球证据的多模态大语言模型,用于网球视频中的战术推理

Yifan Mei, Qingling Shi, Changli Wu, Jiayuan Rao, Jiayi Ji, Liujuan Cao

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对网球视频理解的感知与理解差距,提出回合级战术推理任务,构建专家标注基准TRACE,开发基于证据的多模态大语言模型TennisVAR,实现网球视频的战术推理。

Comments Project Page: https://whynotgit2025.github.io/TennisVAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05822 2026-08-07 cs.SE 新提交 88%

Agent-Based Test Assertion Generation via Diverse Perspective Aggregation

基于智能体的多视角聚合测试断言生成

Dong Wang, Qiaoyu Han, Lin Yang, Jianyi Zhou, Guangtai Liang, Junjie Chen

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03291 2026-08-05 cs.LG cs.AI cs.CL 新提交 88%

The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics

可察觉的轨迹:利用思维链动态检测大语言模型中的推理失败

Shashwat Sourav, Aishwarya Balwani

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究利用思维链动态特性,在不假设语言化CoT语义忠实性的情况下,检测大语言模型在布尔可满足性任务中的分布式推理失败,并通过针对性提示干预提升了Llama3-70B的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12244 2026-08-04 cs.RO 版本更新 88%

Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks

任何房屋任何任务:为抽象人类任务的可扩展长周期规划

Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AHAT是一种优化长周期规划的家庭任务规划器,通过结合LLM和TGPO算法,在复杂家庭任务中实现高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏