arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2603.02669 2026-03-04 cs.RO 91%

IMR-LLM: Industrial Multi-Robot Task Planning and Program Generation using Large Language Models

IMR-LLM:基于大语言模型的工业多机器人任务规划与程序生成

Xiangyu Su, Juzhan Xu, Oliver van Kaick, Kai Xu, Ruizhen Hu

机构 * Shenzhen University(深圳大学) SpeedBot Robotics Co., Ltd.(SpeedBot机器人科技有限公司) Carleton University(卡尔顿大学) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 IMR-LLM通过大语言模型实现工业多机器人任务规划与程序生成,结合析取图和过程树,提出高效任务计划和可执行程序生成方法,并构建了多复杂度层次的IMR-Bench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10983 2026-01-19 cs.CY 91%

Evaluating 21st-Century Competencies in Postsecondary Curricula with Large Language Models: Performance Benchmarking and Reasoning-Based Prompting Strategies

利用大语言模型评估21世纪能力在高等教育课程中的表现:性能基准测试与基于推理的提示策略

Zhen Xu, Xin Guan, Chenxi Shi, Qinhao Chen, Renzhe Yu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 本研究利用大语言模型评估21世纪能力在高等教育课程中的表现,提出基于推理的提示策略提升课程分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05632 2026-01-12 eess.SY cs.SY 91%

LLM-DMD: Large Language Model-based Power System Dynamic Model Discovery

基于大语言模型的电力系统动态模型发现:LLM-DMD

Chao Shen, Zihan Guo, Ke Zuo, Wenqi Huang, Mingyang Sun

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 LLM-DMD通过结合大语言模型的推理和代码生成能力,利用两个循环发现电力系统动态方程并强制代数约束,从而实现高保真动态模型的构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01196 2026-01-06 cs.RO 91%

EduSim-LLM: An Educational Platform Integrating Large Language Models and Robotic Simulation for Beginners

EduSim-LLM: 一个整合大语言模型和机器人模拟的教育平台,用于初学者

Shenqi Lu, Liangwei Zhang

机构 * Hangzhou Dianzi University Information Engineering College(杭州电子科技大学信息工程学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 EduSim-LLM通过整合大语言模型与机器人模拟,实现自然语言到机器人行为的转换,提升初学者在人机交互和多机器人协作中的控制与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10394 2025-11-14 cs.CV 91%

LLM-YOLOMS: Large Language Model-based Semantic Interpretation and Fault Diagnosis for Wind Turbine Components

Yaru Li, Yanxue Wang, Meng Li, Xinming Li, Jianbo Feng

机构 * School of Mechanical-Electronic and Vehicle Engineering, Beijing University of Civil Engineering and Architecture(机械电子与车辆工程学院,北京建筑大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Journal resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14387 2025-08-21 cs.RO 91%

DEXTER-LLM: Dynamic and Explainable Coordination of Multi-Robot Systems in Unknown Environments via Large Language Models

Yuxiao Zhu, Junfeng Chen, Xintong Zhang, Meng Guo, Zhongkui Li

机构 * College of Engineering, Peking University(北京大学工程学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然科学与应用科学系)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments submitted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12728 2025-08-19 eess.SP 91%

LLM-RIMSA: Large Language Models driven Reconfigurable Intelligent Metasurface Antenna Systems

Yunsong Huang, Hui-Ming Wang, Qingli Yan, Zhaowei Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06519 2025-06-10 eess.SY cs.SY 91%

Hierarchical Debate-Based Large Language Model (LLM) for Complex Task Planning of 6G Network Management

Yuyan Lin, Hao Zhou, Chengming Hu, Xue Liu, Hao Chen, Yan Xin, Jianzhong, Zhang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24476 2025-06-02 cs.CV 91%

Period-LLM: Extending the Periodic Capability of Multimodal Large Language Model

Yuting Zhang, Hao Lu, Qingyong Hu, Yin Wang, Kaishen Yuan, Xin Liu, Kaishun Wu

机构 * The Hong Kong University of Science & Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science & Technology(香港科技大学) Zhejiang University(浙江大学) Lappeenranta-Lahti University of Technology(拉佩兰塔-拉赫蒂技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06513 2025-05-13 cs.RO 91%

LLM-Flock: Decentralized Multi-Robot Flocking via Large Language Models and Influence-Based Consensus

Peihan Li, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15505 2025-03-10 cs.RO 91%

Discovering Object Attributes by Prompting Large Language Models with Perception-Action APIs

Angelos Mavrogiannis, Dehao Yuan, Yiannis Aloimonos

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06419 2025-02-11 cs.RO 91%

Occ-LLM: Enhancing Autonomous Driving with Occupancy-Based Large Language Models

Tianshuo Xu, Hao Lu, Xu Yan, Yingjie Cai, Bingbing Liu, Yingcong Chen

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted in 2025 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21040 2024-10-29 cs.RO 91%

LiP-LLM: Integrating Linear Programming and dependency graph with Large Language Models for multi-robot task planning

Kazuma Obata, Tatsuya Aoki, Takato Horii, Tadahiro Taniguchi, Takayuki Nagai

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01202 2024-05-03 cs.SE cs.CR 91%

DLAP: A Deep Learning Augmented Large Language Model Prompting Framework for Software Vulnerability Detection

Yanjing Yang, Xin Zhou, Runfeng Mao, Jinwei Xu, Lanxin Yang, Yu Zhangm, Haifeng Shen, He Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18778 2024-03-28 cs.RO 91%

3P-LLM: Probabilistic Path Planning using Large Language Model for Autonomous Robot Navigation

Ehsan Latif

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Exploratory Study

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13655 2024-03-05 cs.CV 91%

LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models

Long Lian, Boyi Li, Adam Yala, Trevor Darrell

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Transactions on Machine Learning Research (TMLR) 2024, with Featured Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20034 2023-11-01 cs.RO 91%

GG-LLM: Geometrically Grounding Large Language Models for Zero-shot Human Activity Forecasting in Human-Aware Task Planning

Moritz A. Graule, Volkan Isler

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03653 2023-05-08 cs.IR 91%

Query Expansion by Prompting Large Language Models

Rolf Jagerman, Honglei Zhuang, Zhen Qin, Xuanhui Wang, Michael Bendersky

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12348 2026-08-17 cs.DB cs.AI 版本更新 91%

Can Large Language Models Reason about Event-Time Stream-Processing Semantics?

StreamReason-Bench:大型语言模型能否推理事件时间流处理语义?

Zhuoxi Wang, Shibo Zheng, Haoyu Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究构建了StreamReason-Bench基准测试,发现LLM在事件时间流处理语义推理任务上表现不佳,思维链可提升其性能,难点在于事件时间与延迟数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20520 2026-07-24 cs.AI cs.HC cs.PL 新提交 91%

Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving

数学问题解决中大型语言模型在可执行推理约束下的表示鲁棒性

Sagnik Nath, Edith Aurora Graf, Liang Zhang, Diego Zapata-Rivera

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究大型语言模型在数学问题解决中表示鲁棒性,通过改变问题表面表示评估五个模型,发现其对表示敏感,代码增强未统一提升鲁棒性,揭示了正确性等方面新权衡,强调表示应作为接口设计变量。

Comments presented at the 28th International Conference on Human-Computer Interaction (2026), Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24902 2026-06-25 cs.DL cs.AI 新提交 91%

Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

大语言模型在研究级数学问题上的失败模式:分类与实证刻画

Arnesh Banerjee, Ayushi Bhattacharjee

机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03818 2026-06-23 cs.CL 版本更新 91%

Empirical Prompt Engineering for Construct Identification with Large Language Models

改善人机编码对齐:心理学构念识别中提示工程的实证评估

Kylie L. Anglin, Stephanie Milan, Brittney Hernandez, Claudia Ventura

机构 * Department of Educational Psychology, Neag School of Education, University of Connecticut(教育心理学系,教育学院,康涅狄格大学) Department of Psychological Sciences, College of Liberal Arts and Sciences, University of Connecticut(心理学系,文理学院,康涅狄格大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究提出一个实证框架,通过提示工程优化大语言模型在心理学文本中识别构念的性能。实验评估五种提示策略,发现构念定义和任务框架最关键,结合代码簿引导和自动提示工程的少样本方法最接近专家判断。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17312 2026-06-17 cs.AI 新提交 91%

Quantifying Consistency in LLM Logical Reasoning via Structural Uncertainty

通过结构不确定性量化LLM逻辑推理中的一致性

Baishali Chaudhury, Mengdie Flora Wang, Hyunji Hayley Park, Rahul Ghosh, Sungmin Hong, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 提出结构不确定性框架,通过自偏好排序的稳定性评估LLM推理一致性,在逻辑和数学任务中与答案分散度互补,提升不可靠实例识别。

Comments Published at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. Accepted as best paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09484 2026-06-09 cs.CL 新提交 91%

Detecting Differences Is Not Understanding Structure: Large Language Models Fail at Graph Isomorphism

检测差异不等于理解结构:大型语言模型在图同构任务中失败

Kumar Thushalika, Sukumar Kishanthan, Asela Hevapathige

机构 * University of Ruhuna(鲁胡纳大学) University of Moratuwa(莫拉图瓦大学) University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本研究通过图同构检测任务揭示LLM的“虚假成功”:虽然LLM在检测同构时准确率接近完美,但面对节点标签置换的相同图时却无法识别,表明其依赖模式而非抽象结构推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03858 2026-06-03 cs.AI 91%

PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models

PyraMathBench: 评估与提升大型语言模型的数学能力

Zetian Ouyang, Linlin Wang, Gerard de Melo, Liang He

机构 * East China Normal University(东华师范大学) Hasso Plattner Institute, University of Potsdam(波茨坦大学哈索普兰特纳研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出PyraMathBench分层基准测试,通过整合数值处理与数学推理评估LLM,并引入SOLVE模块和IRPO优化方法提升数值-数学协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10398 2026-05-29 cs.CE cs.AI 91%

Are LLMs Socially Adaptive? Contrasting Belief Evolution in Large Language Models and Humans

大型语言模型是否具有社会适应性?对比大型语言模型与人类的信念演化

Yu Lei, Hao Liu, Chengxing Xie, Songjia Liu, Zhiyu Yin, Canyu Chen, Guohao Li, Philip Torr, Zhen Wu

机构 * Tsinghua University(清华大学) Department of Psychological and Cognitive Sciences(心理与认知科学系) College AI(人工智能学院) School of Management(管理学院) Fudan University(复旦大学) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究提出基于社会心理学的仿真基准FairMindSim和信念-奖励对齐行为演化模型BREM,通过连续经济游戏对比人类与LLM的决策动态,发现中等能力模型表现出过度惩罚的刚性攻击性,而前沿模型随推理能力提升趋向人类式的克制与宽容。

Comments KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24050 2026-05-26 cs.LG 91%

Bridging On-Device and Cloud LLMs for Collaborative Reasoning: A Unified Methodology for Local Routing and Post-Training

桥接设备端与云端大语言模型实现协作推理:本地路由与后训练的统一方法

Wenzhi Fang, Dong-Jun Han, Liangqi Yuan, Evan Chen, Christopher Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出通过强化学习后训练使设备端LLM内部决定是否调用云端,结合分层奖励和自适应提示过滤,显著缩小与纯云端LLM的性能差距。

Comments We propose a unified post-training framework that integrates routing optimization, enabling the on-device LLM to improve its problem-solving ability while learning routing strategies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22238 2026-05-22 cs.AI 91%

Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play

评估大型语言模型作为实时战略代理:提供商性能、混合分解及时间风险游戏中的操作差距

H. C. Ekne

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文研究了大型语言模型在实时策略环境中的表现,发现其性能受目标跟踪、执行转换、成本和运行时可靠性等因素影响,支持将LLM作为受限制工作流中的组件进行评估,而非孤立的基准测试对象。

Comments 13 pages, 7 figures. Code and tracked notes: https://github.com/hcekne/risk-game . Public runtime artifact index: https://github.com/hcekne/risk-game/blob/main/docs/article-plans/public_experiment_artifacts.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14004 2026-05-19 cs.CL 91%

Early Stopping Chain-of-thoughts in Large Language Models

大语言模型中的早期停止思维链

Minjia Mao, Bowen Yin, Yu Zhu, Xiao Fang

机构 * University of Delaware(德克萨斯大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出了一种在推理阶段减少思维链生成长度的方法ES-CoT,通过检测答案收敛并提前停止来降低推理成本,同时保持与标准思维链相当的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10825 2026-05-19 cs.AI 91%

CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms

CheeseBench:在啮齿类行为神经科学范式上评估大语言模型

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 CheeseBench通过九种经典行为神经科学范式评估大语言模型,发现模型规模、上下文历史、提示方式和架构对性能有显著影响,且当前模型在空间导航等任务上仍低于啮齿类动物基准。

Comments 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏