arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-29 至 2025-12-29 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 27 篇

2512.21902 2025-12-29 cs.CL 89%

Explainable Statute Prediction via Attention-based Model and LLM Prompting

基于注意力模型和大语言模型提示的可解释法规预测

Sachin Pawar, Girish Keshav Palshikar, Anindita Sinha Banerjee, Nitin Ramrakhiyani, Basit Ali

机构 * TCS Research(TCS研究)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于注意力模型和大语言模型提示的法规预测方法,通过生成可解释的预测结果提升法律AI系统的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21837 2025-12-29 cs.CL 89%

Knowledge Reasoning of Large Language Models Integrating Graph-Structured Information for Pest and Disease Control in Tobacco

基于图结构信息的大型语言模型知识推理用于烟草害虫和疾病控制

Siyu Li, Chenwei Song, Wan Zhou, Xinyi Liu

机构 * School of Information Science and Engineering(信息科学与工程学院) Chongqing Jiaotong University(重庆交通大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出一种整合图结构信息的大型语言模型,用于提升烟草害虫和疾病控制的知识推理能力,通过构建领域知识图并结合图神经网络实现更准确的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18033 2025-12-29 cs.RO cs.AI 88%

OpenNav: Open-World Navigation with Multimodal Large Language Models

OpenNav: 基于多模态大语言模型的开放世界导航

Mingfeng Yuan, Letian Wang, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) University of Toronto Robotics Institute(多伦多大学机器人研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18190 2025-12-29 cs.AI cs.CL cs.LG 88%

External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning

外部海马体:用于引导大语言模型推理的拓扑认知图

Jian Yan

机构 * School of Computer Science, Zunyi Normal University(计算机科学学院,遵义师范学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出External Hippocampus框架,通过拓扑认知图引导大语言模型推理,解决多步推理中的认知死锁问题,提升推理效率和准确性。

Comments 12 pages, 7 figures. v3: replaces v2 (uploaded in error); updated to two-column format; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13143 2025-12-29 cs.CY 88%

Auditing Meta-Cognitive Hallucinations in Reasoning Large Language Models

审查推理大型语言模型中的元认知幻觉

Haolang Lu, Yilian Liu, Jingxin Xu, Guoshun Nan, Yuanlong Yu, Zhican Chen, Kun Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过审查推理链轨迹,揭示了大型语言模型在长推理过程中如何通过错误反思强化偏见,提出黑盒审查方法以更有效地检测和归因幻觉问题。

Comments Accepted by NeurIPS 2025 (37 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21404 2025-12-29 cs.CR cs.AI 85%

LLM-Driven Feature-Level Adversarial Attacks on Android Malware Detectors

基于大语言模型的Android恶意软件检测器特征级对抗攻击

Tianwei Lan, Farid Naït-Abdesselam

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LAMLAD框架,利用大语言模型生成特征扰动以对抗恶意软件检测器,实验显示攻击成功率高达97%,并提出对抗训练防御策略提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12717 2025-12-29 cs.CL 83%

ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving

ToTRL: 通过解谜游戏解锁大语言模型树状思维推理潜力

Haoyuan Wu, Xueyi Chen, Rui Ming, Jilong Gao, Shoubo Hu, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab(Noah's Ark Lab) Huawei(华为) ChatEDA Tech(ChatEDA科技)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ToTRL通过解谜游戏训练,提升大语言模型的树状思维推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21855 2025-12-29 cs.AI cs.CL cs.LG cs.MA 80%

SIGN: Schema-Induced Games for Naming

SIGN:基于模式的命名游戏

Ryan Zhang, Herbert Woisetschläger

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SIGN通过引入轻量结构引导惯例形成,提升了多代理协调效率,其在命名游戏中展示了更高的收敛速度和一致性。

Comments AAAI 2026 Student Abstract (Oral). Code available ar https://github.com/ryanzhangofficial/schema-induced-games-for-naming

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21723 2025-12-29 cs.RO cs.AI cs.LG 79%

HELP: Hierarchical Embodied Language Planner for Household Tasks

家庭任务的分层具身语言规划器HELP

Alexandr V. Korchemnyi, Anatoly O. Onishchenko, Eva A. Bakaeva, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HELP通过分层结构的LLM智能体解决家庭任务中的复杂规划问题,结合自然语言处理与具身智能,实现高效任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19864 2025-12-29 cs.CL cs.AI 79%

HARMON-E: Hierarchical Agentic Reasoning for Multimodal Oncology Notes to Extract Structured Data

HARMON-E:多模态肿瘤病历的分层代理推理以提取结构化数据

Shashi Kant Gupta, Arijeet Pramanik, Jerrin John Thomas, Regina Schwind, Lauren Wiener, Avi Raju, Jeremy Kornbluth, Yanshan Wang, Zhaohui Su, Hrituraj Singh

机构 * Triomics University of Pittsburgh(匹兹堡大学) Ontada

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HARMON-E通过分层代理推理框架,实现对多模态肿瘤病历的结构化数据提取,达到高精度和大规模应用。

Comments 39 Pages, Supplementary Included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20312 2025-12-29 cs.LG cs.AI 79%

TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning

TableGPT-R1: 通过强化学习推进表格推理

Saisai Yang, Qingyi Huang, Jing Yuan, Liangyu Zha, Kai Tang, Yuhang Yang, Ning Wang, Yucheng Wei, Liyao Li, Wentao Ye, Hao Chen, Tao Zhang, Junlin Zhou, Haobo Wang, Gang Chen, Junbo Zhao

机构 * Zhejiang University Institute of Computing Innovation(浙江大学计算创新研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 TableGPT-R1通过强化学习框架提升表格推理能力,整合数据工程、奖励系统和多阶段训练框架,实现复杂表格任务的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19855 2025-12-29 cs.LG cs.HC 77%

Inducing Causal World Models in LLMs for Zero-Shot Physical Reasoning

在LLM中诱导因果世界模型以实现零样本物理推理

Aditya Sharma, Ananya Gupta, Chengyu Wang, Chiamaka Adebayo, Jakub Kowalski

机构 * Department of Electrical Engineering(电气工程系) Indian Institute of Technology Bombay(印度理工学院孟买分校) Department of Computer Science and Automation(计算机科学与自动化系) Indian Institute of Science(印度科学研究所) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) University of Lagos(拉各斯大学) Faculty of Mathematics, Informatics, and Mechanics(数学、信息学与力学学院) University of Warsaw(华沙大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CWMI框架,通过引入因果物理模块和因果干预损失,使LLM具备因果推理能力,在零样本物理推理任务中取得显著成效。

Comments 12 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21699 2025-12-29 cs.AI 77%

Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning

迈向负责任和可解释的AI代理:基于共识驱动的推理

Eranga Bandara, Tharaka Hewa, Ross Gore, Sachin Shetty, Ravi Mukkamala, Peter Foytik, Abdul Rahman, Safdar H. Bouk, Xueping Liang, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University, Norfolk, VA, USA(老奥本大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Florida International University, USA(佛罗里达国际大学) Nanyang Technological University, Singapore(南洋理工大学) University of Colombo, Sri Lanka(科伦坡大学) Accenture Technology Labs, Arlington, VA, USA(Accenture技术实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模型共识和推理层治理的负责任和可解释的AI代理架构,通过结构化整合不同模型的输出以提升系统鲁棒性、透明度和责任性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05622 2025-12-29 cs.RO cs.AI 77%

CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory

CityNavAgent:基于层次语义规划和全局记忆的空中视觉-语言导航

Weichen Zhang, Chen Gao, Shiquan Yu, Ruiying Peng, Baining Zhao, Qian Zhang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CityNavAgent通过层次语义规划和全局记忆模块,提升空中视觉-语言导航在复杂城市环境中的导航性能。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20458 2025-12-29 cs.IR 75%

Laser: Governing Long-Horizon Agentic Search via Structured Protocol and Context Register

激光:通过结构化协议和上下文寄存器治理长 horizon 的代理搜索

Shuting Wang, Qiaolin Xia, Vich Wang, Herberttli, Bobsimons, Zhicheng Dou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Laser通过结构化协议和上下文寄存器稳定并扩展代理搜索,提升多跳问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18286 2025-12-29 cs.CV 75%

RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System

RoadSceneVQA: 用于智能交通系统 roadside 系统的视觉问答基准测试

Runwei Guan, Rongsheng Hu, Shangshu Chen, Ningyuan Xiao, Xue Xia, Jiayang Liu, Beibei Chen, Ziren Tang, Ningwei Ouyang, Shaofeng Liang, Yuxuan Fan, Wanjie Sun, Yutao Yue

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 RoadSceneVQA 通过大规模标注数据和 CogniAnchor 融合模块,提升多模态大语言模型在交通感知与推理任务中的性能。

Comments 10 pages, 6 figures, accepted by AAAI 2026. The model is also called Dream, to the other me in the world forever

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21481 2025-12-29 cs.MA 75%

The AI Committee: A Multi-Agent Framework for Automated Validation and Remediation of Web-Sourced Data

AI委员会:一种多智能体框架,用于自动验证和修复网络来源的数据

Sunith Vallabhaneni, Thomas Berkane, Maimuna Majumder

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AI委员会是一种多智能体框架,通过自动化验证和修复网络数据集,提升数据质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18848 2025-12-29 cs.CL cs.AI cs.LG stat.ME 75%

A Causal Lens for Evaluating Faithfulness Metrics

一种评估忠实度度量的因果视角

Kerem Zaman, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出因果诊断性框架,用于评估自然语言解释的忠实度度量,通过生成忠实-不忠实解释对,发现Filler Tokens在多任务中表现最佳,连续度量更优但易受噪声影响。

Comments Published at EMNLP 2025; 25 pages, 22 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21711 2025-12-29 cs.CL cs.AI 73%

Do Latent Tokens Think? A Causal and Adversarial Analysis of Chain-of-Continuous-Thought

潜在标记是否思考?对连续思维链的因果和对抗分析

Yuyi Zhang, Boyu Tang, Tianjie Ju, Sufeng Duan, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过因果和对抗分析揭示COCONUT作为伪推理机制的问题,指出其依赖捷径而非真实推理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09109 2025-12-29 cs.CL cs.AI cs.IR 73%

Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning

正向与反向思考:用于检索增强推理的多目标强化学习

Wenda Wei, Yu-An Liu, Ruqing Zhang, Jiafeng Guo, Lixin Su, Shuaiqiang Wang, Dawei Yin, Maarten de Rijke, Xueqi Cheng

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Bi-RAR通过双向信息距离和多目标强化学习框架,提升检索增强推理在复杂多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01470 2025-12-29 cs.CL 70%

BARD: budget-aware reasoning distillation

BARD: 带预算意识的推理蒸馏

Lujie Niu, Lei Shen, Yi Jiang, Caixia Yuan, Xiaojie Wang, Wenbo Su, Bo zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.CL

AI总结 BARD通过两阶段训练实现推理能力蒸馏与预算控制,使模型在不同预算下高效完成推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06259 2025-12-29 cs.CV cs.AI 70%

SIFThinker: Spatially-Aware Image Focus for Visual Reasoning

SIFThinker: 基于空间的图像聚焦用于视觉推理

Zhangquan Chen, Ruihui Zhao, Chuwei Luo, Mingze Sun, Xinlei Yu, Yangyang Kang, Ruqi Huang

机构 * ByteDance(字节跳动)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SIFThinker通过结合深度增强的边界框和自然语言,提升视觉推理中的空间理解和细粒度感知能力。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04440 2025-12-29 cs.CL cs.AI cs.LG 67%

StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion

StepFun-Formalizer: 通过知识推理融合解锁大语言模型的自动形式化潜力

Yutong Wu, Di Huang, Ruosi Wan, Yue Peng, Shijie Shang, Chenrui Cao, Lei Qi, Rui Zhang, Zidong Du, Jie Yan, Xing Hu

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 StepFun-Formalizer通过知识推理融合提升大语言模型的自动形式化能力,在FormalMATH-Lite和ProverBench上取得最佳成绩。

Comments AAAI 2026 Oral. Extended version with full appendix, 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21613 2025-12-29 cs.AI 57%

AMS-IO-Bench and AMS-IO-Agent: Benchmarking and Structured Reasoning for Analog and Mixed-Signal Integrated Circuit Input/Output Design

AMS-IO-Bench 和 AMS-IO-Agent:用于模拟和混合信号集成电路输入/输出设计的基准测试与结构化推理

Zhishuai Zhang, Xintian Li, Shilong Liu, Aodong Zhang, Lu Jie, Nan Sun

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出 AMS-IO-Agent 和 AMS-IO-Bench,通过结构化推理提升模拟和混合信号集成电路输入/输出设计效率,实现高通过率和缩短设计周期。

Comments 8 pages, 5 figures. Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21431 2025-12-29 cs.SE cs.LG 57%

Cerberus: Multi-Agent Reasoning and Coverage-Guided Exploration for Static Detection of Runtime Errors

Cerberus:多智能体推理与覆盖引导探索用于运行时错误的静态检测

Hridya Dhulipala, Xiaokai Rong, Tien N. Nguyen

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG

AI总结 Cerberus通过多智能体推理和覆盖引导探索,实现无执行的运行时错误静态检测,提高测试效率和错误发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21722 2025-12-29 cs.RO 50%

MAction-SocialNav: Multi-Action Socially Compliant Navigation via Reasoning-enhanced Prompt Tuning

MAction-SocialNav: 通过推理增强的提示调优实现多动作社交合规导航

Zishuo Wang, Xinyu Zhang, Zhuonan Liu, Tomohito Kawabata, Daeun Song, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学) Graduate School of Computer Science, George Mason University(计算机科学研究生院,乔治·梅森大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 MAction-SocialNav通过推理增强的提示调优实现多动作社交合规导航,提升决策质量与安全性,效率高于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21560 2025-12-29 cs.CV 50%

Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration

迈向智能场景增强以实现情境感知的对象放置和赞助商-标志集成

Unnati Saraswat, Tarun Rao, Namah Gupta, Shweta Swami, Shikhar Sharma, Prateek Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science(巴里尔理工学院和科学研究院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出两个新任务:情境感知的对象插入和赞助商-产品标志增强,并构建了相应数据集以支持这些任务。

详情

展开后加载摘要…

URL PDF HTML 收藏