arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-12 至 2025-12-12 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 26 篇

2512.10080 2025-12-12 cs.CL cs.AI 91%

What Kind of Reasoning (if any) is an LLM actually doing? On the Stochastic Nature and Abductive Appearance of Large Language Models

LLM 实际上在进行何种推理(如果有的话)?关于大语言模型的随机性质及其类比于人类假设推理的性质

Luciano Floridi, Jessica Morley, Claudio Novelli, David Watson

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型的推理机制,指出其生成文本基于学习模式而非真实推理,且其看似假设推理的特性源于训练数据,而非实际推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16989 2025-12-12 cs.LG 89%

Unveiling the Latent Directions of Reflection in Large Language Models

揭示大型语言模型中反思的潜在方向

Fu-Chieh Chang, Yu-Ting Lee, Pei-Yuan Wu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文通过分析模型激活中的潜在方向,揭示了大型语言模型中反思机制的可控性及不同反思层次的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08694 2025-12-12 cs.CL 89%

TP-RAG: Benchmarking Retrieval-Augmented Large Language Model Agents for Spatiotemporal-Aware Travel Planning

TP-RAG:用于时空感知旅行规划的检索增强型大语言模型代理基准测试

Hang Ni, Fan Liu, Xinyu Ma, Lixin Su, Shuaiqiang Wang, Dawei Yin, Hui Xiong, Hao Liu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 TP-RAG提出了一种用于时空感知旅行规划的检索增强型大语言模型基准测试,通过整合参考轨迹提升旅行计划的空间效率和兴趣点合理性,采用EvoRAG框架实现更高效的时空合规性。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21051 2025-12-12 cs.CR cs.AI cs.NI 89%

Toward Intelligent and Secure Cloud: Large Language Model Empowered Proactive Defense

迈向智能和安全的云:大型语言模型赋能的主动防御

Yuyang Zhou, Guang Cheng, Kang Du, Zihan Chen, Yuyu Zhao

机构 * School of Cyber Science and Engineering, Southeast University, Purple Mountain Laboratories, and Jiangsu Province Engineering Research Center of Security for Ubiquitous Network(网络安全学院、东南大学、紫山实验室以及江苏省物联网安全工程技术研究中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出LLM-PD,一种基于大型语言模型的主动防御架构,用于有效应对云网络中的DoS攻击,通过数据分析和自我进化提升防御效率。

Comments 7 pages; Accepted by IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06392 2025-12-12 cs.LG cs.AI 88%

RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs

RLAX:在TPUs上为大语言模型实现大规模分布式强化学习

Runlong Zhou, Lefan Zhang, Shang-Chen Wu, Kelvin Zou, Hanzhi Zhou, Ke Ye, Yihao Feng, Dong Yin, Alex Guillen Garcia, Dmytro Babych, Rohit Chatterjee, Matthew Hopkins, Xiang Kong, Chang Lan, Lezhi Li, Yiping Ma, Daniele Molinari, Senyu Tong, Yanchao Sun, Thomas Voice, Jianyu Wang, Chong Wang, Simon Wang, Floris Weers, Yechen Xu, Guolin Yin, Muyang Yu, Yi Zhang, Zheng Zhou, Danyang Zhuo, Ruoming Pang, Cheng Leong

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 RLAX在TPUs上实现大规模分布式强化学习,通过参数服务器架构和新数据集筛选技术,提升大语言模型的推理能力。

Comments The submission is being withdrawn because internal stakeholders determined that it is not appropriate to publish work on this topic at this time

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10273 2025-12-12 cs.AI 88%

Reverse Thinking Enhances Missing Information Detection in Large Language Models

逆向思维增强大语言模型中缺失信息检测能力

Yuxin Liu, Chaojie Gu, Yihang Zhang, Bin Qian, Shibo He

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出逆向思维框架,通过引导LLM进行逆向推理来提升缺失信息检测的准确性与鲁棒性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10440 2025-12-12 cs.CL 83%

Enhancing Next-Generation Language Models with Knowledge Graphs: Extending Claude, Mistral IA, and GPT-4 via KG-BERT

通过知识图谱增强下一代语言模型:通过KG-BERT扩展Claude、Mistral IA和GPT-4

Nour El Houda Ben Chaabene, Hamza Hammami

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) National Engineering School of Tunis(突尼斯国家工程学院) Faculty of Sciences of Tunis(突尼斯科学学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 通过KG-BERT将知识图谱与Claude、Mistral IA和GPT-4结合,提升其事实可靠性与上下文感知能力。

Comments This paper was accepted and scheduled for inclusion in the ICALT 2025 proceedings but was ultimately not published due to absence from the conference presentation. It appears in the official program booklet. Conference: 2025 IEEE International Conference on Advanced Learning Technologies (ICALT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19942 2025-12-12 cs.LG 83%

Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning

微分平滑缓解锐化并提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Huaqing Zhang, Aditi Raghunathan

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 微分平滑通过缓解RL微调中的锐化问题,提升大语言模型的推理能力和输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10300 2025-12-12 cs.AI 79%

Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules

探讨视觉语言模型中注意力头的功能作用:推理模块的证据

Yanbei Jiang, Xueqi Ma, Shu Liu, Sarah Monazam Erfani, Tongliang Liu, James Bailey, Jey Han Lau, Krista A. Ehinger

机构 * The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文通过CogVision数据集探讨视觉语言模型中注意力头的功能作用,揭示其在多模态推理中的关键作用及分布特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07702 2025-12-12 cs.CV cs.AI 79%

Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment

引导不应生成的内容:用于文本-图像对齐的自动化负提示

Sangha Park, Eunji Kim, Yeongtak Oh, Jooyoung Choi, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Amazon(亚马逊) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(IPAI、AIIS、ASRI、INMC 和 ISRC,首尔国立大学)

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI

AI总结 本文提出NPC方法,通过自动化负提示生成提升文本-图像对齐效果,在GenEval++和Imagine-Bench上取得优异成绩。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10121 2025-12-12 cs.CL cs.AI cs.CY q-fin.GN 79%

Workflow is All You Need: Escaping the "Statistical Smoothing Trap" via High-Entropy Information Foraging and Adversarial Pacing

流程即一切:通过高熵信息觅食和对抗性节奏控制摆脱'统计平滑陷阱

Zhongjie Jiang

机构 * Zhongjie Jiang(江宗杰)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DeepNews框架,通过高熵信息觅食和对抗性节奏控制,解决LLMs在长文本生成中的幻觉、逻辑一致性和个性化表达难题,实验显示其在金融报道中表现优异。

Comments 22 pages, 8 figures. Includes an ecological validity blind test where the Agentic Workflow achieved a 25% acceptance rate in top-tier media, decisively outperforming the SOTA Zero-shot baseline (0%). Features the DNFO-v5 ontology

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10610 2025-12-12 cs.MA 78%

Thinking While Driving: A Concurrent Framework for Real-Time, LLM-Based Adaptive Routing

驾驶中思考:一种用于实时、基于大语言模型的自适应路由的并发框架

Xiaopei Tan, Muyang Fan

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 该研究提出了一种基于大语言模型的实时自适应路由框架,通过并发处理实现动态路径规划与拥堵绕行,提升交通效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19486 2025-12-12 eess.SY cs.LG cs.MA cs.SY 77%

VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture

VLMLight:通过视觉-语言元控制与双分支推理架构实现安全关键的交通信号控制

Maonan Wang, Yirong Chen, Aoyu Pang, Yuxin Cai, Chung Shue Chen, Yuheng Kan, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nokia Bell Labs(诺基亚贝尔实验室) Fourier Intelligence(Fourier智能)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 VLMLight通过视觉-语言元控制与双分支推理架构,实现安全关键的交通信号控制,显著减少紧急车辆等待时间并提升系统安全性。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15257 2025-12-12 cs.CL 77%

When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners

当语言更少时更有效:语言推理解耦使LLM成为更好的多语言推理者

Weixiang Zhao, Jiahe Guo, Yang Deng, Tongtong Wu, Wenxuan Zhang, Yulin Hu, Xingyu Sui, Yanyan Zhao, Wanxiang Che, Bing Qin, Tat-Seng Chua, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理学院) Monash University(墨尔本大学) Singapore University of Technology and Design(新加坡科技设计大学) National University of Singapore(国立新加坡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 通过解耦语言和推理能力,使LLM在多语言推理中表现更优,无需额外训练开销。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10756 2025-12-12 cs.CL cs.LG 73%

OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification

基于结果的过程验证器OPV用于高效长链式推理验证

Zijian Wu, Lingkai Kong, Wenwei Zhang, Songyang Gao, Yuzhe Gu, Zhongrui Cai, Tianyou Ma, Yuhong Liu, Zhi Wang, Runyuan Ma, Guangyu Wang, Wei Li, Conghui He, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学机器学习实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 OPV通过基于结果的过程验证方法,实现对长链式推理的高效准确验证,提升大规模注释效率并优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10561 2025-12-12 cs.CL cs.LG 73%

Causal Reasoning Favors Encoders: On The Limits of Decoder-Only Models

因果推理更青睐编码器:关于解码器-only模型极限的探讨

Amartya Roy, Elamparithy M, Kripabandhu Ghosh, Ponnurangam Kumaraguru, Adrian de Wynter

机构 * SIRE, IIT Delhi(IIT德里SIRE) Robert Bosch GmbH, India(印度罗伯特博世集团) IIIT Hyderabad(海得拉巴IIIT) IISER Kolkata(科钦IISER) Microsoft and the University of York(微软和约克大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了因果推理中编码器和编码器-解码器架构相较于仅解码器模型的优势,发现前者在多跳联合推理和分布偏移鲁棒性方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09935 2025-12-12 cs.AI cs.LG 73%

Exploring Health Misinformation Detection with Multi-Agent Debate

探索多智能体辩论中的健康 misinformation 检测

Chih-Han Chen, Chen-Han Tsai, Yu-Shao Peng

机构 * National Taiwan University(台湾国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种两阶段框架,通过多智能体辩论与自动化评分结合,提升健康虚假信息检测的准确性与说服力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10702 2025-12-12 cs.AI 70%

COMPARE: Clinical Optimization with Modular Planning and Assessment via RAG-Enhanced AI-OCT: Superior Decision Support for Percutaneous Coronary Intervention Compared to ChatGPT-5 and Junior Operators

COMPARE: 通过RAG增强的AI-OCT实现临床优化:与ChatGPT-5和初级操作者相比,为经皮冠状动脉介入术提供更优的决策支持

Wei Fang, Chiyao Wang, Wenshuai Ma, Hui Liu, Jianqiang Hu, Xiaona Niu, Yi Chu, Mingming Zhang, Jingxiao Yang, Dongwei Zhang, Zelin Li, Pengyun Liu, Jiawei Zheng, Pengke Zhang, Chaoshi Qin, Wangang Guo, Bin Wang, Yugang Xue, Wei Zhang, Zikuan Wang, Rui Zhu, Yihui Cao, Quanmao Lu, Rui Meng, Yan Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CA-GPT通过RAG增强的AI-OCT系统在PCI规划和评估中优于ChatGPT-5和初级医生,提供更可靠的决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09443 2025-12-12 cs.HC cs.AI math.OC 70%

Advancing Mathematical Research via Human-AI Interactive Theorem Proving

通过人机交互定理证明推进数学研究

Chenyi Li, Zhijian Lai, Dong An, Jiang Hu, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Yau Mathematical Sciences Center, Tsinghua University(清华大学尤伊数学科学中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种人机交互的定理证明流程,利用大语言模型辅助数学研究,通过案例研究展示其在流形优化与Grover算法间连接的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04629 2025-12-12 cs.AI 70%

BioMedGPT-Mol: Multi-task Learning for Molecular Understanding and Generation

BioMedGPT-Mol: 用于分子理解和生成的多任务学习

Chenyang Zuo, Siqi Fan, Zaiqing Nie

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) PharMolix Inc.(PharMolix公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BioMedGPT-Mol通过多任务学习方法,实现了分子理解和生成任务的高效建模,并在 retrosynthetic 计划中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19286 2025-12-12 cs.CL 70%

TheMCPCompany: Creating General-purpose Agents with Task-specific Tools

TheMCPCompany:创建通用代理的专用工具

Reza Esfandiarpoor, Vishwas Suryanarayanan, Stephen H. Bach, Vishal Chowdhary, Anthony Aue

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TheMCPCompany通过评估工具调用代理在现实世界服务交互中的表现,揭示了当前模型在复杂任务中的挑战。

Comments Code: https://github.com/Reza-esfandiarpoor/the-mcp-company

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10927 2025-12-12 cs.CV 67%

FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos

FoundationMotion: 自动标注与视频中空间运动的推理

Yulu Gan, Ligeng Zhu, Dandan Shan, Baifeng Shi, Hongxu Yin, Boris Ivanovic, Song Han, Trevor Darrell, Jitendra Malik, Marco Pavone, Boyi Li

机构 * MIT(麻省理工学院) NVIDIA(英伟达) UMich(密歇根大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 FoundationMotion通过自动数据整理管道生成大规模细粒度运动数据集,提升开源模型在运动理解与空间推理任务中的性能。

Comments Code is available at https://github.com/Wolfv0/FoundationMotion/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16203 2025-12-12 cs.CV cs.AI 57%

When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models

当对齐失败时:针对视觉-语言-动作模型的多模态对抗攻击

Yuping Yan, Yuhan Xie, Yixin Zhang, Lingjuan Lyu, Handing Wang, Yaochu Jin

机构 * TGAI Lab, School of Engineering, Westlake University(西拉库大学工程学院TGAI实验室) Pennsylvania State University(宾夕法尼亚州立大学) Sony Research, Sony(索尼研究实验室,索尼) Xidian University(西安电子科技大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文提出VLA-Fool,针对视觉-语言-动作模型的多模态对抗攻击,揭示其在白盒和黑盒环境下具身多模态对齐的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13886 2025-12-12 cs.CL 57%

Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning

Game-RL: 合成多模态可验证游戏数据以提升VLMs的通用推理能力

Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song, Jiahao Zhan, Yuyang Lu, Chaoran Tao, Zhiyuan Guo, Jizhou Yu, Tianhao Cheng, Zhiheng Xi, Changhao Jiang, Zhangyue Yin, Yining Zheng, Weifeng Ge, Guanhua Chen, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 Game-RL通过合成多模态可验证游戏数据提升VLMs的通用推理能力。

Comments 69 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10238 2025-12-12 cs.SE 50%

Studying and Automating Issue Resolution for Software Quality

研究和自动化软件质量的问题解决

Antu Saha

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本研究通过提升issue报告质量、表征开发者工作流程和自动化解决任务,推动AI驱动的issue解决,提升软件质量。

Comments 3 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10125 2025-12-12 econ.TH 50%

Motivated Reasoning and Information Aggregation

动机性推理与信息聚合

Avidit Acharya, Kyungtae Park, Tomer Zaidman

专题命中 推理与问题求解 :SLM(abstract)

AI总结 本文研究了动机性推理对信息聚合的影响,发现其在不同设定中对福利和信息聚合有不同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏