arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-05 至 2025-12-05 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 23 篇

2506.05901 2025-12-05 cs.CL cs.AI 90%

Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router

路由与推理:通过强化模型路由扩展大语言模型推理

Chenyang Shao, Xinyang Liu, Yutang Lin, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) BNRist, Tsinghua University(清华大学BNRist)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 R2-Reasoner通过强化模型路由器实现高效的大语言模型推理扩展,减少API成本并保持推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04748 2025-12-05 cs.CL 89%

Model Whisper: Steering Vectors Unlock Large Language Models' Potential in Test-time

模型Whisper:引导向量解锁大型语言模型在测试时的潜力

Xinyue Kang, Diwei Shi, Li Chen

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Model Whisper通过轻量级引导向量在测试时提升大型语言模型的推理能力,实现高效且稳定的性能提升。

Comments accepted to aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01926 2025-12-05 cs.AI cs.CL cs.LG 89%

Large language models can learn and generalize steganographic chain-of-thought under process supervision

大语言模型可以在过程监督下学习和泛化隐写链式思维

Joey Skaf, Luis Ibanez-Lissen, Robert McCarthy, Connor Watts, Vasil Georgiv, Hannes Whittingham, Lorena Gonzalez-Manzano, David Lindner, Cameron Tice, Edward James Young, Puria Radmard

机构 * Mentorship for Alignment Research Students (MARS)(对齐研究 mentorship 项目) University College London(伦敦大学学院) Queen Mary University of London(伦敦女王学院) ML Alignment & Theory Scholars (MATS)(对齐与理论学者) Meridian Impact, Cambridge(剑桥 Meridian Impact) Universidad Carlos III de Madrid(马德里卡洛斯三世大学) Geodesic Research and University of Cambridge(Geodesic Research 和剑桥大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 大语言模型在过程监督下能够学习并泛化隐写链式思维,通过替换特定字符串实现推理编码,提升监控可靠性。

Comments 10 pages main text, 3 figures main text, 17 pages supplementary material, 1 figure supplementary material, accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04513 2025-12-05 cs.AI 88%

BiTAgent: A Task-Aware Modular Framework for Bidirectional Coupling between Multimodal Large Language Models and World Models

BiTAgent: 一种面向任务的模块化框架,用于多模态大语言模型与世界模型之间的双向耦合

Yu-Wei Zhan, Xin Wang, Pengzhe Mao, Tongtong Feng, Ren Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Shandong University(山东大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 BiTAgent通过双向耦合多模态大语言模型与世界模型,实现任务感知的动态联合学习,提升多任务和跨环境的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04532 2025-12-05 cs.CV cs.AI 85%

PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement

PhyVLLM:具有运动-外观解耦的物理引导视频语言模型

Yu-Wei Zhan, Xin Wang, Hong Chen, Tongtong Feng, Wei Feng, Ren Wang, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 PhyVLLM通过引入物理运动建模和运动-外观解耦,提升视频语言模型在物理推理和视频理解任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13247 2025-12-05 cs.CL 85%

Grounding LLM Reasoning with Knowledge Graphs

通过知识图谱 grounding 大语言模型的推理

Alfonso Amayuelas, Joy Sain, Simerjot Kaur, Charese Smiley

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) JP Morgan AI Research(摩根大通人工智能研究)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过知识图谱 grounding 大语言模型的推理,提升推理的准确性和可解释性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23075 2025-12-05 cs.CV cs.AI 83%

SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models

SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理

Ruosen Zhao, Zhikang Zhang, Jialei Xu, Jiahao Chang, Dong Chen, Lingyun Li, Weijian Sun, Zizhuang Wei

机构 * Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22037 2025-12-05 cs.CY 81%

What AI Speaks for Your Community: Polling AI Agents for Public Opinion on Data Center Projects

人工智能为你的社区发声:通过AI代理收集数据中心项目公众意见

Zhifeng Wu, Yuelin Han, Shaolei Ren

专题命中 推理与问题求解 :foundation model(abstract,comments);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AI代理调查框架,利用大型语言模型评估社区对数据中心项目的意见,以指导负责任的AI发展。

Comments 35 Pages. Accepted to NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05105 2025-12-05 cs.CL cs.AI cs.IT cs.LG eess.SP math.IT 80%

Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning

语义软引导:无需强化学习的LLM长上下文推理

Purbesh Mitra, Sennur Ulukus

机构 * University of Maryland(马里兰大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出语义软引导方法,通过自我蒸馏技术无需强化学习提升LLM长上下文推理能力,实验显示在数学和编程基准测试中准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04785 2025-12-05 cs.AI cs.CR 77%

ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications

ASTRIDE:面向智能体AI应用的安全威胁建模平台

Eranga Bandara, Amin Hass, Ross Gore, Sachin Shetty, Ravi Mukkamala, Safdar H. Bouk, Xueping Liang, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(老奥布里恩大学) Accenture Technology Labs(埃森哲技术实验室) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ASTRIDE是首个专为AI智能体应用设计的自动化威胁建模平台,通过扩展STRIDE框架并结合微调的视觉语言模型与推理LLM,实现基于图的威胁建模自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04355 2025-12-05 cs.DC cs.AI cs.PF 77%

Counting Without Running: Evaluating LLMs' Reasoning About Code Complexity

无需运行即可计数:评估LLM对代码复杂度的推理能力

Gregory Bolet, Giorgis Georgakoudis, Konstantinos Parasyris, Harshitha Menon, Niranjan Hasabnis, Kirk W. Cameron, Gal Oren

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出gpuFLOPBench基准测试,评估LLM在无需运行代码的情况下预测CUDA内核FLOP计数的能力,揭示现有代码助手在硬件特定微码效应方面的局限性。

Comments 13 pages, 6 figures, MLSys 2026 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05112 2025-12-05 cs.CV cs.AI cs.CL cs.LG 75%

DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

DraCo: 文本到图像预览与稀有概念生成的草稿作为CoT

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学 MMLab) CUHK IMIXR(香港中文大学 IMIXR) Sun Yat-Sen University(中山大学) SCUT(华南理工大学) CUHK (Shenzhen)(香港中文大学(深圳))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DraCo通过结合文本和视觉内容的交错推理,提升文本到图像生成的精度和稀有概念生成能力。

Comments Project Page: https://github.com/CaraJ7/DraCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04923 2025-12-05 cs.AI cs.CL 73%

Algorithmic Thinking Theory

算法思维理论

MohammadHossein Bateni, Vincent Cohen-Addad, Yuzhou Gu, Silvio Lattanzi, Simon Meierhans, Christopher Mohri

机构 * Google(谷歌) NYU(纽约大学) ETH Zurich(苏黎世联邦理工学院) Stanford(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种算法思维理论框架,用于分析和设计更强大的推理方法,通过概率 oracle 实现迭代改进和答案聚合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00331 2025-12-05 cs.CL 70%

TreeRare: Syntax Tree-Guided Retrieval and Reasoning for Knowledge-Intensive Question Answering

TreeRare: 语法树引导的检索与推理用于知识密集型问答

Boyi Zhang, Zhuo Liu, Hangfeng He

机构 * University of Rochester(罗切斯特大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TreeRare通过语法树引导的检索与推理方法,提升知识密集型问答任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04680 2025-12-05 cs.SE cs.AI cs.HC 70%

Generative AI for Self-Adaptive Systems: State of the Art and Research Roadmap

生成式人工智能在自适应系统中的应用:现状与研究路线图

Jialong Li, Mingyue Zhang, Nianyu Li, Danny Weyns, Zhi Jin, Kenji Tei

机构 * Waseda University(早稻田大学) Southwest University(西南大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学) Tokyo Institute of Technology(东京技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨生成式人工智能在自适应系统中的应用现状与研究方向,分析其提升系统自主性和人机交互的潜力及挑战。

Comments Accepted by ACM Transactions on Autonomous and Adaptive Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04558 2025-12-05 cs.LG 70%

On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference

在测试时间计算的极限:用于更好推理的顺序奖励过滤

Yue Yu, Qiwei Di, Quanquan Gu, Dongruo Zhou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出顺序奖励过滤方法,通过选择高奖励生成物优化测试时间计算,提升大语言模型的推理性能。

Comments 45 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09058 2025-12-05 cs.SE cs.AI cs.SY eess.SY 70%

EmbedGenius: Towards Automated Software Development for Generic Embedded IoT Systems

EmbedGenius: 面向通用嵌入式物联网系统的自动化软件开发

Huanqi Yang, Mingzhe Li, Mingda Han, Zhenjiang Li, Weitao Xu

机构 * City University of Hong Kong(香港城市大学) Shandong University(山东大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EmbedGenius通过结合大语言模型和嵌入式系统知识,实现了通用嵌入式物联网系统的自动化软件开发,显著提升了代码生成准确率和任务完成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04790 2025-12-05 cs.IR 67%

Spatially-Enhanced Retrieval-Augmented Generation for Walkability and Urban Discovery

空间增强的检索增强生成用于步行性和城市探索

Maddalena Amendola, Chiara Pugliese, Raffaele Perego, Chiara Renso

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 WalkRAG通过空间增强的检索增强生成框架,结合信息检索与空间推理,为用户提供步行性城市探索的推荐服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04459 2025-12-05 cs.CV 67%

dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning

dVLM-AD:通过可控推理增强扩散视觉语言模型以实现驾驶

Yingzi Ma, Yulong Cao, Wenhao Ding, Shuibai Zhang, Yan Wang, Boris Ivanovic, Ming Jiang, Marco Pavone, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(abstract);language agent(abstract)

AI总结 dVLM-AD通过可控推理提升扩散视觉语言模型,实现更一致的驾驶推理与规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04797 2025-12-05 cs.AI cs.RO 57%

SIMA 2: A Generalist Embodied Agent for Virtual Worlds

SIMA 2: 一种通用的具身代理用于虚拟世界

SIMA team, Adrian Bolton, Alexander Lerchner, Alexandra Cordell, Alexandre Moufarek, Andrew Bolt, Andrew Lampinen, Anna Mitenkova, Arne Olav Hallingstad, Bojan Vujatovic, Bonnie Li, Cong Lu, Daan Wierstra, Daniel P. Sawyer, Daniel Slater, David Reichert, Davide Vercelli, Demis Hassabis, Drew A. Hudson, Duncan Williams, Ed Hirst, Fabio Pardo, Felix Hill, Frederic Besse, Hannah Openshaw, Harris Chan, Hubert Soyer, Jane X. Wang, Jeff Clune, John Agapiou, John Reid, Joseph Marino, Junkyung Kim, Karol Gregor, Kaustubh Sridhar, Kay McKinney, Laura Kampis, Lei M. Zhang, Loic Matthey, Luyu Wang, Maria Abi Raad, Maria Loks-Thompson, Martin Engelcke, Matija Kecman, Matthew Jackson, Maxime Gazeau, Ollie Purkiss, Oscar Knagg, Peter Stys, Piermaria Mendolicchio, Raia Hadsell, Rosemary Ke, Ryan Faulkner, Sarah Chakera, Satinder Singh Baveja, Shane Legg, Sheleem Kashem, Tayfun Terzi, Thomas Keck, Tim Harley, Tim Scholtes, Tyson Roberts, Volodymyr Mnih, Yulan Liu, Zhengdong Wang, Zoubin Ghahramani

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 SIMA 2是一种基于Gemini模型的通用具身代理,能够理解和行动于多种3D虚拟世界,具备自我改进能力,显著提升了与人类表现的接近程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03783 2025-12-05 cs.AI cs.SD 57%

Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning

Omni-AutoThink: 通过强化学习实现自适应多模态推理

Dongchao Yang, Songxiang Liu, Disong Wang, Yuanyuan Wang, Guanglu Wan, Helen Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan(美团)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI

AI总结 Omni-AutoThink通过强化学习实现自适应多模态推理,提升模型在不同任务难度下的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04492 2025-12-05 cs.CL 57%

MSME: A Multi-Stage Multi-Expert Framework for Zero-Shot Stance Detection

MSME: 一种多阶段多专家框架用于零样本立场检测

Yuanshuo Zhang, Aohua Li, Bo Chen, Jingbo Sun, Xiaobing Zhao

机构 * footnotemark: 1(机构1)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 MSME提出了一种多阶段多专家框架,通过知识准备、专家推理和决策聚合三个阶段,提升零样本立场检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19430 2025-12-05 cs.RO cs.CV 50%

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

GigaBrain-0:一种由世界模型驱动的视觉-语言-动作模型

GigaBrain Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jie Li, Jiagang Zhu, Lv Feng, Peng Li, Qiuping Deng, Runqi Ouyang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yang Wang, Yifan Li, Yilong Li, Yiran Ding, Yuan Xu, Yun Ye, Yukun Zhou, Zhehao Dong, Zhenan Wang, Zhichao Liu, Zheng Zhu

机构 * GigaBrain Team(GigaBrain团队)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 GigaBrain-0通过世界模型生成数据,减少对真实机器人数据的依赖,提升视觉-语言-动作模型的泛化能力和现实世界性能。

Comments https://gigabrain0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏