arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-05 至 2025-12-05 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2512.05105 2025-12-05 cs.CL cs.AI cs.IT cs.LG eess.SP math.IT 87%

Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning

语义软引导:无需强化学习的LLM长上下文推理

Purbesh Mitra, Sennur Ulukus

机构 * University of Maryland(马里兰大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出语义软引导方法,通过自我蒸馏技术无需强化学习提升LLM长上下文推理能力,实验显示在数学和编程基准测试中准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08833 2025-12-05 cs.CL cs.AI cs.LG 82%

An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems

对LLMs在数学推理中鲁棒性的调查:通过高级数学问题的数学等价转换进行基准测试

Yuren Hao, Xiang Wan, ChengXiang Zhai

机构 * Department of Computer Science University of Illinois Urbana–Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science Stanford University(计算机科学系斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种新的评估方法,通过数学等价转换的变体测试LLMs的数学推理鲁棒性,发现模型在不同变体上的表现差异显著。

Comments 34 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04355 2025-12-05 cs.DC cs.AI cs.PF 79%

Counting Without Running: Evaluating LLMs' Reasoning About Code Complexity

无需运行即可计数:评估LLM对代码复杂度的推理能力

Gregory Bolet, Giorgis Georgakoudis, Konstantinos Parasyris, Harshitha Menon, Niranjan Hasabnis, Kirk W. Cameron, Gal Oren

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出gpuFLOPBench基准测试,评估LLM在无需运行代码的情况下预测CUDA内核FLOP计数的能力,揭示现有代码助手在硬件特定微码效应方面的局限性。

Comments 13 pages, 6 figures, MLSys 2026 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04748 2025-12-05 cs.CL 57%

Model Whisper: Steering Vectors Unlock Large Language Models' Potential in Test-time

模型Whisper:引导向量解锁大型语言模型在测试时的潜力

Xinyue Kang, Diwei Shi, Li Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 Model Whisper通过轻量级引导向量在测试时提升大型语言模型的推理能力,实现高效且稳定的性能提升。

Comments accepted to aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2512.04228 2025-12-05 cs.AI 79%

Addressing Logical Fallacies In Scientific Reasoning From Large Language Models: Towards a Dual-Inference Training Framework

解决大型语言模型在科学推理中的逻辑谬误:一种双推理训练框架

Peter B. Walker, Hannah Davidson, Aiden Foster, Matthew Lienert, Thomas Pardue, Dale Russell

机构 * Intelligenesis LLC Uniformed Services University(美国武装部队服务大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种双推理训练框架,旨在解决大型语言模型在科学推理中的逻辑谬误问题,通过整合肯定生成与反事实否定,提升模型的鲁棒性和可解释性。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04374 2025-12-05 cs.CL cs.FL 57%

LangSAT: A Novel Framework Combining NLP and Reinforcement Learning for SAT Solving

LangSAT:一种结合自然语言处理和强化学习的SAT求解新框架

Muyu Pan, Matthew Walter, Dheeraj Kodakandla, Mahfuza Farooque

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 LangSAT结合自然语言处理和强化学习,通过将英语描述转换为CNF并优化求解过程,提升SAT求解的效率和普及性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 2 篇

2504.00409 2025-12-05 cs.CL cs.AI 62%

Semantic Mastery: Enhancing LLMs with Advanced Natural Language Understanding

语义 mastery:通过高级自然语言理解增强大语言模型

Mohanakrishnan Hariharan

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过高级自然语言理解技术提升大语言模型的语义理解和推理能力,探讨了知识图谱、检索增强生成和对比学习等方法在解决复杂NLP任务中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04204 2025-12-05 astro-ph.IM astro-ph.HE cs.AI 57%

Machine Phenomenology: A Simple Equation Classifying Fast Radio Bursts

机器现象学:一个简单方程分类快速射电暴

Yang Liu, Yuhao Lu, Rahim Moradi, Bo Yang, Bing Zhang, Wenbin Lin, Yu Wang

机构 * School of Computer Science, University of South China(南华大学计算机科学学院) Department of Physics E. Pancini, University Federico II(费米研究所物理系) Key Laboratory of Particle Astrophysics, Institute of High Energy Physics, Chinese Academy of Sciences(中国科学院高能物理研究所粒子天体物理重点实验室) School of Mathematics and Physics, University of South China(南华大学数学物理学院) The Hong kong Institute for Astronomy and Astrophysics, University of Hong Kong(香港大学天文与天体物理研究所) Department of Physics, University of Hong Kong(香港大学物理系) Nevada Center for Astrophysics, University of Nevada(内华达大学天文中心) School of Physical Science and Technology, Southwest Jiaotong University(西南交通大学物理科学与技术学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个简单方程通过符号回归分类快速射电暴,结合人类物理推理与机器学习发现经验定律。

Comments 19 pages, 9 figures, 3 tables. Submitted to SCIENCE CHINA Physics, Mechanics & Astronomy

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 12 篇

2512.05112 2025-12-05 cs.CV cs.AI cs.CL cs.LG 88%

DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

DraCo: 文本到图像预览与稀有概念生成的草稿作为CoT

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学 MMLab) CUHK IMIXR(香港中文大学 IMIXR) Sun Yat-Sen University(中山大学) SCUT(华南理工大学) CUHK (Shenzhen)(香港中文大学(深圳))

专题命中 规划推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 DraCo通过结合文本和视觉内容的交错推理,提升文本到图像生成的精度和稀有概念生成能力。

Comments Project Page: https://github.com/CaraJ7/DraCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01926 2025-12-05 cs.AI cs.CL cs.LG 88%

Large language models can learn and generalize steganographic chain-of-thought under process supervision

大语言模型可以在过程监督下学习和泛化隐写链式思维

Joey Skaf, Luis Ibanez-Lissen, Robert McCarthy, Connor Watts, Vasil Georgiv, Hannes Whittingham, Lorena Gonzalez-Manzano, David Lindner, Cameron Tice, Edward James Young, Puria Radmard

机构 * Mentorship for Alignment Research Students (MARS)(对齐研究 mentorship 项目) University College London(伦敦大学学院) Queen Mary University of London(伦敦女王学院) ML Alignment & Theory Scholars (MATS)(对齐与理论学者) Meridian Impact, Cambridge(剑桥 Meridian Impact) Universidad Carlos III de Madrid(马德里卡洛斯三世大学) Geodesic Research and University of Cambridge(Geodesic Research 和剑桥大学)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);planning(abstract)

AI总结 大语言模型在过程监督下能够学习并泛化隐写链式思维,通过替换特定字符串实现推理编码,提升监控可靠性。

Comments 10 pages main text, 3 figures main text, 17 pages supplementary material, 1 figure supplementary material, accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04459 2025-12-05 cs.CV 82%

dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning

dVLM-AD:通过可控推理增强扩散视觉语言模型以实现驾驶

Yingzi Ma, Yulong Cao, Wenhao Ding, Shuibai Zhang, Yan Wang, Boris Ivanovic, Ming Jiang, Marco Pavone, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 dVLM-AD通过可控推理提升扩散视觉语言模型,实现更一致的驾驶推理与规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13983 2025-12-05 cs.MA cs.RO cs.SY eess.SY 82%

Learning Two-agent Motion Planning Strategies from Generalized Nash Equilibrium for Model Predictive Control

从广义纳什均衡学习双智能体运动规划策略用于模型预测控制

Hansung Kim, Edward L. Zhu, Chang Seok Lim, Francesco Borrelli

机构 * University of California Berkeley(加州大学伯克利分校) PlusAI Inc(PlusAI公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出了一种基于广义纳什均衡的学习方法,用于多智能体运动规划中的模型预测控制,通过训练神经网络预测奖励结果来实现博弈论互动的隐式处理。

Comments Accepted Proceeding at 2025 Learning for Dynamics and Control Conference (L4DC)

Journal ref 283:112-123, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04405 2025-12-05 eess.SP cs.AI 70%

Towards 6G Native-AI Edge Networks: A Semantic-Aware and Agentic Intelligence Paradigm

迈向6G原生AI边缘网络:一种语义感知和代理智能范式

Chenyuan Feng, Anbang Zhang, Geyong Min, Yongming Huang, Tony Q. S. Quek, Xiaohu You

机构 * College of Computer Science, University of Exeter, Exeter, U.K.(埃克塞特大学计算机科学学院) Sony China Research Laboratory, Beijing, China(索尼中国研究实验室) School of Information Science and Engineering, Southeast University, Nanjing, China(东南大学信息科学与工程学院) Purple Mountain Laboratories, Nanjing, China(紫金山实验室) Information System Technology and Design Pillar, Singapore University of Technology and Design, Singapore(新加坡科技设计大学信息系统技术与设计支柱)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出语义感知和代理智能范式,旨在通过统一分类法和促进技术推动6G原生AI边缘网络的发展。

Comments submitted to Digital Communications and Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05066 2025-12-05 cs.LG cs.AI cs.CL 67%

Multi-LLM Collaboration for Medication Recommendation

多LLM协作用于药物推荐

Huascar Sanchez, Briland Hitaj, Jules Bergmann, Linda Briesemeister

机构 * Computer Science Laboratory, SRI International(SRI国际计算机科学实验室) University of Maryland St. Joseph Medical Center(马里兰大学圣约瑟夫医疗中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于LLM化学的多模型协作方法,通过增强互补性、稳定性和校准性,提高药物推荐的可靠性与可信度。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04451 2025-12-05 cs.CV 67%

StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios

StreamEQA:迈向具身场景的流式视频理解

Yifei Wang, Zhenkai Li, Tianwen Qian, Huanran Zheng, Zheng Wang, Yuqian Fu, Xiaoling Wang

机构 * School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,华东师范大学) Zhejiang University of Technology(浙江工业大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 StreamEQA是一个针对具身场景中流式视频问答的基准测试,通过评估模型在感知、交互和规划方面的能力,推动流式视频理解在具身应用中的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04785 2025-12-05 cs.AI cs.CR 57%

ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications

ASTRIDE:面向智能体AI应用的安全威胁建模平台

Eranga Bandara, Amin Hass, Ross Gore, Sachin Shetty, Ravi Mukkamala, Safdar H. Bouk, Xueping Liang, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(老奥布里恩大学) Accenture Technology Labs(埃森哲技术实验室) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ASTRIDE是首个专为AI智能体应用设计的自动化威胁建模平台,通过扩展STRIDE框架并结合微调的视觉语言模型与推理LLM,实现基于图的威胁建模自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09080 2025-12-05 cs.AI 57%

BioAnalyst: A Foundation Model for Biodiversity

BioAnalyst: 一种用于生物多样性的基础模型

Athanasios Trantas, Martino Mensio, Stylianos Stasinos, Sebastian Gribincea, Taimur Khan, Damian Podareanu, Aliene van der Veen

机构 * Nederlandse Organisatie voor Toegepast Natuurwetenschappelijk Onderzoek – TNO(荷兰应用自然科学研究院 – TNO) Eindhoven University of Technology(埃因霍温理工大学) Amazon(亚马逊) University of Groningen(格罗宁根大学) Helmholtz Center for Environmental Research – UFZ(环境研究赫尔姆霍茨中心 – UFZ) SURF

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 BioAnalyst是一种针对生物多样性分析和保护规划的多模态基础模型,通过预训练和微调实现物种分布建模和生态预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04492 2025-12-05 cs.CL 57%

MSME: A Multi-Stage Multi-Expert Framework for Zero-Shot Stance Detection

MSME: 一种多阶段多专家框架用于零样本立场检测

Yuanshuo Zhang, Aohua Li, Bo Chen, Jingbo Sun, Xiaobing Zhao

机构 * footnotemark: 1(机构1)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 MSME提出了一种多阶段多专家框架,通过知识准备、专家推理和决策聚合三个阶段,提升零样本立场检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22037 2025-12-05 cs.CY 50%

What AI Speaks for Your Community: Polling AI Agents for Public Opinion on Data Center Projects

人工智能为你的社区发声:通过AI代理收集数据中心项目公众意见

Zhifeng Wu, Yuelin Han, Shaolei Ren

专题命中 规划推理 :planning(abstract)

AI总结 本文提出AI代理调查框架,利用大型语言模型评估社区对数据中心项目的意见,以指导负责任的AI发展。

Comments 35 Pages. Accepted to NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21164 2025-12-05 cs.HC 50%

Preference-Aligned Options from Generative AI Compensates for Age-Related Cognitive Decline in Decision Making

基于生成式AI的偏好对齐选项可缓解老年人决策中的年龄相关认知下降

Sayaka Ishibashi, Kou Tamura, Ayana Goma, Kenta Yamamoto, Kouhei Masumoto

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究发现,生成式AI通过减少信息搜索的认知负荷,能缓解老年人决策中的年龄相关认知下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 6 篇

2511.23075 2025-12-05 cs.CV cs.AI 79%

SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models

SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理

Ruosen Zhao, Zhikang Zhang, Jialei Xu, Jiahao Chang, Dong Chen, Lingyun Li, Weijian Sun, Zizhuang Wei

机构 * Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04276 2025-12-05 cs.AI cs.LG math.ST stat.TH 79%

The Geometry of Benchmarks: A New Path Toward AGI

基准的几何学:通向通用人工智能的新路径

Przemyslaw Chojecki

机构 * Przemyslaw Chojecki(独立研究者)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于几何框架的基准评估方法,通过自主AI尺度和GVU操作符,为通用人工智能的发展提供了新的理论视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19430 2025-12-05 cs.RO cs.CV 67%

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

GigaBrain-0:一种由世界模型驱动的视觉-语言-动作模型

GigaBrain Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jie Li, Jiagang Zhu, Lv Feng, Peng Li, Qiuping Deng, Runqi Ouyang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yang Wang, Yifan Li, Yilong Li, Yiran Ding, Yuan Xu, Yun Ye, Yukun Zhou, Zhehao Dong, Zhenan Wang, Zhichao Liu, Zheng Zhu

机构 * GigaBrain Team(GigaBrain团队)

专题命中 视觉空间推理 :chain-of-thought(abstract);CoT(abstract)

AI总结 GigaBrain-0通过世界模型生成数据,减少对真实机器人数据的依赖,提升视觉-语言-动作模型的泛化能力和现实世界性能。

Comments https://gigabrain0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04763 2025-12-05 cs.LG cs.CL cs.CV 62%

MemLoRA: Distilling Expert Adapters for On-Device Memory Systems

MemLoRA: 通过专家适配器实现设备端记忆系统

Massimo Bini, Ondrej Bohdal, Umberto Michieli, Zeynep Akata, Mete Ozay, Taha Ceritli

机构 * Samsung R&D Institute UK(三星英国研发中心) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(慕尼黑海德堡研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 MemLoRA通过为小型语言模型添加专用记忆适配器,实现设备端记忆系统的本地部署,并扩展至视觉理解任务,提升多模态场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04797 2025-12-05 cs.AI cs.RO 57%

SIMA 2: A Generalist Embodied Agent for Virtual Worlds

SIMA 2: 一种通用的具身代理用于虚拟世界

SIMA team, Adrian Bolton, Alexander Lerchner, Alexandra Cordell, Alexandre Moufarek, Andrew Bolt, Andrew Lampinen, Anna Mitenkova, Arne Olav Hallingstad, Bojan Vujatovic, Bonnie Li, Cong Lu, Daan Wierstra, Daniel P. Sawyer, Daniel Slater, David Reichert, Davide Vercelli, Demis Hassabis, Drew A. Hudson, Duncan Williams, Ed Hirst, Fabio Pardo, Felix Hill, Frederic Besse, Hannah Openshaw, Harris Chan, Hubert Soyer, Jane X. Wang, Jeff Clune, John Agapiou, John Reid, Joseph Marino, Junkyung Kim, Karol Gregor, Kaustubh Sridhar, Kay McKinney, Laura Kampis, Lei M. Zhang, Loic Matthey, Luyu Wang, Maria Abi Raad, Maria Loks-Thompson, Martin Engelcke, Matija Kecman, Matthew Jackson, Maxime Gazeau, Ollie Purkiss, Oscar Knagg, Peter Stys, Piermaria Mendolicchio, Raia Hadsell, Rosemary Ke, Ryan Faulkner, Sarah Chakera, Satinder Singh Baveja, Shane Legg, Sheleem Kashem, Tayfun Terzi, Thomas Keck, Tim Harley, Tim Scholtes, Tyson Roberts, Volodymyr Mnih, Yulan Liu, Zhengdong Wang, Zoubin Ghahramani

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 SIMA 2是一种基于Gemini模型的通用具身代理,能够理解和行动于多种3D虚拟世界,具备自我改进能力,显著提升了与人类表现的接近程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04790 2025-12-05 cs.IR 50%

Spatially-Enhanced Retrieval-Augmented Generation for Walkability and Urban Discovery

空间增强的检索增强生成用于步行性和城市探索

Maddalena Amendola, Chiara Pugliese, Raffaele Perego, Chiara Renso

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 WalkRAG通过空间增强的检索增强生成框架,结合信息检索与空间推理,为用户提供步行性城市探索的推荐服务。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2512.04558 2025-12-05 cs.LG 79%

On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference

在测试时间计算的极限:用于更好推理的顺序奖励过滤

Yue Yu, Qiwei Di, Quanquan Gu, Dongruo Zhou

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.LG

AI总结 本文提出顺序奖励过滤方法,通过选择高奖励生成物优化测试时间计算,提升大语言模型的推理性能。

Comments 45 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04555 2025-12-05 cs.CL 57%

ADAPT: Learning Task Mixtures for Budget-Constrained Instruction Tuning

ADAPT:为预算受限的指令微调学习任务混合

Pritam Kadasi, Abhishek Upperwal, Mayank SIngh

机构 * Lingo Research Group, Indian Institute of Technology Gandhinagar(林戈研究组,印度理工学院冈德hinagar分校) Soket AI(Soket人工智能)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 ADAPT通过学习任务采样比例优化预算受限的指令微调,提升下游任务性能并更高效地分配训练资源。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 8 篇

2502.13247 2025-12-05 cs.CL 85%

Grounding LLM Reasoning with Knowledge Graphs

通过知识图谱 grounding 大语言模型的推理

Alfonso Amayuelas, Joy Sain, Simerjot Kaur, Charese Smiley

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) JP Morgan AI Research(摩根大通人工智能研究)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 通过知识图谱 grounding 大语言模型的推理,提升推理的准确性和可解释性

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05901 2025-12-05 cs.CL cs.AI 84%

Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router

路由与推理:通过强化模型路由扩展大语言模型推理

Chenyang Shao, Xinyang Liu, Yutang Lin, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) BNRist, Tsinghua University(清华大学BNRist)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 R2-Reasoner通过强化模型路由器实现高效的大语言模型推理扩展,减少API成本并保持推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏