arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19038 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19038 篇

2602.01047 2026-03-25 cs.CV cs.AI 79%

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01969 2026-03-25 cs.CV cs.AI 79%

Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration

通过注意力校准缓解大视觉-语言模型中的物体幻觉

Younan Zhu, Linwei Tao, Minjing Dong, Chang Xu

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出动态注意力校准方法,通过对比学习动态强制位置不变性,有效缓解大视觉-语言模型中的物体幻觉问题,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07077 2026-03-24 cs.SD cs.AI 79%

CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models

CALM:用于大音频-语言模型的类条件稀疏注意力向量

Videet Mehta, Liming Wang, Hilde Kuehne, Rogerio Feris, James R. Glass, M. Jehanzeb Mirza

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Tuebingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出CALM,一种用于小样本分类的类条件稀疏注意力向量方法,通过学习类依赖的重要性权重提升音频和音频视觉分类性能,实验显示在多个基准上优于传统投票方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20162 2026-03-23 cs.CL 79%

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

评估在用户压力下指令调优语言模型的证据基础

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer

机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Computer Science, Old Dominion University(老 Dominion 大学计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了在用户压力下指令调优语言模型如何平衡用户对齐压力与上下文证据的忠实性,通过控制的认知冲突框架评估证据一致性准确性及排序表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19714 2026-03-23 cs.CL 79%

LoopRPT: Reinforcement Pre-Training for Looped Language Models

LoopRPT: 用于循环语言模型的强化预训练

Guo Tang, Shixin Jiang, Heng Chang, Nuo Chen, Yuhan Li, Huiming Fan, Jia Li, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) Tsinghua University, Beijing, China(清华大学) The Hong Kong University of Science and Technology, Guangzhou, China(香港科学与技术大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出LoopRPT框架,通过将下一步预测转化为推理任务,利用EMA教师参考和噪声潜在轨迹直接优化循环语言模型的中间表示,提升表示质量并实现准确度与计算量的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19564 2026-03-23 cs.LG 79%

Wearable Foundation Models Should Go Beyond Static Encoders

可穿戴基础模型应超越静态编码器

Yu Yvonne Wu, Yuwei Zhang, Hyungjun Yoon, Ting Dang, Dimitris Spathis, Tong Xia, Qiang Yang, Jing Han, Dong Ma, Sung-Ju Lee, Cecilia Mascolo

机构 * Dartmouth College, USA(达特茅斯学院) University of Cambridge, UK(剑桥大学) The University of Melbourne, Australia(墨尔本大学) Google Research, UK(谷歌研究) Tsinghua University, China(清华大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出可穿戴基础模型需超越静态编码器,通过结构丰富数据、纵向感知多模态建模和代理推理系统实现连续性健康支持。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18815 2026-03-20 cs.AI 79%

ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents

ProRL Agent:多轮LLM代理的RL训练rollout-as-a-service

Hao Zhang, Mingjie Liu, Shaokun Zhang, Songyang Han, Jian Hu, Zhenghui Jin, Yuchi Zhang, Shizhe Diao, Ximing Lu, Binfeng Xu, Zhiding Yu, Jan Kautz, Yi Dong

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出ProRL Agent,通过API服务提供完整的代理rollout生命周期,支持多样化的代理任务,在无根HPC环境中提供标准化可扩展的沙箱环境,通过软件工程、数学、STEM和编程任务的RL训练验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16344 2026-03-20 cs.RO cs.AI 79%

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) University of Toronto(多伦多大学) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17969 2026-03-19 cs.RO cs.AI 79%

Specification-Aware Distribution Shaping for Robotics Foundation Models

面向规范的机器人基础模型分布塑形

Sadık Bera Yüksel, Derya Aksaray

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出一种面向规范的机器人基础模型分布优化框架,通过在预训练模型执行中强制满足信号时序逻辑约束,提升机器人在复杂任务中的安全性和合规性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17312 2026-03-19 cs.CV cs.AI 79%

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI 79%

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13628 2026-03-17 cs.CV cs.AI 79%

Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models

基于可定位性的自适应推理图像地理定位方法

Bo Yu, Fengze Yang, Yiming Liu, Chao Wang, Xuewen Luo, Taozhe Li, Ruimin Ke, Xiaofan Zhou, Chenxi Liu

机构 * The University of Utah(犹他大学) The University of Oklahoma(俄克拉荷马大学) Worcester Polytechnic Institute(沃斯特理工学院) Rensselaer Polytechnic Institute(雷士利理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出Geo-ADAPT框架,通过优化可定位性评分和两阶段分组相对策略优化,提升图像地理定位的适应性和准确性,减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13612 2026-03-17 cs.AI 79%

LLM Routing as Reasoning: A MaxSAT View

LLM路由作为推理:一种MaxSAT视角

Son Nguyen, Xinyuan Liu, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出基于约束的LLM路由方法,将其建模为加权MaxSAT问题,通过自然语言反馈生成硬约束和软约束,实验证明语言反馈能产生近可行推荐集,揭示了语言条件下的结构化约束优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13443 2026-03-17 cs.SE cs.AI cs.PL 79%

NormCode Canvas: Making LLM Agentic Workflows Development Sustainable via Case-Based Reasoning

NormCode Canvas:通过基于案例的推理使LLM代理工作流开发可持续

Xin Guan, Yunshan Li, Ze Wang

机构 * Psylens AI, China(Psylens AI,中国) Shenzhen University, China(深圳大学,中国) University College London, United Kingdom(伦敦大学学院,英国)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 NormCode Canvas通过基于案例的推理实现多步骤LLM工作流的可持续开发,其核心是NormCode语言,确保每个执行检查点都是自包含的案例,从而消除隐含共享状态带来的问题。

Comments 16 pages, 5 figures. Submitted to ICCBR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00819 2026-03-16 cs.RO cs.AI 79%

DriveMind: A Dual Visual Language Model-based Reinforcement Learning Framework for Autonomous Driving

DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶

Dawood Wasif, Terrence J. Moore, Chandan K. Reddy, Frederica Free-Nelson, Seunghyun Yoon, Hyuk Lim, Dan Dongseong Kim, Jin-Hee Cho

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。

Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10978 2026-03-12 cs.CV cs.AI 79%

GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations

GroundCount: 通过目标检测对视觉语言模型进行接地以缓解计数幻觉

Boyuan Chen, Minghao Shao, Siddharth Garg, Ramesh Karri, Muhammad Shafique

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 GroundCount通过目标检测提供空间接地,缓解视觉语言模型计数幻觉,提升准确率并减少推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09774 2026-03-11 cs.AI 79%

World2Mind: Cognition Toolkit for Allocentric Spatial Reasoning in Foundation Models

World2Mind: 用于基础模型的方位认知工具包

Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Hang Su, Yubin Wang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学人工智能院计算机科学与技术系、清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 World2Mind通过构建空间认知地图和三阶段推理链,提升基础模型的空间推理能力,使纯文本模型也能实现复杂3D空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09232 2026-03-11 cs.SD cs.CL eess.AS 79%

How Contrastive Decoding Enhances Large Audio Language Models?

对比解码如何增强大型音频语言模型?

Tzu-Quan Lin, Wei-Ping Huang, Yi-Cheng Lin, Hung-yi Lee

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过对比解码策略评估,发现音频感知解码和音频对比解码在不同模型中效果各异,揭示了CD在纠正特定错误类型上的有效性及局限性。

Comments Submitted to INTERSPEECH 2026. Code and additional analysis results are provided in our repository: https://github.com/nervjack2/LALM-Contrastive-Decoding-Error-Profiles

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18988 2026-03-11 cs.CL 79%

Markovian Transformers for Informative Language Modeling

马尔可夫变换器用于信息语言建模

Scott Viteri, Max Lamparth, Peter Chatain, Clark Barrett

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 马尔可夫变换器通过引入CoT瓶颈提升语言模型的推理能力,实验显示其在问答任务中表现优异,且对CoT依赖性强。

Comments 21 pages, 6 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09036 2026-03-11 cs.LG 79%

SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Grounding

SCALAR:通过LLM引导的符号规划和深度RL接地学习与组合技能

Renos Zabounidis, Yue Wu, Simon Stepputtis, Woojun Kim, Yuanzhi Li, Tom Mitchell, Katia Sycara

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.LG

AI总结 SCALAR通过结合LLM引导的符号规划与深度RL,实现技能学习与组合,显著提升任务完成效率和鲁棒性。

Comments Best Paper Award Honorable Mention at NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24427 2026-03-11 cs.CL 79%

SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models

SynthWorlds: 用于语言模型中推理与知识分离的受控并行世界

Ken Gu, Advait Bhat, Mike A Merrill, Robert West, Xin Liu, Daniel McDuff, Tim Althoff

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) EPFL(苏黎世联邦理工学院) Google Research(谷歌研究)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 SynthWorlds通过构建两个结构相同的并行世界,分离语言模型的推理与知识能力,揭示了模型在仅依赖参数化知识和知识增强设置下的性能差异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08436 2026-03-10 cs.CV cs.CL 79%

Can Vision-Language Models Solve the Shell Game?

视觉-语言模型能解决贝壳游戏吗?

Tiedong Liu, Wee Sun Lee

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出SGCoT方法,通过生成对象轨迹解决VLMs在视觉跟踪中的根本限制,实现超过90%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07915 2026-03-10 cs.AI 79%

Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents

Ares: 为高效LLM代理的自适应推理努力选择

Jingbo Yang, Bairu Hou, Wei Wei, Yujia Bao, Shiyu Chang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Accenture(埃森哲)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 Ares通过动态选择推理努力级别,有效降低LLM代理的推理成本,同时保持任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06737 2026-03-10 cs.LO cs.AI cs.SC 79%

Agent Hunt: Bounty Based Collaborative Autoformalization With LLM Agents

Agent Hunt: 基于奖金的协作自动形式化与LLM代理

Chad E. Brown, Cezary Kaliszyk, Josef Urban

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 基于奖金的协作自动形式化方法,利用LLM代理在交互式定理证明环境中进行去中心化证明搜索与理论构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05728 2026-03-09 cs.LO cs.AI cs.SE 79%

LTLGuard: Formalizing LTL Specifications with Compact Language Models and Lightweight Symbolic Reasoning

LTLGuard:利用紧凑语言模型和轻量符号推理形式化LTL规范

Medina Andresel, Cristinel Mateis, Dejan Nickovic, Spyridon Kounoupidis, Panagiotis Katsaros, Stavros Tripakis

机构 * AIT Austrian Institute of Technology(奥地利技术研究所) Aristotle University of Thessaloniki(希腊塞萨洛尼基亚里士多德大学) Northeatern University(东北大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 LTLGuard通过结合紧凑语言模型与轻量符号推理,有效生成无冲突的LTL规范,提升形式化验证的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02263 2026-03-09 q-bio.GN cs.AI 79%

LA-MARRVEL: A Knowledge-Grounded, Language-Aware LLM Framework for Clinically Robust Rare Disease Gene Prioritization

LA-MARRVEL:一种基于知识、语言感知的LLM框架,用于临床稳健的罕见病基因优先级排序

Jaeyeon Lee, Lin Yao, Hyun-Hwan Jeong, Zhandong Liu

机构 * Baylor College of Medicine(贝勒医学院) Jan and Dan Duncan Neurological Research Institute(Jan和Dan Duncan神经研究 institutes) Texas Children’s Hospital(德克萨斯儿童医院) Quantitative and Computational Biosciences program(定量与计算生物科学项目)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 LA-MARRVEL通过基于知识和语言感知的LLM框架,提升罕见病基因优先级排序的准确性和临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23405 2026-03-09 cs.LG 79%

Planner Aware Path Learning in Diffusion Language Models Training

扩散语言模型训练中的规划感知路径学习

Fred Zhangzhi Peng, Zachary Bezemek, Jarrid Rector-Brooks, Shuibai Zhang, Anru R. Zhang, Michael Bronstein, Alexander Tong, Avishek Joey Bose

机构 * Duke University(杜克大学) Mila Université de Montréal(蒙特利尔大学) California Institute of Technology(加州理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Oxford(牛津大学) AITHYRA Imperial College London(伦敦帝国学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 本文提出PAPL,一种通过规划感知路径学习提升扩散语言模型训练与推理一致性的方法,实现跨领域性能提升。

Comments Camera ready version for ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04319 2026-03-05 cs.CL 79%

AILS-NTUA at SemEval-2026 Task 12: Graph-Based Retrieval and Reflective Prompting for Abductive Event Reasoning

AILS-NTUA 在 SemEval-2026 任务 12: 基于图的检索与反思提示的归纳事件推理

Nikolas Karafyllis, Maria Lymperaiou, Giorgos Filandrianos, Athanasios Voulodimos, Giorgos Stamou

机构 * School of Electrical and Computer Engineering, AILS Laboratory(电气与计算机工程学院,AILS实验室) National Technical University of Athens(雅典国家技术大学)

专题命中 推理与问题求解 :prompting(title);LLM(abstract);分类 cs.CL

AI总结 AILS-NTUA 提出基于图检索与反思提示的三阶段系统,在 SemEval-2026 任务 12 中实现 0.95 准确率,揭示多标签因果推理中的系统性失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02208 2026-03-03 cs.CL 79%

Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training

Reasoning Core:一个可扩展的程序化数据生成套件,用于符号预训练和后训练

Valentin Lacombe, Valentin Quesnel, Damien Sileo

机构 * Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工大学、UMR 9189 - CRIStAL)

专题命中 推理与问题求解 :post-training(title);language model(abstract);分类 cs.CL

AI总结 Reasoning Core 提出了一种可扩展的程序化数据生成套件,用于符号预训练和后训练,通过生成多样化的符号推理数据提升语言模型的推理能力。

Comments Keywords: LLMs, NLP, Dataset, Corpus, Procedural Pre-training, Reasoning, Logic, Formal Semantics https://github.com/sileod/reasoning_core

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01580 2026-03-03 cs.CL 79%

Markovian ODE-guided scoring can assess the quality of offline reasoning traces in language models

马尔可夫ODE引导的评分可以评估语言模型离线推理轨迹的质量

Arghodeep Nandi, Ojasva Saxena, Tanmoy Chakraborty

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(电子工程系,印度理工学院德里) Indian Institute of Technology Delhi(印度理工学院德里) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(人工智能学院,印度理工学院德里)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 MarODE通过马尔可夫模型和常微分方程评估语言模型推理轨迹质量,有效提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏