ESPO: Entropy Importance Sampling Policy Optimization
ESPO:熵重要性采样策略优化
机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司大语言模型团队)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ESPO通过结合细粒度更新与稳定训练,解决梯度利用率不足问题,提升大语言模型在复杂推理任务中的性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
ESPO:熵重要性采样策略优化
机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司大语言模型团队)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ESPO通过结合细粒度更新与稳定训练,解决梯度利用率不足问题,提升大语言模型在复杂推理任务中的性能。
LM-Lexicon:通过和谐语义专家提升定义建模
机构 * BIGAI ; Baidu Inc.(百度公司) ; Peking University(北京大学)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL
AI总结 LM-Lexicon通过语义专家学习和混合架构提升定义建模效果,实现BLEU分数提升7%,并优化领域级路由机制
Comments EACL 2026 (Oral), 22 pages, 12 figures, 12 tables
基于随机浮点采样的位置编码增强变换器的长度泛化能力
机构 * Daiwa Securities(大和证券) ; The University of Tokyo(东京大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 本研究提出随机浮点采样方法,通过增强位置编码的泛化能力,提升变换器在长序列处理和常识推理任务中的表现。
Comments To appear at EACL 2026
HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。
训练多模态大推理模型需要更优质的思考:一种用于长链式思考合成与选择的三阶段框架
机构 * School of Computer Science and Engineering(计算机科学与工程学院) ; Key Laboratory of Computer Network and Information Integration (SEU), Ministry of Education(计算机网络与信息集成重点实验室(SEU))
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SynSelect框架,通过三阶段合成与选择生成高质量多模态推理数据,提升模型推理能力。
基于大语言模型的链式推理在临床阿尔茨海默病评估与诊断中的应用
机构 * Stevens Institute of Technology(斯蒂文斯理工学院) ; Surgical Trauma Intensive Care Unit(外科创伤重症护理科) ; Institute of Brain Science(脑科学研究所) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL
AI总结 本文提出利用大语言模型的链式推理进行阿尔茨海默病的评估与诊断,通过生成推理路径提升诊断稳定性和性能,F1分数提升达15%。
在线监督微调用于高效推理
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Eastern Institute of Technology, Ningbo(宁波工程技术学院) ; Shanghai Jiao Tong University(上海交通大学) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; Tencent Hunyuan / AI Lab(腾讯混元/AI实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出在线监督微调方法,通过简化奖励机制提升推理效率和准确性,减少计算成本并优化性能。
在大语言模型中解锁机器翻译的推理能力
机构 * University of Amsterdam(阿姆斯特丹大学) ; Cohere Labs(Cohere实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种针对翻译的结构化推理框架,通过多步骤草稿、充分性细化、流畅性提升和选择性迭代修订,显著提升了大语言模型在机器翻译中的性能。
用于复杂评估任务的推理语言模型:从儿童保护案件报告中评估父母合作
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究了推理语言模型在评估儿童保护案件中父母合作方面的有效性,发现模型在母亲合作评估上表现更佳,但对父亲合作的评估准确性较低,提示需关注性别差异。
超越令牌级策略梯度:用于大语言模型复杂推理的多令牌策略梯度优化
机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) ; Baidu Inc.(百度公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出MPO框架,通过多令牌级优化提升大语言模型在复杂推理任务中的性能。
AuTAgent: 一个用于工具增强音频推理的强化学习框架
机构 * Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; The University of Queensland(昆士兰大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 AuTAgent通过强化学习框架学习何时及使用哪些工具,提升音频模型的推理能力,实验显示在多个基准上显著提高准确性。
iQUEST: 一种迭代式问题引导的知识库问答框架
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 iQUEST通过迭代分解复杂查询和集成图神经网络,提升多跳知识库问答的推理准确性与连贯性。
Comments Accepted to the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025), Main Track
TWISTED-RL:无人类示范的分层技能代理用于打结
机构 * Reichman University(雷赫曼大学) ; Technion – Israel Institute of Technology(技术学院——以色列理工学院) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 复杂问题求解 :planning(abstract);分类 cs.AI、cs.LG
AI总结 TWISTED-RL通过强化学习和拓扑动作实现无示范的复杂打结任务,提升泛化能力和效率。
经验强化学习
机构 * University of Southern California(南加州大学) ; Microsoft(微软公司) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 经验强化学习通过显式经验-反思-巩固循环提升语言模型在稀疏奖励环境中的学习效率和性能。
Comments 26 pages, 9 tables, 7 figures
AgenticSciML: 基于协作多智能体系统的科学机器学习中的涌现发现
机构 * Brown University(布朗大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 AgenticSciML通过协作多智能体系统实现科学机器学习中的涌现发现,生成超越单智能体和人类设计基线的高效方法。
基于大语言模型的强化学习用于无线网络优化
机构 * State-Province Joint Engineering and Research Center of Advanced Networking and Intelligent Information Services, College of Computer Science, Northwest University(高级网络与智能信息服务省-市联合工程与研究中心,计算机科学学院,西北大学) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) ; Institute of Artificial Intelligence, University of Science and Technology Beijing(人工智能研究院,北京科技大学) ; Department of Electrical and Electronic Engineering, the University of Hong Kong(电子与电气工程系,香港大学) ; Automation of School, Guangdong University of Technology(自动化学院,广东工业大学) ; Queen’s University Belfast(贝尔法斯特女王大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出利用大语言模型增强强化学习,以优化6G无线网络,通过多智能体强化学习框架提升网络性能。
RF-GPT:教AI看见无线世界
机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) ; College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) ; Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。
SYNAPSE:通过扩散激活实现LLM代理的片段语义记忆
机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) ; Department of Biosystems Engineering and Soil Science, University of Tennessee(田纳西大学生物系统工程与土壤科学系) ; Department of Biomedical Informatics, University of Colorado School of Medicine(科罗拉多医学院生物医学信息学系) ; Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) ; Department of Physics and Astronomy, The University of Georgia(佐治亚大学物理与天文学系)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 SYNAPSE通过动态图与扩散激活机制,提升LLM在复杂时间序列和多跳推理任务中的性能,解决上下文隧道问题。
评估用于RAG的提示工程技术在小型语言模型中的表现:一种多跳问答方法
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文通过评估24种提示模板,发现优化RAG在小型语言模型上的表现提升显著,为资源受限环境下的RAG系统提供实用建议。
Comments 32 Pages, Submitted to Journal of Computing and Security
提示到处方:迈向生成式差分限折射光学设计
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出一种结合大语言模型和可微分光线追踪的生成框架,实现差分限折射光学设计的自动化,适用于工业计量、红外目镜和非球面透镜等多种场景。
Comments 17 pages, 5 figures
具身智能频谱管理:动态频谱接入的新范式
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出具身智能频谱管理范式,通过具身智能技术解决动态频谱接入中的灵活性和通用性问题,展示原型平台并探讨未来研究方向。
OpenTSLM:用于多变量医学文本和时间序列数据推理的时间序列语言模型
机构 * Stanford Mussallem Center for Biodesign(斯坦福 Mussallem 生物设计中心) ; Centre for Digital Health Interventions(数字健康干预中心) ; Agentic Systems Lab(代理系统实验室) ; National University of Singapore(新加坡国立大学) ; Microsoft(微软) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google Research(谷歌研究) ; Stanford University(斯坦福大学) ; Amazon(亚马逊) ; Division of Cardiovascular Medicine(心血管医学部) ; Division of Cardiology(心内科部) ; Pediatric Cardiology(儿童心内科) ; University of Washington(华盛顿大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 OpenTSLM通过整合时间序列作为原生模态,提升对多变量医学文本和时间序列数据的推理能力,其模型在多个任务中均优于基线模型。
让慢思考更快:通过步骤熵压缩LLM的链式思考
机构 * The Chinese University of Hong Kong(中国香港大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI
AI总结 通过步骤熵压缩LLM的链式思考,提升推理效率并保持准确性。
Comments Accepted by ICLR2026
VeRA: 在大规模上验证推理数据增强
机构 * Princeton University(普林斯顿大学)
专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 VeRA通过验证推理数据增强框架,实现大规模、可靠的评估基准生成,提升评估的稳健性和成本效益。
Comments 36 pages; VeRA technical report
面包还是法棍?一项关于任务拓扑、长度泛化和推理轨迹益处的研究
机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) ; Kempner Institute for the Study of Artificial and Natural Intelligence, Harvard University(哈佛大学人工智能与自然智能研究所) ; Center for Brain Sciences, Harvard University(哈佛大学脑科学中心)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究通过PITA数据集探讨推理轨迹在不同任务拓扑和长度泛化中的表现,揭示了RT模型在广度任务中的优势及深度任务的局限性。
Comments 38 pages, 11 figures, code available at https://github.com/wtong98/boule-or-baguette
知道何时不回答:具有退避意识的科学推理
机构 * Texas A&M University(德克萨斯农工大学) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种具有退避意识的科学推理框架,通过分解科学主张并利用自然语言推理评估证据,以减少错误风险,强调退避在科学验证中的重要性。
FGBench: 一个用于大语言模型中功能基团级分子属性推理的数据集和基准
机构 * Department of Chemical and Biomolecular Engineering, University of Illinois Urbana-Champaign(化学与生物分子工程系,伊利诺伊大学厄巴纳-香槟分校) ; Department of Computer Science, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 FGBench通过构建包含功能基团级信息的数据集,提升大语言模型在分子属性推理任务中的能力。
Comments NeurIPS 2025 (Datasets and Benchmarks Track)
ProMoral-Bench:评估大语言模型中道德推理与安全性的提示策略
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 ProMoral-Bench通过统一道德安全评分评估多种提示策略,发现紧凑示例引导框架在道德和安全方面表现更优。
过程监督多智能体强化学习用于可靠的临床推理
机构 * School of Informatics, University of Edinburgh, UK(信息学院,爱丁堡大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出了一种过程监督的多智能体强化学习框架,用于提升基因-疾病有效性校准的临床推理准确性与过程忠实度。
基于协作推理的代理时空 grounding
机构 * CFAR, IHPC, Agency for Science, Technology and Research(A*STAR)(CFAR、IHPC、新加坡科技研究局) ; CCDS, Nanyang Technological University(CCDS、南洋理工大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出ASTG框架,通过协作推理实现开放世界下的时空视频grounding,提升检索效率并优于现有弱监督和零样本方法。