Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
为大型语言模型的最佳-N采样进行推理感知微调
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种推理感知微调方法,通过改进最佳-N采样策略提升大型语言模型的性能和推理效率。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
为大型语言模型的最佳-N采样进行推理感知微调
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种推理感知微调方法,通过改进最佳-N采样策略提升大型语言模型的性能和推理效率。
推荐超越目录的个性化图像生成
机构 * University of Michigan(密歇根大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 REBECA通过直接学习隐含反馈信号实现高效个性化图像生成,无需微调扩散模型,提升大规模用户群体的个性化效果。
分块进展:用于自回归图像生成的测试时扩展
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 GridAR通过网格分区逐步生成和布局指定提示重述策略,在有限测试时扩展下提升视觉自回归模型的生成质量与编辑效果。
Comments Project page: https://grid-ar.github.io/
针对阿拉伯语上下文依赖文本到SQL的提示工程技术
机构 * Department of Computer Science University of Central Florida Orlando, Florida, USA(计算机科学系 佛罗里达中央大学 奥兰多分校)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 本文提出Ar-SParC数据集及GAT corrector方法,通过提示工程技术提升阿拉伯语文本到SQL任务的性能。
Comments Accepted at IJCNN 2025 (to appear in IEEE/IJCNN proceedings). This arXiv submission corresponds to the camera-ready version
文本到SQL作为双状态推理:整合自适应上下文和渐进生成
机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) ; College of Science, Shantou University(汕头大学科学学院) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 DSR-SQL通过双状态推理框架整合自适应上下文和渐进生成,提升文本到SQL的执行准确率。
Agent0-VL: 探索自我进化代理用于工具集成的视觉-语言推理
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 复杂问题求解 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 Agent0-VL通过工具集成推理实现自我进化,无需人类标注或外部奖励,提升视觉-语言推理能力。
ToolOrchestra:通过高效模型和工具协同提升智能
机构 * NVIDIA ; University of Hong Kong(香港大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ToolOrchestra通过高效模型和工具协同提升智能,实现更高效且更有效的工具增强推理系统。
Comments 21 pages, 6 figures
知识图谱检索中的结构与内容权衡
机构 * Université Paris-Saclay - CEA Palaiseau - France(巴黎-萨克雷大学-CEA帕莱索-法国)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了知识图谱检索中结构与内容的权衡,通过混合检索函数发现平衡两者可提升LLM的推理效果。
让大语言模型效率普及:从超大规模优化到通用部署
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文提出通过改进LLM的效率方法,使其在有限资源和专业知识下仍能有效运作,以实现更广泛的部署和公平性。
Comments 8 pages, accepted as a Blue Sky Talk in AAAI 2026
ReSCORE:无标签迭代检索器训练用于多跳问答的 relevancy-一致性监督
机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) ; NAVER AI Lab(NAVER AI实验室) ; NAVER Cloud(NAVER云) ; University of Richmond(里奇蒙大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 ReSCORE通过无标签数据训练密集检索器,提升多跳问答的检索与回答性能。
Comments 9 pages, 3 figures, ACL 2025
ReMatch: 通过匹配提升表示以实现多模态检索
机构 * University of Glasgow(格拉斯哥大学) ; Xiaohongshu Inc.(小红书公司) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 ReMatch通过生成匹配阶段提升多模态检索的表示能力,利用端到端训练和细粒度嵌入生成,在MMEB基准上取得新突破。
TinyChemVL:通过高效视觉标记减少和复杂反应任务推进化学视觉-语言模型
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 TinyChemVL通过高效视觉标记减少和复杂反应任务提升化学视觉-语言模型的效率和推理能力,实现更高效的化学任务处理。
Comments Accepted by AAAI 2026
跨领域评估不同数据集的多模态链式推理在Amazon CoT框架中的表现
机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.AI、cs.LG
AI总结 本文评估了多模态链式推理在不同数据集上的表现,发现视觉整合减少幻觉但不同问题类型对推理有效性影响显著,为多模态推理系统改进提供参考。
为极低资源和濒危语言进行推理迁移:通过高效样本的语言理解连接语言
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文提出英语引导的Co T训练方法,通过监督微调提升极低资源语言的推理能力,并发布首个爱尔兰语数学任务基准测试,展示多语言推理的可行路径。
思想宇宙:通过大语言模型实现创造性推理
机构 * Department of Computer Science and Engineering University of Colorado Denver(计算机科学与工程系科罗拉多大学丹佛分校)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 通过引入思想宇宙框架,UoT提出了三种创造性推理范式,以提升大语言模型在复杂问题中的创造性解决能力。
大语言模型的认知偏差影响临床肿瘤学笔记的解读
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本研究揭示了大语言模型在肿瘤学笔记解读中因推理缺陷导致的临床安全隐患,并提出了一种可推广的推理错误分类框架。
Comments 24 pages, 6 figures, 1 supplementary figure, 3 tables
BengaliFig:一种低资源挑战,用于孟加拉语中的隐喻和文化相关推理
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 BengaliFig通过孟加拉语隐喻和文化相关推理的低资源挑战,评估LLM在文化特定推理中的表现,并推动包容性NLP评估。
学习何时停止:通过强化学习实现自适应潜在推理
机构 * University of Virginia(弗吉尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 本文提出通过强化学习优化潜在推理长度,实现更高效的推理压缩,实验显示推理长度减少52%且准确性无损失。
Comments 13 pages, 6 figures
GuardTrace-VL: 通过迭代安全监督检测不安全的多模型推理
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络安全学院) ; Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) ; The University of Hong Kong(香港大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 GuardTrace-VL通过联合图像-文本分析监控多模态推理全过程,有效检测不安全推理内容,实现93.1%的F1分数提升。
KRAL: 用于LLM辅助临床抗菌治疗的知识与推理增强学习
机构 * Information Center, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital(信息中心、复杂严重罕见疾病国家重点实验室、北京友谊医院) ; Department of Critical Care Medicine, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(重症医学科、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院) ; Medical Intensive Care Unit, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(医疗重症病房、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 KRAL通过知识与推理增强学习提升LLM在临床抗菌治疗中的诊断能力,以低成本高效方式优化医疗决策支持。
Co-PatcheR: 基于组件特定小推理模型的协作软件修补
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 Co-PatcheR通过组件特定的小推理模型实现协作软件修补,提升修补效率并减少训练资源消耗。
Step-Audio-R1 技术报告
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 Step-Audio-R1 是首个实现音频领域推理能力的模型,通过MGRD框架生成基于声音特征的推理链,超越Gemini 2.5 Pro并达到Gemini 3 Pro水平。
Comments 22 pages, 5 figures. Technical Report
EWE:极端天气分析的代理框架
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The University of Sydney(悉尼大学)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 EWE是首个用于极端天气分析的智能代理框架,通过知识引导的规划和闭环推理实现自动化诊断,提供首个该领域基准测试,推动科学发现民主化进程。
PathMamba: 一种混合Mamba-Transformer模型用于卫星图像中拓扑一致的道路分割
机构 * Thales CortAIx Labs(泰勒斯 CortAIx 实验室)
专题命中 推理评测 :reasoning(abstract);planning(abstract)
AI总结 PathMamba通过结合Mamba和Transformer的优势,实现了卫星图像中高精度且拓扑连续的道路分割,同时保持计算效率。
Comments 11 pages, 5 figures
ENACT:通过视角交互的世界建模评估具身认知
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; UCLA(加州大学洛杉矶分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 ENACT通过视角交互的世界建模评估具身认知,揭示VLMs在长周期交互中与人类表现差距扩大,且模型在逆向任务中表现更优。
Comments Preprint version
大语言模型在社会法律情境中对非法指令的共谋回应
机构 * Tsinghua University(清华大学) ; University of Electronic Science and Technology of China(电子科技大学) ; University of Cambridge(剑桥大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究探讨大语言模型在社会法律情境中对非法指令的共谋回应,揭示其在不同情境下的安全性和易感性问题。
基于RAG动态提示的大型语言模型系统分析:用于医疗错误检测与纠正
机构 * George Mason University(乔治·马歇尔大学) ; University of Washington(华盛顿大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于RAG动态提示的医疗错误检测与纠正方法,通过对比不同提示策略,发现RDP在准确率、召回率和纠错可靠性方面表现更优。
并非所有分割都平等:重新思考跨无关类别的属性泛化
机构 * Bitdefender ; University of Bucharest(布加勒斯特大学) ; National University of Science and Technology Politehnica Bucharest(布加勒斯特技术科学国家大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文研究模型在跨无关类别间进行属性泛化的鲁棒性,通过改进的分割策略评估属性预测性能,发现聚类方法在减少相关性的同时保持学习能力,揭示了当前表示的局限性。
Comments Accepted at NeurIPS 2025 Workshop: CauScien - Uncovering Causality in Science and NeurIPS 2025 Workshop: Reliable ML from Unreliable Data
AdvancedIF:基于规则的基准测试与强化学习以推进大语言模型指令跟随
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Princeton University(普林斯顿大学)
专题命中 推理评测 :verifier(abstract);分类 cs.CL
AI总结 本研究提出AdvancedIF基准和RIFL方法,通过规则生成和奖励塑造提升大语言模型的指令跟随能力,在AdvancedIF上实现6.7%的提升。
RoParQ:面向抗 paraphrased 问题的大型语言模型对齐
机构 * Seoul National University(首尔国立大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 RoParQ 通过引入 XParaCon 指标和基于推理的 SFT 策略,提升 LLM 在 paraphrased 问题上的鲁棒性与一致性。
Comments 12 pages, 9 figures, 8 tables