Hierarchical Latent Reasoning for LLM-based Recommendation
面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。
基于因子图的进化感知多序列比对抽样推理
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 研究针对MSA抽样在有限预算下难以控制进化信号的问题,提出将其作为优化问题,引入基于亲和传播的因子图方法AP-REASONER,通过特定因子和控制旋钮进行推理,实验表明该方法在下游任务中表现优异,能可控恢复蛋白质构象。
用于量化小语言模型推理的CUSUM形状的推理时间监测和目标重解码
机构 * Novelis Research(诺贝丽斯研究中心)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究量化小语言模型推理时轨迹问题,提出MGT - B方法,通过映射窗口到概率、累积因子等操作监测并响应警报,经实验得出该方法对特定设置有一定效果,支持选择性监测与修复机制。
原生主动感知作为全模态理解的推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。
Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent
通过概念链进行隐式推理引导
机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) ; Department of Computer Science, University of California, Davis(加利福尼亚大学戴维斯分校计算机科学系)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 研究大语言模型推理脆弱性,提出概念链方法,通过生成连接段落继续预训练模型,使自然文本能引导模型预测,揭示推理脆弱性可被利用,为潜在偏差影响模型决策创造渠道。
EVOQUANT:用于稳健量化交易的自进化验证器引导策略优化
机构 * HKUST(GZ)(香港科技大学(广州)) ; Paradoox AI Research(悖论人工智能研究)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 研究针对量化策略优化多依赖人工且易出错的问题,提出EVOQUANT框架,利用大语言模型诊断瓶颈、生成候选编辑,经多阶段验证选最佳策略,能提炼经验持续改进,实验表明该方法有效提升夏普比率,为金融策略研究提供新途径。
交互缩放:奠定测试时计算的第三轴基础
机构 * Pine AI(松树人工智能公司) ; University of Washington(华盛顿大学)
专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI
AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。
用于量化推理模型的校准e-CUSUM解码:为何令牌对数概率不适用于解码监测
机构 * Novelis Research(诺贝丽斯研究公司)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究针对低比特量化推理模型思维链退化问题,指出用居中令牌对数概率监测解码不可行。提出结合退化感知警报分数与校准e过程检测器的解码控制器,经GSM8K实验验证其有效性及不足,给出方法层面的解释与替代方案。
选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据
机构 * WSO2
专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.LG
AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。
Comments 11 Pages, 5 Figures
截断步骤级采样与过程奖励用于检索增强推理
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出SLATE方法,通过截断步骤级采样和密集过程奖励解决检索增强推理中的信用分配问题,实验表明其在多跳任务中表现优异。
AutoCedar:用于验证器引导的访问控制策略合成的智能体框架
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 研究针对大语言模型将自然语言需求转化为访问控制代码存在的问题,构建验证器引导系统AutoCedar,先转化需求为可检查目标,再合成Cedar策略,通过分解意图原子等实现端到端策略编写,在多任务和案例中表现良好。
Comments 11 pages, 2 figures
打破失败级联:面向医学多模态推理的步骤感知强化学习
机构 * Korea University(高丽大学) ; Upstage AI ; Kyung Hee University(庆熙大学) ; KAIST(韩国科学技术院) ; Hanyang University College of Medicine(汉阳大学医学院) ; AIGEN Sciences
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出步骤感知强化学习算法MRPO,通过为早期错误推理步骤分配指数级惩罚,打破失败级联,显著提升医学视觉问答准确率。
利用同质性感知的结构和语义文本属性图压缩提升LLM推理能力
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出HS2C框架,通过结构熵最小化进行全局层次划分以识别同质社区,并利用检测到的结构同质性指导LLM进行差异化语义聚合,在10个节点级和7个图级基准上同时提升压缩率和推理精度。
面向大语言模型的推理时保形推理与有效事实性控制
机构 * Machine Learning, ICML(机器学习,国际机器学习大会)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出推理时保形推理框架,将保形预测集成到推理图生成中,通过图级不确定性校准生成停止阈值,实现有效事实性控制。
Comments Accepted at ICML 2026
生成式推理重排序器
机构 * Meta AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出GR2框架,利用大语言模型的推理能力进行推荐重排序,通过语义ID编码、推理轨迹监督微调和强化学习优化,在Recall@5和NDCG@5上超越现有方法。
Comments 31 pages
SCI-PRM:用于科学推理验证的工具感知过程奖励模型
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Shanghai AI Lab(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; Tongji University(同济大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 针对科学推理中工具使用和事实一致性问题,提出Sci-PRM模型,通过构建包含工具链轨迹的数据集SCIPRM70K并训练过程奖励模型,在测试时扩展和强化学习中提供细粒度监督,提升基础模型性能。
Comments Accepted by KDD 2026 AI4Science Track
通过解耦证明者-验证者游戏减轻可读性代价
机构 * KAIST(韩国科学技术院)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 提出解耦证明者-验证者游戏(DPVG),通过分离正确性与可检查性训练一个翻译器模型,将固定求解器的解转化为可检查形式,在保持答案正确性的同时提高可检查性,解决了可读性代价问题。
Comments ICLR 2026 Workshop Trustworthy AI
形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理
机构 * University of Michigan(密歇根大学) ; Amazon(亚马逊)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。
Comments Accepted to KDD 2026
基于自适应工人分配的多智能体推理用于立场检测
机构 * Kansas State University(堪萨斯州立大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 提出一种Manager-Worker多智能体框架,通过自适应分配工人智能体进行推理级合成,而非标签级投票,在隐式和上下文依赖的立场检测上显著提升性能。
面向叙事任务的轻量级潜在推理
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) ; CIFAR Fellow
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 提出LiteReason方法,通过轻量级推理投影器生成连续潜在令牌,在强化学习中动态切换潜在与离散推理,将推理长度减少77-92%,同时保持接近非潜在RL的性能。
Ishigaki-IDS:一种面向建筑信息模型中信息交付规范起草的开放权重验证器感知模型
机构 * ONESTRUCTION Inc.(ONESTRUCTION公司) ; AWS GenAI Innovation Center(AWS生成式AI创新中心)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL
AI总结 针对BIM项目中IDS编写瓶颈,提出开放权重LLM Ishigaki-IDS,结合持续预训练、监督微调和基于验证器奖励的强化学习,生成可通过外部验证器检查的IDS草案,在基准上显著优于基线,并减少54.7%工作时间。
Comments 8 pages, 2 figures, 5 tables. Preprint
重回正轨:在扩散大语言模型中对齐奖励与状态以进行推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Tongyi Lab(通义实验室) ; Northeastern University(东北大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 针对扩散大语言模型强化学习中过程奖励与状态轨迹的双重错位问题,提出PAPO框架,通过步骤感知过程奖励和熵引导历史重演实现对齐,在四个基准上取得显著提升。
简单、困难与可学习:面向LLM推理的置信度与难度自适应策略优化
机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) ; Stanford University(斯坦福大学) ; Sydney AI Centre, The University of Sydney(悉尼大学人工智能中心)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 针对GRPO训练中均匀采样导致计算效率低的问题,提出CoDaPO方法,通过置信度和难度自适应重加权与重采样,在固定预算下提升可学习问题的发现,在12个基准上优于现有RL方法。
Comments Published in ICML 2026
无教师自训练放大但不复合:自由验证器域上的 Pass@$K$ 交叉
机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG
AI总结 在自由验证器域上,使用无教师自训练(STaR)和批评者指导的选择,发现自训练放大模型能力但不复合,通过 Pass@$K$ 交叉诊断证实。
推理的影子价格:LLM最优预算分配的经济学视角
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文从经济学视角将推理预算分配建模为全局约束优化问题,提出基于影子价格的CLEAR方法,通过理性放弃和资源再分配,在资源稀缺下显著提升总token成本与平均准确率的帕累托前沿。
世界模型遇见语言模型:论具体推理与抽象推理的互补性
机构 * Nanyang Technological University(南洋理工大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。
跨语言自一致性:面向语言模型的多语言推理
机构 * HiTZ Center, University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心) ; Reka AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 提出无监督强化学习方法,通过强制模型对跨语言等价问题产生相同答案来增强多语言推理,在MGSM上平均提升21.7%,并展现出强泛化能力。
Comments Paper under review
FineVerify: 通过细粒度自验证扩展智能搜索的测试时计算
机构 * National University of Singapore(新加坡国立大学)
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL
AI总结 提出FineVerify细粒度自验证框架,将问题分解为可检查的子问题,对候选答案逐项验证并聚合得分,在四个智能搜索基准上显著优于标准扩展基线。
Comments 8+18 pages, 6 tables, 11 figures
认知支点与视觉锚定:揭示并纠正多模态推理模型中的幻觉
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 龙城人工智能学院) ; South China Agricultural University(华南农业大学) ; South China Normal University(华南师范大学) ; Monash University(莫纳什大学) ; Jishou University(吉首大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 针对多模态大推理模型在长链推理中易产生幻觉的问题,提出V-STAR训练范式,通过分层视觉注意力奖励和强制反思机制,将视觉锚定引入推理过程以减轻幻觉。
Comments TPAMI under review
语言模型推理中带有重置的信用分配
机构 * Meta AI ; Columbia University(哥伦比亚大学) ; Meta Superintelligence Labs(Meta超智能实验室) ; Tel Aviv University(特拉维夫大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出随机重置策略优化(RRPO)和自重置策略优化(SRPO)两种方法,通过重置到中间状态并重新采样反事实延续来改进语言模型多步推理中的信用分配,SRPO在多个推理基准上优于标准GRPO和RRPO。