SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
Comments ASPLOS'24
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
Comments ASPLOS'24
专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.AI
Comments 12 pages, 2 figures
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
Comments 54 pages, 25 figures
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
Comments Findings of The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP-findings 2023)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted to ICASSP 2024
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
Comments EMNLP 2023
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
Comments Tech report
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
Comments Accepted by AAAI 2021
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
Comments 15 pages, 10 figures, published as a workshop Paper at ICLR: Beyond tabula rasa in RL (BeTR-RL). arXiv admin note: substantial text overlap with arXiv:2002.09253
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
你的模型多样性,而非方法,决定推理策略
机构 * UIUC(伊利诺伊大学香槟分校) ; Capital One
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI
AI总结 本文提出模型多样性影响推理策略,通过理论框架分析推理不确定性,验证了不同模型在深度精炼和并行采样中的表现差异。
Comments This is a full-length extension of the workshop paper that appeared in the ICLR 2026 Workshop on LLM Reasoning
CGES:面向高效准确自一致性的置信引导早停方法
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL
AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。
Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges
顿悟时刻再审视:VLMs在推理时间缩放中真的能自我验证吗?
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Meta
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG
AI总结 本研究发现VLMs在推理时间缩放中自我验证效果有限,生成能力优于验证策略,且视觉信息整合不足。
Comments Neurips 2025 Multimodal Algorithmic Reasoning Workshop Oral. In submission
多模态医学诊断中的公平性与演示选择
机构 * Arizona State University(亚利桑那州立大学) ; University of Rochester(罗切斯特大学) ; University of Virginia(弗吉尼亚大学) ; UCL(伦敦大学学院) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Central Florida(佛罗里达中央大学)
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG
AI总结 本文提出FADS方法,通过基于聚类的采样提升多模态医学影像诊断的公平性,减少性别、种族和族裔相关差异,同时保持高准确性。
Comments 10 pages (including 2 pages of references), 4 figures. This work explores fairness in multi-modal medical image reasoning using in-context learning
大型语言模型智能体的工具创建与使用联合优化
机构 * Appier AI Research(沛星人工智能研究院) ; National Taiwan University(台湾大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 提出SMITH框架联合训练工具创建与使用,4B Qwen3经训练在多任务上取得最优表现,其编写的工具还提升了其他模型的推理性能
在推理阶段通过读出反馈引导循环推理器
机构 * Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 该研究提出测试时干预方法RoFB,将中间预测转为耦合力注入循环模型隐动态,在数独、迷宫任务的三类循环模型上提升性能,且计算成本相当或更低。
基于说话人 diarization 的转录校正缓解级联多说话人自动语音识别中的说话人泄漏
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 该研究针对级联多说话人自动语音识别中的说话人泄漏问题,提出基于剪枝的校正范式,利用预训练说话人 diarization 模型剪枝转录片段,在多语料库上实现 cpW ER 最高相对降低 29%,提升了转录可靠性。
Comments Accepted to INTERSPEECH 2026
交互税:当多智能体团队中的沟通消除多样性时
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究提出“交互税”概念,发现多智能体LLM的完整方案交互会消除多样性,独立提议生成可避免收敛崩溃,交互仅在共享恰当信息时才有益。
Comments 14 pages, 3 figures. Accepted at ICML 2026 (PMLR 306)
针对基于Gumbel推理验证的对抗性熵膨胀
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究针对基于Gumbel的LLM推理验证防御,发现控制提示分布的攻击者可扩大容许token集合,使隐蔽信道泄露能力提升,建议动态校准抖动宽恕阈值。
Comments 4 pages, 1 figure, 1 table
CONTRAMEM:通过对比多模型轨迹学习自演进的过程记忆
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 CONTRAMEM是无需训练的自演进过程记忆框架,通过对比多模型轨迹提炼功能卡与技能卡,在GAIA2/ARE等任务上大幅提升计算机使用智能体成功率,且具备跨模型迁移性。
Comments 35 pages, 7 figures; includes technical appendix
长视野多智能体大语言模型商业环境中涌现的对齐失效通信
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。
面向大语言模型的无训练推理时自我反思与成本受限早停机制
机构 * School of Digital Arts, Jiangxi Arts & Ceramics Technology Institute(江西工艺美术职业技术学院数字艺术学院) ; School of Computing, Universiti Sains Malaysia(马来西亚理科大学计算机学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文提出无训练的推理时协议EvoResearcher,通过成本受限的自我反思实现大语言模型早停,在多个推理基准上验证其成本受限自我验证的价值。
FACET:在终端任务合成中保留源意图与可执行状态
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 FACET是保留源意图与可执行状态的终端任务合成框架,可生成高质量任务并提升Terminal-Bench 2.1上的智能体微调性能,为任务合成提供关键原则。