Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection
基于无验证器共识选择的CAD生成测试时缩放
专题命中 测试时计算 :verifier(title,abstract);test-time compute(abstract);分类 cs.LG
AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于无验证器共识选择的CAD生成测试时缩放
专题命中 测试时计算 :verifier(title,abstract);test-time compute(abstract);分类 cs.LG
AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。
BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来
机构 * University College London(伦敦大学学院) ; NVIDIA(英伟达)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。
更多正确质量,更差答案:幂采样为何会失效及如何修复
机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能 State Key Laboratory)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG
AI总结 研究发现幂采样存在悖论,即提升正确轨迹概率却降低下游推理性能,归因于剂量与覆盖不匹配,提出修复后的支持保留幂采样器可逆转损失并优于标准多采样推理。
Comments 16 pages, 8 figures, 1 table. Haohui Yang and Jiaxing Sun contributed equally. Xiujun Ma is the corresponding author
提升多模态RLVR的泛化鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学) ; University of California Berkeley(加州大学伯克利分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Renmin University of China(中国人民大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。
Comments 32 pages, 5 figures