Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection
基于无验证器共识选择的CAD生成测试时缩放
专题命中 测试时计算 :verifier(title,abstract);test-time compute(abstract);分类 cs.LG
AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于无验证器共识选择的CAD生成测试时缩放
专题命中 测试时计算 :verifier(title,abstract);test-time compute(abstract);分类 cs.LG
AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。
BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来
机构 * University College London(伦敦大学学院) ; NVIDIA(英伟达)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。
更多正确质量,更差答案:幂采样为何会失效及如何修复
机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能 State Key Laboratory)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG
AI总结 研究发现幂采样存在悖论,即提升正确轨迹概率却降低下游推理性能,归因于剂量与覆盖不匹配,提出修复后的支持保留幂采样器可逆转损失并优于标准多采样推理。
Comments 16 pages, 8 figures, 1 table. Haohui Yang and Jiaxing Sun contributed equally. Xiujun Ma is the corresponding author
提升多模态RLVR的泛化鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学) ; University of California Berkeley(加州大学伯克利分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Renmin University of China(中国人民大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。
Comments 32 pages, 5 figures
批量自适应剪枝:面向语言推理模型的周期性神经元激活感知权重剪枝
机构 * The University of Tokyo(东京大学)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本研究针对语言推理模型批量推理下自适应剪枝性能下降的问题,提出带周期性top-k选择和激活记忆的无训练剪枝方法,在DeepSeek-R1-Distill-Qwen-7B上实现39.7个百分点准确率提升与1.40倍推理加速。
Comments Accepted at COLM 2026. 28 pages, 12 figures, 18 tables. Code: https://github.com/matsuolab/batch-wise-prune
放大并不意味着具有预测性:思考模型中的推理行为
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。
Comments Published in COLM 2026
通过置信度动态实现大推理模型的早停
机构 * University of Maryland(马里兰大学) ; University of Southern California(南加州大学)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究推理过程中中间答案的置信度,提出CoDE-Stop方法利用置信度动态决定早停,无需额外训练,提升准确率与效率,减少25-50%的token使用。
SheetCompass:面向智能体电子表格推理的分层关系图
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对LLM处理电子表格时丢失多维结构语义的问题,提出SheetCompass框架,通过显式建模表内外结构关系并结合内存机制,提升智能体对复杂工作簿的推理能力。
Intern-S2-Mobius:知识与推理解耦的基础模型
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究提出知识与推理解耦的Mobius-v0架构,基于此构建的7B模型和Intern-S2-Mobius模型,分别在减少训练数据和提升推理速度的同时保持了相近的下游任务性能。
智能体事务:面向ACID兼容的智能体系统
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。
将视觉-语言-动作模型进化为具备即时工具使用能力的智能体
机构 * Astribot(星舟机器人) ; Tsinghua University(清华大学) ; Juxi Tech(矩芯科技) ; IntelliFusion Inc.(智融公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出带工具使用的智能体机器人(ART)框架,调优VLA模型以利用工具模块,在模拟及真实任务中成功率较基线高20%,为VLA系统实际部署奠定基础。
Comments 12 pages, 4 figures, Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings, 2026, pp. 1346-1357
基于大语言模型的自主代理的自修复框架
机构 * AX Center, SAMSUNG SDS(三星SDS AX中心) ; Dept. of Artificial Intelligence, Graduate School of Engineering, Yonsei University(延世大学工程研究生院人工智能系)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种可靠性感知的自修复框架,通过故障检测、可靠性评估和自动恢复机制提升基于大语言模型的自主代理的可靠性,实验表明该方法显著提高了任务成功率并增强了系统鲁棒性。
Comments 13 pages, 3 figures,1 table
Journal ref International Journal of Software Engineering and Knowledge Engineering,2026
TENET:迈向仓库级代码生成的测试驱动开发的第一步
机构 * Purdue University(普渡大学) ; Microsoft Office AI(微软办公人工智能)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。
Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)
别让AI代理占用你的文件:将信息和控制移交给文件系统以实现代理安全和自主性
专题命中 复杂问题求解 :self-correction(abstract)
AI总结 本文研究了AI代理对文件系统的滥用问题,提出YoloFS文件系统通过三种技术提升代理的安全性和自主性,减少用户交互并提高任务完成率。
大语言模型可以成为基数估计器吗?一项实证研究
专题命中 复杂问题求解 :self-correction(abstract)
AI总结 本文探讨了大语言模型在基数估计中的应用,通过实验证明其在泛化能力、复杂查询支持和数据效率方面的优势,展示了其在数据库管理系统中的潜力。
日式儿童谜语作为机器洞察与元认知的基准
专题命中 推理评测 :reasoning(title,abstract);CoT(abstract_cn);分类 cs.AI
AI总结 该研究通过日本儿童谜语构建基准,揭示机器在洞察推理和元认知控制方面的不足,为提升AI的自我评估能力提供新方向。
MedClaw:用于长程手术视频推理的启发式智能体框架
机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) ; University of Maryland(马里兰大学) ; Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) ; University of British Columbia(不列颠哥伦比亚大学) ; Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。
Second Thought:LLM智能体行动与观察时的并行推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出无需训练的推理框架Second Thought,利用LLM智能体行动与观察的空闲窗口并行推理,在多基准测试中降低轮次、减少主线程解码量,且Pass@1表现优于计算匹配对照组。
ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。
仅前向传播一次:在冻结语言模型的单次前向传播中同时完成回答与弃权(不执行)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出YOPO系统,通过训练小型网络重构残差流,在冻结Qwen2.5模型单次前向传播中同时实现回答、引导与弃权,性能优于两次前向传播基准,且在跨域等场景表现出色。
Comments 24 pages. Ziyang Luo and Zhongyao Chu contributed equally
面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。
字里行间:法律模拟中行为真实性的建模与评估
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出可控法律角色驱动的证词采集模拟器WitnessSim,采用分离行为真实性与教学实用性的评估框架,证实其行为保真度,为法律模拟性能评估提供框架。
Comments Accepted at ICML 2026 AI4Law. 47 pages, 26 tables, 14 figures
超越英语的GRPO:非英语与多语言场景下GRPO的大规模研究
机构 * Apple(苹果公司) ; Hasso Plattner Institute(哈索·普拉特纳研究所) ; ELLIS Unit Potsdam(波茨坦ELLIS单元)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对非英语及多语言场景开展GRPO大规模实证,发现母语训练推理与英语训练差距小、存在跨语言迁移但趋势依赖模型语言,指出非英语RLVR有跨语言增益但需全面评估退化问题。
BAT:基于大语言模型的空间声音推理学习
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出结合Spatial-AST与LLaMA-2 7B的BAT模型,通过合成数据集训练,实现了超越SELD任务的空间声音感知与推理,展现了LLM在空间音频领域的应用潜力。
Comments Accepted to ICML 2024. Our demo, dataset, code and model weights are available at: https://zhishengzheng.com/bat
TimeSage-EV:面向动态环境下智能体时间序列分析的实时基准测试集
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; University of Oxford(牛津大学) ; VulpiVox Intelligence(VulpiVox智能公司) ; Squirrel Ai Learning(Squirrel AI学习公司) ; Griffith University(格里菲斯大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对现有时间序列基准未评估时间有效性等问题,推出动态环境智能体时间序列分析基准TimeSage-EV,含多领域真实场景,实验揭示模型性能差距及失败模式,提供研究资源。
语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试
机构 * DGIST(大邱庆北科学技术院) ; KAIST(韩国科学技术院) ; InnoCORE LLM
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。
Comments Accepted to CVPR 2026 Findings
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026
AlignFace:具有可解释概念关系的人类对齐人脸相似度度量
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。
Comments 10 pages, 10 figures, 2 tables, ACM MM 26
P2Skill:面向云-本地大语言模型推理系统的隐私保护技能蒸馏
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对云-本地LLM推理系统的P2Skill,通过技能提示实现本地SLM自主处理PII相关操作,无需隐私微调,在四领域基准上的隐私保护推理质量较基线提升1.69倍、3.66倍。
通用科学人工智能的实现路径:科学图像的多模态理解
机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB)) ; Eindhoven University of Technology(埃因霍温理工大学) ; Freie Universität Berlin(柏林自由大学) ; International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心) ; National University of Sciences and Technology(国家科技大学) ; University of Warwick(华威大学) ; PSG College of Technology(PSG理工学院) ; Aalto University(阿尔托大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出以科学图像多模态理解构建通用科学AI的路径,依托ALD/E-ImageMiner基准与2026年ICDAR竞赛,明确相关任务能力检验维度及长期研究方向,推动可机器执行的科学视觉知识与可验证多模态科学AI发展。
Comments 15 pages, 1 figure
基于MemoryArena的MemoryLake研究:智能体记忆后端的匹配对比
机构 * MemoryLake Team(MemoryLake团队)
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 该研究在MemoryArena的五个任务领域中,对比MemoryLake等三种智能体记忆后端,发现MemoryLake在数学等三个领域成功率最高,整体平均成功率领先,且性能与工作负载相关。
Comments 16 pages, 7 tables