arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 25 篇

2608.30156 2026-09-01 cs.CL 新提交 77%

Reactivating Test-Time Scaling for Plane Geometry Problem Solving

重新激活平面几何问题求解的测试时缩放能力

Xiaoqiang Kang, Shengen Wu, Maizhen Ning, Xiaobo Jin, Kaizhu Huang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) University of Liverpool(利物浦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hithink Research(海天瑞声研究院) Digital Innovation Research Center, Duke Kunshan University(昆山杜克大学数字创新研究中心)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 该研究针对平面几何问题求解中测试时缩放失效的问题,提出多轨迹合成、感知增强训练及共识引导多轨迹集成方法,提升了不同模型规模下的几何问题求解性能,且采样成本最高降低8倍。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30751 2026-09-01 cs.AI cs.CV 新提交 74%

Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models

自回归马赛克:探测仅文本语言模型的二维空间推理能力

Ashwin Nedungadi, Stefan Oehmcke, Stefan Lüdtke

机构 * Institute for Visual & Analytic Computing (VAC), University of Rostock(罗斯托克大学视觉与分析计算研究所(VAC))

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 该研究引入AM-Bench基准,发现仅文本LLMs的二维空间表现取决于模型和输出介质,无法仅用代码生成能力解释,其开放式布局表现存在显著差异。

Comments WACV 2027 Submission Pre-Print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01914 2026-09-01 cs.CL cs.CV 版本更新 74%

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

多模态大语言模型空间推理中空间词汇偏差的机制诊断

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII LLMC(日本国立信息与通信技术研究所语言模型中心) RIKEN AIP(日本理化学研究所先进理工研究所) Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) The University of Osaka(大阪大学) University of Tokyo(东京大学)

专题命中 视觉空间推理 :reasoning(title);分类 cs.CL

AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。

Comments 27 pages. Accepted to EMNLP 2026 (Main Conference); camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18364 2026-09-01 cs.AI cs.GR cs.MA 版本更新 70%

Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

基于LLM的Manim动画生成的训练与代理推理策略

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出ManimTrainer和ManimAgent,结合监督微调与强化学习,提升文本到代码到视频的转换性能,通过ManimBench评估17种模型,结果显示GRPO和RITL-DOC策略显著提升动画生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28678 2026-09-01 cs.CV cs.GR 新提交 67%

Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs

评估用于可缩放矢量图形生成的约束迭代优化方法(基于现成的视觉语言模型)

Matthew Perlman, James Beetham, Niels Da Vitoria Lobo, Amrit Singh Bedi, Mubarak Shah

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Central Florida(中佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract)

AI总结 本研究评估结合视觉反馈、结构化编辑与约束解码的约束迭代优化方法,探索用现成VLMs生成SVG的能力,发现约束解码提升编译成功率但VLMs存在视觉推理不足的局限。

Comments Accepted to Pacific Graphics 2026 Poster Track. 2 Pages. 2 Figures. 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14086 2026-09-01 cs.CV cs.AI cs.CL 版本更新 62%

Error-Driven Scene Editing for 3D Grounding in Large Language Models

面向大语言模型中3D grounding的错误驱动场景编辑

Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对3D大语言模型的空间grounding偏差问题,提出错误驱动框架DEER-3D,通过结构化循环生成针对性反事实训练示例,在多基准上实现4%-6%的性能增益。

Comments Accepted by ECCV 2026. Code: https://github.com/zhangyuejoslin/Deer-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30935 2026-09-01 cs.RO cs.AI 新提交 57%

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

LightNav-0:激发视觉语言模型的空间智能以实现通用具身导航

Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 LightNav-0 是激发 VLM 空间智能的通用具身导航模型,单模型支持多导航任务,在仿真基准和真实场景中均实现最优性能,具备强泛化能力。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30426 2026-09-01 cs.CL 新提交 57%

Learning to Reason and Use Tools through Unsupervised Fine-Tuning in Task-Oriented Dialog Systems

面向任务的对话系统中通过无监督微调学习推理与使用工具

Markel Ferro, Oier Lopez de Lacalle

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU HiTZ中心 - Ixa)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对任务导向对话系统的动态信息检索缺陷,提出适配ReAct框架的无监督微调方法,使LLMs可访问外部知识,其微调后的8B模型性能超越70B上下文系统,在SIMMC数据集上表现优异。

Comments Accepted to SEPLN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30396 2026-09-01 cs.AI cs.RO 新提交 57%

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

将基础模型搭建为物理世界智能体以推动长时程导航前沿

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Inc(阿里巴巴集团) Zhongguancun Academy(中关村学院) Adelaide University(阿德莱德大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30307 2026-09-01 cs.CV cs.AI 新提交 57%

ScenePilot: Grow-and-Repair Policy for Text-Driven 3D Indoor Scene Generation

ScenePilot:面向文本驱动的3D室内场景生成的生长-修复策略

Jiawei Zhang, Hongsong Wang, Pan Zhou

机构 * Southeast University(东南大学) Singapore Management University(新加坡管理大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 ScenePilot是一种检索增强的生长-修复框架,通过HRAP模块检索布局先验、RMR模块进行轻量修复,实现了高效的文本驱动3D室内场景生成,提升了物理合理性等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29114 2026-09-01 cs.RO cs.AI 新提交 57%

CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation

CGFM-Nav:用于语义引导的终身多模态具身导航的认知图场记忆

Yuxiang Xiao, Xibei Chen, Xin Zhou, Jie Chen, Yifeng Zhang, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对视觉与语言导航中环境表征的不足,提出CGFM及基于其的CGFM-Nav框架,在GOAT-Bench实验中提升了导航的成功率与SPL,验证了方法的有效性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28707 2026-09-01 cs.CL cs.CV 新提交 57%

ReVA: A Region-Aware Visual Assistant for Visually Grounded Question Answering

ReVA:面向视觉接地问答的区域感知视觉助手

Anoop Senthil

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对多模态大语言模型视觉问答中存在的物体幻觉问题,提出区域感知模型ReVA,通过双桥接结构融合整图与区域特征,在POPE数据集上将平均F1提升至82.85%,有效改善了视觉接地效果。

Comments 11 pages. Code: https://github.com/anoop675/reva

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23491 2026-09-01 cs.CV cs.CL 版本更新 57%

PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation

PlanCraft:用于受建筑师启发的渐进式3D住宅场景生成的草图绘制、细化和布置

Pengyu Zeng, Yuqin Dai, Jun Yin, Ziyang Han, Ng Cheuk Hei, Jing Zhong, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Shuai Lu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对自动住宅平面图生成中忽视的设计渐进性及二维平面图重要性问题,提出PlanCraft,通过SketchPlan提供训练信号,PlanCraft-Diff细化草图,PlanCraft-Agent布置场景,实验显示其在FID及空间合理性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-09-01 cs.CV cs.AI 版本更新 57%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

Comments Accepted at EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16690 2026-09-01 cs.CL cs.CV 版本更新 57%

EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

EMemBench: 交互式评估VLM代理情景记忆的基准测试

Xinze Li, Ziyue Zhu, Siyuan Liu, Yubo Ma, Yuhang Zang, Yixin Cao, Aixin Sun

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 EMemBench通过交互式游戏评估VLM代理的情景记忆,发现归纳和空间推理在视觉设置中仍是瓶颈,且持续记忆对文本游戏有明显提升,但对VLM代理的提升不一致。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31005 2026-09-01 cs.CV 新提交 50%

From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents

从意图到证据:面向长视频智能体的策略引导多策略检索

Can Zhang, Baofeng Zhang, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Ruirui Li

机构 * Beijing University of Chemical Technology(北京化工大学) Baidu, Inc.(百度公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对长视频智能体现有统一证据获取方式的缺陷,提出无需训练的VESTA智能体,通过策略引导多策略检索等机制,在多个长视频基准上取得了显著性能提升。

Comments 15 pages, 5 figures, 6 tables (main paper with appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29733 2026-09-01 cs.CV 新提交 50%

XDG: Accelerated Visual Disambiguation

XDG:加速视觉消歧

Gonglin Chen, Ben Southall, Hanyuan Xiao, Wenbin Teng, Haolin Xiong, Tianwen Fu, Junyi Ouyang, Kshitij Singh Minhas, Supun Samarasekera, Rakesh Kumar, Yajie Zhao

机构 * USC Institute for Creative Technologies(南加州大学创意技术研究所) University of Southern California(南加州大学) SRI International(SRI国际公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 XDG是适配可扩展SfM的高效视觉消歧模型,通过微调Depth Anything 3并复用其相机令牌实现配对分类,在保持精度的同时将推理速度提升超3倍,大幅缩短大规模场景消歧耗时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28784 2026-09-01 cs.CV 新提交 50%

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28699 2026-09-01 cs.CV 新提交 50%

Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG

超越视觉边界:为电影检索增强生成(RAG)重新思考场景分割

Dong-Hee Kim, Seonwoo Choi, Changbeen Kim, Jungmyung Wi, Juyeon Ko, Youngju Choi, Il Hyeon Mun, Hyunwoo J. Kim, Donghyun Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文针对电影RAG场景,发现现有场景分割方法不如均匀时间分块,提出以叙事为核心的NarraScene数据集,其生成的片段作为检索单元可提升下游电影理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28697 2026-09-01 cs.RO 新提交 50%

Multi-Group Pipe Routing under Permanent Geometric Occupancy: Problem, Benchmark, and Classical Baselines

永久几何占用下的多组管道路由:问题、基准及经典基线

Deng Quan

专题命中 视觉空间推理 :planning(abstract)

AI总结 针对增材制造中多组流道永久占用体积的路由问题,提出带几何双见证冲突的形式化方法、可控难度的3D基准及CBS等经典基线,验证了CBS性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26509 2026-09-01 cs.CV 版本更新 50%

Conditional Diffusion for 3D CT Volume Reconstruction from 2D X-rays

基于条件扩散的3DCT体积重建从2DX光

Martin Rath, Morteza Ghahremani, Yitong Li, Ashkan Taghipour, Marcus Makowski, Christian Wachinger

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Western Australia (UWA)(西澳大利亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出AXON框架,通过多阶段扩散模型直接从真实X光重建高保真3DCT体积,采用粗到细策略和ControlNet优化,支持双平面X光输入并提升诊断分辨率。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 27 篇

2605.11467 2026-09-01 cs.LG cs.AI 版本更新 90%

Drop the Act: Probe-Filtered RL for Faithful Chain-of-Thought Reasoning

摒弃表演:用于忠实推理链的探针过滤强化学习

Swapnil Parekh, Naman Goyal

机构 * Intuit

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ProFIL方法,通过探针过滤强化学习减少推理链中的表演现象,提升推理链的忠实度并缩短链长,同时在多个领域和模型架构中验证了其有效性。

Comments 17 pages. Substantially revised presentation and experiments; added Naman Goyal as a co-author; expanded evaluation, controls, and scientific appendix. Core method retained

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30679 2026-09-01 cs.CL cs.AI 新提交 89%

LCoT-GV: Graph Attention Networks for Verifying Long Reasoning Chains in Large Language Models

LCoT-GV:用于验证大语言模型中长推理链的图注意力网络

Bérénice Jaulmes, Mehwish Alam

机构 * Télécom Paris(巴黎电信学院) Institut Polytechnique de Paris(巴黎理工学院) BNP Paribas(法国巴黎银行)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);verifier(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对大语言模型长推理链存在的步骤缺陷问题,提出LCoT-GV图框架结合图注意力网络验证推理链,构建新数据集且方法具竞争力。

Comments 6 pages without references, 2 tables, 1 algorithm, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28675 2026-09-01 cs.CV cs.CL 新提交 89%

Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning

用于视频推理的多智能体自增强强化学习

Mingwen Zhang, Jisheng Dang, Minqiang Yang, Bimei Wang, Bin Hu, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL

AI总结 该研究提出结合可训练Grounder与冻结Verifier的多智能体强化学习框架,在20亿参数规模下实现视频推理任务零样本迁移,相关指标优于同等规模基线,验证了冻结验证作为证据选择训练信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03782 2026-09-01 cs.CL 版本更新 83%

Reasoning over Grammar: Can Synthetic Linguistic Reasoning Traces Enhance Low-Resource Machine Translation?

基于语法的推理:合成语言推理轨迹能否增强低资源机器翻译?

Renhao Pei, Yihong Liu, Sampo Pyysalo, Hinrich Schütze, Shaoxiong Ji

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出自动生成语言推理轨迹的方法,通过上下文学习、监督微调和强化微调评估其对低资源机器翻译的影响,发现推理轨迹在推理时指导效果显著,但作为训练数据收益有限。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22635 2026-09-01 cs.CL cs.AI 版本更新 82%

Learning Composable Chains-of-Thought

学习可组合思维链

Fangcong Yin, Zeyu Leo Liu, Liu Leqi, Xi Ye, Greg Durrett

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对无标注思维链数据的组合推理任务,提出通过可组合思维链训练原子模型并结合多任务学习或模型合并,搭配拒绝采样微调,提升了大型语言模型在组合推理任务上的泛化性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06415 2026-09-01 cs.CL cs.LG 版本更新 81%

PERK: Long-Context Reasoning as Test-Time Learning

PERK:长上下文推理作为参数高效测试时学习

Zeming Chen, Angelika Romanou, Gail Weiss, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 PERK通过参数高效测试时学习方法,实现对长上下文的高效推理,显著提升模型性能。

Comments ICLR 2026, 10 pages, 7 figures, test-time learning, long context, meta-learning

Journal ref The Fourteenth International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28660 2026-09-01 cs.CL cs.AI cs.LG 新提交 80%

Test-Time Scaling for Scientific Equation Discovery

科学方程发现的测试时缩放

Haowei Lin, Hubert Lim, Xiangyu Wang, Letian Huang, Di He

机构 * Peking University(北京大学)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文将测试时缩放(TTS)应用于开放场景的自动方程发现,建模迭代搜索过程并在固定预算下对比控制器,发现搜索宽度是主导分配参数,为缩放LLM基方程发现提供了核心思路。

Journal ref EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29988 2026-09-01 cs.AI 新提交 79%

AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

AutoCRAT:针对大语言模型推理的轨迹内随机性与计算量联合控制

Hanjun Luo, Qiushi Liu, Jingya Zhang, Haihong Pang, Jiaheng Wen, Yifei Ma, Yu Yao, Chengxi Zhang, Hanrong Zhang, Yankai Chen, Hanan Salam

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) University of Washington Seattle(华盛顿大学西雅图分校) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 AutoCRAT是针对大语言模型推理的轨迹内随机性与计算量联合控制方法,仅在语义边界更新决策,在6个基准上减少推理令牌并提升准确率,且跨主干迁移性强。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03603 2026-09-01 cs.CV cs.CL 版本更新 79%

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

世界模型遇见语言模型:论具体推理与抽象推理的互补性

Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏