Monte Carlo Tree Search for Table-to-Multimodal Report Generation
面向表格到多模态报告生成的蒙特卡洛树搜索
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向表格到多模态报告生成的蒙特卡洛树搜索
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。
stratum: 一种支持大规模基于代理的机器学习工作负载的系统基础设施
机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 stratum是一种支持大规模基于代理的机器学习工作负载的系统基础设施,通过解耦流水线执行与规划推理,提升大规模代理流水线搜索效率。
Comments Accepted at PVLDB 2026 (Vol. 19, No. 11). Artifact available on GitHub
Journal ref Proc. VLDB Endow. 19(11): 3799-3806, 2026
材料科学假说生成中从图到答案的机制恢复可视化
机构 * Washington University in St. Louis(圣路易斯华盛顿大学) ; Oak Ridge National Laboratory(橡树岭国家实验室) ; Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) ; UniverseTBD ; Massachusetts Institute of Technology(麻省理工学院) ; Old Dominion University(奥多明尼昂大学)
专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对适配的 Qwen3-8B 模型 Graph-PRefLexOR-8B,构建可视化诊断工作流以追踪材料科学假说生成的图到答案机制,发现机制恢复集中于后期合成及答案起始层,可助力相关人员识别假说的机制支持变化。
从叙事中重建持久世界以实现基于叙事的交互体验
专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出从叙事中重建显式持久世界的核心方法,开发原型实现可游玩环境,为AI辅助游戏创作等提供语义基础,验证了其可行性与应用价值。
VibeSearchBench:野外长期主动搜索的基准测试
机构 * Xiaohongshu Dots Studio & Unipat AI(小红书 dots 飞 studios 与 Unipat AI)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有搜索基准中查询过于明确、单轮交互和固定模式评估导致用户体验与评估结果差距的问题,提出VibeSearch范式并构建VibeSearchBench基准,通过渐进式用户模拟和图匹配评估框架测试前沿模型,发现所有模型在长期上下文推理、主动意图激发和结构化知识构建方面仍存在显著不足。
用领域特定语言改进神经偏微分方程求解器的自动设计
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。
觅食智能体中作为动态稳态优先级的内感受注意力
机构 * Univ. of Cape Town(开普敦大学) ; Neuroscience Institute, Univ. of Cape Town(开普敦大学神经科学研究所) ; Laureate Institute for Brain Research(劳雷尔脑研究所) ; University of the Witwatersrand(金山大学) ; INRS(国家科学研究中心(加拿大)) ; Delft University of Technology(代尔夫特理工大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该研究针对有限感知带宽下的需求分配问题,构建主动推理觅食智能体,提出动态稳态优先级的内感受注意力机制,在AffectWorld实验中显著提升存活率,且收益同时作用于感知与规划,学习速度也更快。
Comments Accepted at SAB 2026 (From Animals to Animats 18), forthcoming in the Springer Lecture Notes in Artificial Intelligence proceedings. 20 pages, 11 numbered figures (12 graphics), 5 tables. The 12-page camera-ready paper is reproduced without alteration and followed by supplementary analyses that were not part of the proceedings paper. Code: https://github.com/sgrimbly/attention-aif-sab2026-snapshot
AgentForge:用于学习智能体软件工程的沉浸式角色扮演平台
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本研究提出沉浸式角色扮演平台AgentForge,让新手在多智能体代码修复工作流中担任软件工程角色,经37名新手开发者测试,该平台可提升新手的软件工程技能与智能体协作理解。
Comments 7 pages, 2 figures
Hi-TTRL:利用提示调控测试时强化学习的共识
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究针对测试时强化学习(TTRL)中共识强度不当导致的问题,提出 Hi-TTRL 框架,通过 MCMC 提示采样器调控共识强度,提升了 TTRL 的性能。
Comments 15 pages, 7 figures
GRIMIP:一种使用LLM进行MIP求解器实例特定配置的通用框架
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 提出GRIMIP框架,结合大语言模型的语义推理与贝叶斯优化的高效搜索,为混合整数规划求解器配置超参数,在MIPLIB等基准上实现超过40%的原始对偶积分减少。
信号驱动观测:面向长程任务的Web智能体
机构 * University of Cambridge(剑桥大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。
Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026
SurgNarrator:面向手术视频理解的生成式检索框架
机构 * University of Liverpool(利物浦大学) ; City University of Hong Kong(香港城市大学) ; University of Oxford(牛津大学) ; University of Strasbourg(斯特拉斯堡大学) ; IHU Strasbourg(斯特拉斯堡大学医院研究所) ; Imperial College London(帝国理工学院)
专题命中 规划推理 :reasoning(abstract)
AI总结 SurgNarrator是专为手术视频理解设计的生成式检索框架,通过构建手术词汇表、适配Qwen3-VL-Embedding-8B并采用分层检索策略,在零样本设置下于12个基准上实现性能提升且延迟大幅降低。
Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
克服动作可控世界模型中的统计偏差
专题命中 规划推理 :planning(abstract)
AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。
HELENA:面向多智能体系统的互补拓扑联合上的分层稀疏协调框架
专题命中 规划推理 :reasoning(abstract)
AI总结 HELENA 是一种 MAS 框架,通过互补拓扑联合与分层稀疏协调抑制冗余噪声,在八个基准测试上实现最优结果,平均提升 3.47%,MMLU-Pro 最高提升 10.34%,难基准提升更显著且附加成本合理。
主动式AI助手中个性化交互发起的偏好驱动在线适应
专题命中 规划推理 :reasoning(abstract)
AI总结 本文针对主动式AI助手个性化交互时机难确定的问题,提出EOPA方法,在ProPerSim基准上较最强基线提升F1分数19.80个百分点,降低推理延迟与平均每日适应时间。
用于解耦和异步强化学习后训练的双向资源调度
专题命中 规划推理 :reasoning(abstract)
AI总结 本文针对不同RL设置和工作负载下资源常空闲的问题,提出BiDiRL架构,通过开发热切换运行时、基于时间性能建模的规划器及双向调度器,减少资源空闲,在32-GPU测试平台上显著提高RL训练吞吐量。
Comments 16 pages
PhysMind:从视频到可执行世界的无训练物理推理框架
专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 PhysMind是无训练的智能体框架,为每个视频构建可执行世界,在CLEVRER、Physion++数据集及反事实问题上的物理推理准确率显著优于现有视觉语言模型。
Comments 27 pages, 18 figures. Project page: https://physmind.github.io/
Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力
机构 * HKUST(香港科技大学) ; Tencent Video(腾讯视频) ; Peking University(北京大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。
Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。
基于参考的操作:多模态空间推理的框架与流程
专题命中 视觉空间推理 :reasoning(title)
AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。
Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)
SleepVLM:基于视觉语言模型的可解释且规则驱动的睡眠分期
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出SleepVLM,一种基于规则驱动的视觉语言模型,通过多通道PSG波形图像进行睡眠分期,并生成符合AASM评分标准的临床可读解释,在保持高准确率的同时提升可解释性。
链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考
机构 * UC Berkeley(加州大学伯克利分校) ; UCLA(洛杉矶大学) ; Panasonic AI Research(松下人工智能研究)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。
Comments Project page: https://wakalsprojectpage.github.io/covt-website/
NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法
机构 * Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。
Comments 13 pages, 5 figures
EmpaAva:开源智能体式3D化身共情实时聊天机器人
机构 * National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学) ; University of Oxford(牛津大学)
专题命中 视觉空间推理 :planning(abstract);分类 cs.CL
AI总结 该研究提出首个开源智能体式3D化身共情聊天机器人EmpaAva,通过三智能体架构实现闭环多模态交互,在评估中优于多款基准模型,将开源并提供在线演示。
Comments Project&Demo: https://empaava.top/
HiSC:用于高效3D场景理解的分层空间聚类令牌压缩
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。
Comments Accepted by ACM MM 2026
SpecRoll:用于投机强化学习rollout的快慢校验器反馈自适应方法
机构 * VNU University of Engineering and Technology(越南国家大学河内理工大学) ; Viettel AI(越南电信人工智能公司)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 SpecRoll是一种投机强化学习rollout引擎,通过快慢双时间尺度自适应结合相关校验机制,在5个1.5B-14B模型和3个数学推理数据集上,相比普通GRPO和FastGRPO实现了生成与端到端速度的显著提升。
用于多轮迭代推理的链式递归语言模型
机构 * University of Maryland(马里兰大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM长上下文推理易传播早期错误的问题,提出Chained RLM推理架构,通过分阶段管理上下文提升多轮迭代推理准确率,验证其相比直接LLM回答的性能增益。
顺序是保障:基于静态优先学习提议的验证者预算代码删除
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 该研究针对验证者预算有限时的AI代码删除问题,提出DELSCOUT调度方法,结合静态与学习候选排序,提升已验证删除覆盖率并控制验证器调用,明确了模型、顺序与执行的分工。
关系响应场:黑盒大语言模型响应一致性与恢复的通用理论
机构 * Sungkyunkwan University(成均馆大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出关系响应场(RRF)理论,定义黑盒大语言模型响应恢复的内在难度γₖ(D,A),推导稀疏修复算法,通过实验验证其在响应一致性与恢复中的有效性。
在扩散噪声中寻求物理规律
机构 * Brown University(布朗大学) ; University of Edinburgh(爱丁堡大学) ; MIT(麻省理工学院)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。
Comments 15 pages