arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-09 至 2026-02-09 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 4 篇

2602.06166 2026-02-09 cs.CV 82%

M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning

M3:通过多模态、多智能体和多轮视觉推理实现高保真的文本到图像生成

Bangji Yang, Ruihan Guo, Jiajun Fan, Chaoran Cheng, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 M3通过多智能体和多轮视觉推理提升开源模型的文本到图像生成能力,超越商业系统并实现最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06041 2026-02-09 cs.CV 78%

Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning

从透视描述预测相机姿态用于空间推理

Xuejun Zhang, Aditi Tiwari, Zhenhailong Wang, Heng Ji

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 CAMCUE通过姿态感知的多图像框架,从自然语言描述中准确预测相机姿态,提升多视角空间推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22894 2026-02-09 cs.CR cs.AI 57%

DECEPTICON: How Dark Patterns Manipulate Web Agents

DECEPTICON:暗模式如何操纵网络代理

Phil Cuvin, Hao Zhu, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 DECEPTICON研究揭示暗模式通过引导代理轨迹对网络代理构成重大风险,表明需加强防御措施以应对操纵性设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17815 2026-02-09 cs.RO 50%

Less Is More: Scalable Visual Navigation from Limited Data

少即是多:从有限数据实现可扩展的视觉导航

Yves Inglin, Jonas Frey, Changan Chen, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利加州大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出Less is More方法,通过结合有限专家示范与规划器生成的监督,实现高效视觉导航。

Comments v2: Minor text edits, reference formatting fixes, and project page link added

详情

展开后加载摘要…

URL PDF HTML 收藏