arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-24 至 2026-08-24 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 6 篇

2608.21170 2026-08-24 cs.CV cs.AI 新提交 83%

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力

Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20720 2026-08-24 cs.CV 新提交 71%

AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning

AffordAny:基于单目RGB图像的开放世界3D affordance grounding,通过视觉-语言引导的几何推理实现

Junqi Wu, Kaihua Tang, Xuanwen Chen, Hongzhi Li, Jianqiang Huang, Xian-Sheng Hua

专题命中 视觉空间推理 :reasoning(title)

AI总结 AffordAny是端到端框架,通过单目RGB图像结合VLM引导解码器与伪标签自训练,实现开放世界3D affordance grounding,在未见对象、类别等评估中表现出有效性与鲁棒性。

Comments The code and dataset are publicly available. Code: this https URL (https://github.com/lzlfwow/AffordAny). Dataset: this https URL (https://modelscope.cn/datasets/lzlfwow/AffordAny)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20366 2026-08-24 q-bio.BM cs.LG 新提交 57%

Harmonic Torsional Diffusion for Protein-Ligand Flexible Docking

用于蛋白质-配体柔性对接的调和扭转扩散

Maksim Zhdanov, Pavel Strashnov, Vladislav Kurenkov

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Harmony调和扭转扩散框架,通过对齐得分参数化与扩散过程几何,在PDBBind、PoseBusters基准及EBNA1、KRAS G12D案例中提升了蛋白质-配体柔性对接的精度与有效性。

Comments Accepted at the 2026 Workshop on Generative and Agentic AI for Biology (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17950 2026-08-24 cs.CL 版本更新 57%

Do Large Language Models Play Six Degrees of Separation? Measuring Topological Compression in Long-Context Manifolds

大型语言模型是否遵循六度分隔理论?测量长上下文流形中的拓扑压缩

Md. Faiyaz Abdullah Sayeedi

机构 * BRAC University(BRAC大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过分析LLM隐藏状态流形的几何结构,发现深度推理层的语义锚点遵循六度分隔理论,该拓扑特性可用于RAG的零样本幻觉检测,为评估事实可靠性提供了几何指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20476 2026-08-24 cs.CL 版本更新 57%

When Looks Do Not Lie: Discourse Structure Guided In-Context Learning for Faithful Diagram Generation

用上下文示例能改进教育图表生成吗?如果幻觉破坏了整体效果就不能

Evanfiya Logacheva, Arto Hellas, Tsvetomila Mihaylova, Juha Sorva, Ava Heinonen, Juho Leinonen

机构 * Aalto University(阿尔托大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过基于RST的上下文示例方法改进教育图表生成,发现高复杂度上下文增加幻觉风险,LLMs难以检测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20691 2026-08-24 cs.CV 新提交 50%

Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation

连接语言与球面空间:面向全景生成的以对象为中心的控制方法

Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对现有文本到全景生成方法难以对齐对象级方向描述的问题,提出以对象为中心的可控框架PanoCtrl,构建相关数据集并实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏