arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-16 至 2026-01-16 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 9 篇

2601.07695 2026-01-16 cs.CV 79%

Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model

平滑操作符:平滑可验证奖励激活视觉-语言模型的空间推理能力

Siwen Jiao, Tianxiong Lv, Kangan Qian, Chenxu Zhao, Xiuyuan Zhu, Tianlun Li, Xiaolong Cheng, Jinyu Li, Zhihao Liao, Yang Cai

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出平滑可验证奖励激活方法,通过平滑操作符和绝对保持GRPO框架提升视觉-语言模型对3D场景的理解能力,实现性能与数据效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02064 2026-01-16 cs.CV 79%

RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video

RTV-Bench: 通过实时视频对多模态大语言模型的连续感知、理解和推理进行基准测试

Shuhang Xun, Sicheng Tao, Jungang Li, Yibo Shi, Zhixin Lin, Zhanhui Zhu, Yibo Yan, Hanqian Li, Linghao Zhang, Shikang Wang, Yixin Liu, Hanbo Zhang, Ying Ma, Xuming Hu

机构 * HIT(哈尔滨工业大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) XJTU(西安交通大学) SDU(山东大学) CityU(城市大学) HUST(华中科技大学)

专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 RTV-Bench通过实时视频对多模态大语言模型的连续感知、理解和推理能力进行细粒度基准测试,揭示了实时模型在长时段视频处理中的性能优势与局限。

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track;

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10165 2026-01-16 cs.CV 70%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10094 2026-01-16 cs.CV cs.AI cs.LG 67%

V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation

V-Zero:基于零标注的自改进多模态推理

Han Wang, Yi Yang, Jingyuan Hu, Minfeng Zhu, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Zhejiang University(浙江大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 V-Zero通过自改进机制在无需人工标注的情况下提升多模态模型的视觉数学推理和通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10061 2026-01-16 cs.CV cs.AI 62%

CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation

CoF-T2I: 视频模型作为纯视觉推理器用于文本到图像生成

Chengzhuo Tong, Mingkun Chang, Shenglong Zhang, Yuran Wang, Cheng Liang, Zhizheng Zhao, Ruichuan An, Bohan Zeng, Yang Shi, Yifan Dai, Ziming Zhao, Guanbin Li, Pengfei Wan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 CoF-T2I通过引入链式帧推理提升文本到图像生成的质量,通过逐步视觉细化和显式推理步骤实现高质量图像生成。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09727 2026-01-16 cs.CL cs.AI cs.IR cs.LG 62%

SciNets: Graph-Constrained Multi-Hop Reasoning for Scientific Literature Synthesis

SciNets: 图约束多跳推理用于科学文献综合

Sauhard Dubey

机构 * Jaypee Institute of Information Technology(杰伊佩 Institute 信息科技学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 SciNets通过图约束多跳推理实现科学文献综合,通过多跳路径连接罕见共现的概念,提升机制解释的稳定性和多样性。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10222 2026-01-16 cs.AI 57%

Compartmentalised Agentic Reasoning for Clinical NLI

临床自然语言推理中的 compartmentalised agentic 推理

Maël Jullien, Lei Xu, Marco Valentino, André Freitas

机构 * Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester, UK(曼彻斯特大学国家生物标记中心) Idiap Research Institute, Switzerland(日内瓦IDIAP研究所) School of Computer Science, University of Sheffield, UK(谢菲尔德大学计算机科学系) École Polytechnique Fédérale de Lausanne (EPFL), Switzerland(洛桑联邦理工学院(EPFL))

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 CARENLI 通过 compartmentalisation 和验证提升临床自然语言推理的准确率,从 23% 提高到 57%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10455 2026-01-16 cs.CL cs.RO 50%

SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability

SurgGoal: 重新思考手术计划评估 via 目标满足性

Ruochen Li, Kun Yuan, Yufei Xia, Yue Zhou, Qingyu Lu, Weihang Li, Youxiang Zhu, Nassir Navab

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Strasbourg, France(斯特拉斯堡大学) University of Glasgow, United Kingdom(格拉斯哥大学) Nanyang Technological University, Singapore(南洋理工大学) University of Massachusetts Boston, USA(马萨诸塞大学波士顿分校)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 SurgGoal通过目标满足性度量重新评估手术计划,揭示视频大语言模型在安全关键环境中的性能问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09562 2026-01-16 cs.IR 50%

MM-BRIGHT: A Multi-Task Multimodal Benchmark for Reasoning-Intensive Retrieval

MM-BRIGHT: 一种多任务多模态基准用于推理密集型检索

Abdelrahman Abdallah, Mohamed Darwish Mounis, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mostafa Farouk Senussi, Mohamed Mahmoud, Mohammed Ali, Adam Jatowt, Hyun-Soo Kang

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 MM-BRIGHT是首个用于推理密集型检索的多模态基准,通过29个技术领域中的2,803个现实世界查询,评估了多模态检索模型在文本到文本、多模态到文本等任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏