arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2608.24302 2026-08-26 cs.AI 新提交 89%

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法

Guoyang Xu, Hao Chen

机构 * Tencent(腾讯)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24325 2026-08-26 cs.AI 新提交 85%

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

SonarLLM:一种用于水下感知的原生声呐-光学多模态大语言模型

Cong Su, longxuan ma, Ling Dong, Guofeng Tang, Weijie Yin, Haohui Chen, Zhengtao Yu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Yunnan Key Laboratory of Artificial Intelligence(云南省人工智能重点实验室)

专题命中 视觉问答 :multimodal large language model(title);MLLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型不适用于水下声呐-光学感知的问题,提出SonarLLM模型,结合专用编码器与分层融合机制,在SonarBench基准上实现了优异的水下感知性能,凸显了声呐的互补价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24011 2026-08-26 cs.CL cs.AI 新提交 70%

SAGE: From Direct Answering to Evidence-Grounded Inference for Chinese Ancient Document Understanding

SAGE:面向中国古代文献理解的从直接回答到证据导向推理

Yuchuan Wu, Xuan Luo, Yinglian Zhu, Meng Fang, Xiangyang Xue, Bin Li

机构 * Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 针对现有大型视觉语言模型(LVLMs)在古代文献理解中证据支撑不足的问题,本文提出SAGE多智能体框架,通过多阶段证据导向推理实现任务规划、证据获取与验证,在AncientDoc基准上优于基线,搭载Qwen3.5-9B的SAGE性能超更大单体模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12202 2026-08-26 cs.PL cs.AI cs.CR cs.LG 版本更新 62%

Quasar: A Programming Language Specialized for LLM Code Actions

Quasar:一种专门用于LLM代码操作的编程语言

Stephen Mell, Botong Zhang, David Mell, Shuo Li, Ramya Ramalingam, Nathan Yu, Stephan Zdancewic, Osbert Bastani

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出专门用于LLM代码操作的编程语言Quasar,通过分离内部代码与外部调用实现新特性,还实现了访问控制、自动并行化、共形预测等增强代码操作的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24134 2026-08-26 cs.CV 新提交 57%

EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI

EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力

Junlong Li, Junxi Li, Jianjun Gao, Chen Cai, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :visual language model(abstract);分类 cs.CV

AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24221 2026-08-26 cs.SE cs.CL cs.PL 新提交 50%

DeepRepoQA: Code Repository Question Answering with Deep Agent Exploration

DeepRepoQA:基于深度智能体探索的代码仓库问答系统

Weihan Peng, Yuling Shi, Yingwei Ma, Longfei Yun, Beijun Shen, Xiaodong Gu

专题命中 视觉问答 :grounding(abstract)

AI总结 针对现有代码仓库问答方法缺乏深度推理能力的问题,提出基于LLM智能体与蒙特卡洛树搜索的DeepRepoQA框架,在SWE-QA基准上实现了性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏