arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-29 至 2026-01-29 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 9 篇

2510.20707 2026-01-29 cs.CV 83%

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

融合重要性与多样性:KV缓存压缩的联合优化

Xuyang Liu, Xiyan Gui, Yuchao Zhang, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 MixKV通过融合重要性与多样性,优化KV缓存压缩,提升多模态模型的存储效率与推理性能。

Comments Accepted by ICLR 2026. Our code is available at https://github.com/xuyang-liu16/MixKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04655 2026-01-29 cs.CV cs.AI 73%

X-SAM: From Segment Anything to Any Segmentation

X-SAM:从Segment Anything到Any Segmentation

Hao Wang, Limeng Qiao, Zequn Jie, Zhijian Huang, Chengjian Feng, Qingfang Zheng, Lin Ma, Xiangyuan Lan, Xiaodan Liang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 X-SAM通过引入统一框架和VGD分割任务,提升多模态大语言模型的像素级视觉理解能力,实现更广泛的分割任务整合。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20208 2026-01-29 cs.RO cs.CV 57%

TRACER: Texture-Robust Affordance Chain-of-Thought for Deformable-Object Refinement

TRACER: 适用于变形物体细化的纹理鲁棒触觉链

Wanjun Jia, Kang Li, Fan Yang, Mengfei Duan, Wenrui Chen, Yiming Jiang, Hui Zhang, Kailun Yang, Zhiyong Li, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 TRACER通过纹理鲁棒触觉链框架,提升变形物体在复杂纹理下的触觉识别精度和长视界任务成功率。

Comments The source code and dataset will be made publicly available at https://github.com/Dikay1/TRACER

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20064 2026-01-29 cs.CV 57%

DiSa: Saliency-Aware Foreground-Background Disentangled Framework for Open-Vocabulary Semantic Segmentation

DiSa:面向开放词汇语义分割的视觉-语义解耦框架

Zhen Yao, Xin Li, Taotao Jing, Shuai Zhang, Mooi Choo Chuah

机构 * Department of Computer Science and Engineering, Lehigh University(计算机科学与工程系,莱恩大学) Department of Computer Science(计算机科学系) Engineering, Lehigh University(工程系,莱恩大学) Qualcomm AI Research(高通人工智能研究)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 DiSa通过显著性感知解耦框架和分层细化模块,有效解决开放词汇语义分割中前景偏见和空间定位不足的问题,提升分割精度。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19935 2026-01-29 cs.CL cs.AI 57%

Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents

Mem2ActBench: 一个评估面向任务的自主代理长期记忆利用的基准

Yiting Shen, Kun Li, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Mem2ActBench是一个评估自主代理利用长期记忆执行任务能力的基准,通过合成工具使用任务验证记忆应用的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00282 2026-01-29 cs.AI cs.CL 57%

Mind the Gap: The Divergence Between Human and LLM-Generated Tasks

注意差距:人类与LLM生成任务之间的差异

Yi-Long Lu, Jiajun Song, Chunhui Zhang, Wei Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究揭示了人类与LLM在任务生成中的核心差异,指出人类受心理驱动影响,而LLM在生成具身目标方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20833 2026-01-29 cs.CE 50%

Idea2Story: An Automated Pipeline for Transforming Research Concepts into Complete Scientific Narratives

Idea2Story: 一种将研究概念转化为完整科学叙述的自动化流程

Tengyue Xu, Zhuoyang Qian, Gaoge Liu, Li Ling, Zhentao Zhang, Biao Wu, Shuo Zhang, Ke Lu, Wei Shi, Ziqi Wang, Zheng Feng, Yan Luo, Shu Xu, Yongjin Chen, Zhibo Feng, Zhuo Chen, Bruce Yuan, Harry Wang, Kris Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Idea2Story通过离线知识构建实现自主科学发现,提升研究效率与可靠性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20105 2026-01-29 cs.CL 50%

FFE-Hallu:Hallucinations in Fixed Figurative Expressions:Benchmark of Idioms and Proverbs in the Persian Language

FFE-Hallu:固定修辞表达中的幻觉:波斯语中的成语和谚语基准

Faezeh Hosseini, Mohammadali Yousefzadeh, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究 institute,Khatam 大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,德黑兰,伊朗)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 FFE-Hallu是首个针对波斯语隐喻幻觉评估的基准,揭示了LLMs在处理隐喻语言方面的系统性弱点。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18697 2026-01-29 cs.HC 50%

Bridging Instead of Replacing Online Coding Communities with AI through Community-Enriched Chatbot Designs

通过社区增强的聊天机器人设计连接而非取代在线编程社区

Junling Wang, Lahari Goswami, Gustavo Kreia Umbelino, Kiara Chau, Mrinmaya Sachan, April Yi Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Community-Enriched AI设计范式,通过整合在线编程社区内容提升AI聊天机器人与社区的互动性,增强用户信任并支持学习者解决问题。

Comments Accepted at the ACM Conference on Computer-Supported Cooperative Work and Social Computing (CSCW 2026). To appear in PACMHCI

详情

展开后加载摘要…

URL PDF HTML 收藏