arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-28 至 2026-01-28 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 11 篇

2510.09110 2026-01-28 cs.CV cs.AI 82%

Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding

合成对象组合用于检测、分割和接地任务中的可扩展和准确学习

Weikai Huang, Jieyu Zhang, Taoyang Jia, Chenhao Zheng, Ziqi Gao, Jae Sung Park, Winson Han, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 合成对象组合(SOC)通过新的以对象为中心的组合策略,实现了准确且可扩展的数据合成流程,提升了检测、分割和接地任务的性能,尤其在低数据和封闭词汇场景中表现突出。

Comments Project website: https://github.com/weikaih04/Synthetic-Detection-Segmentation-Grounding-Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08512 2026-01-28 cs.CV cs.AI 81%

MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding

MLVTG: 基于Mamba的特征对齐与LLM驱动的多模态视频时间定位

Zhiyi Zhu, Xiaoyu Wu, Zihao Liu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 MLVTG通过结合MambaAligner和LLMRefiner,实现了多模态视频时间定位的高精度定位与语义净化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19222 2026-01-28 cs.CV cs.AI 73%

UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection

UniPCB: 一个统一的视觉-语言基准用于开放式PCB质量检测

Fuxiang Sun, Xi Jiang, Jiansheng Wu, Haigang Zhang, Feng Zheng, Jinfeng Yang

机构 * Shenzhen Polytechnic University(深圳职业技术大学) Southern University of Science and Technology(南方科技大学) University of Science and Technology Liaoning(辽宁科技大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 UniPCB提出一个统一的视觉-语言基准用于开放式PCB质量检测,通过系统化流程和PCB-GPT模型提升缺陷定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19498 2026-01-28 cs.CV cs.AI cs.LG 67%

Cortex-Grounded Diffusion Models for Brain Image Generation

基于皮层的扩散模型用于脑图像生成

Fabian Bongratz, Yitong Li, Sama Elbaroudy, Christian Wachinger

机构 * Lab for AI in Medical Imaging, Technical University of Munich, Germany(慕尼黑技术大学医学影像人工智能实验室) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Cor2Vox通过结合皮层结构先验,实现了高精度的脑MRI合成,能生成解剖学一致且生物合理的图像,适用于多种脑部疾病模拟和数据集和谐化任务。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19752 2026-01-28 cs.AI 57%

Agentic Design Patterns: A System-Theoretic Framework

代理设计模式:一种系统理论框架

Minh-Dung Dao, Quy Minh Le, Hoang Thanh Lam, Duc-Trong Le, Quoc-Viet Pham, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork Vietnam National University(越南国家大学) IBM Research Ireland(IBM爱尔兰研究) Trinity College Dublin(都柏林三一学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种系统理论框架,通过分解代理AI系统为五个核心功能子系统,提出12种代理设计模式,以解决代理设计中的重复问题,提升自主系统的模块化和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19607 2026-01-28 cs.AI 57%

ComAgent: Multi-LLM based Agentic AI Empowered Intelligent Wireless Networks

ComAgent:基于多LLM的代理式AI赋能智能无线网络

Haoyun Li, Ming Xiao, Kezhi Wang, Robert Schober, Dong In Kim, Yong Liang Guan

机构 * IEEE

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 ComAgent通过多LLM代理式AI框架,实现复杂无线网络任务的自动化设计与优化,展现出超越单体LLM的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19281 2026-01-28 cs.HC 50%

Gazeify Then Voiceify: Physical Object Referencing Through Gaze and Voice Interaction with Displayless Smart Glasses

通过眼动和语音交互实现无显示屏智能眼镜的物理物体指认

Zheng Zhang, Mengjie Yu, Tianyi Wang, Kashyap Todi, Ajoy Savio Fernandes, Yue Liu, Haijun Xia, Tovi Grossman, Tanya Jonker

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 无显示屏智能眼镜通过眼动和语音交互实现物理物体指认,结合先进分割与视觉-语言模型,提升交互准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19021 2026-01-28 cs.HC 50%

Listening before Asking: Lived-Experience Advisors as Methodological Partners in Dementia Caregiving Studies

在提问前倾听:生活经验顾问作为痴呆症照护研究的方法学伙伴

Joy Lai, Kelly Beaton, David Black, Alex Mihailidis

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨了生活经验顾问在痴呆症照护研究中的方法学作用,通过提前参与的方法学伙伴角色,提升研究的伦理性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17540 2026-01-28 cs.SE 50%

SGCR: A Specification-Grounded Framework for Trustworthy LLM Code Review

SGCR:一种基于规范的可信大语言模型代码审查框架

Kai Wang, Bingcheng Mao, Shuai Jia, Yujie Ding, Dongming Han, Tianyi Ma, Bin Cao

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SGCR通过规范引导LLMs实现可信代码审查,其双路径架构在工业环境中提升了42%的开发者采纳率。

Comments Accepted at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18810 2026-01-28 quant-ph physics.hist-ph 50%

Interaction-Conditional Semantics and the Dissolution of Quantum Paradoxes

交互条件语义与量子悖论的消解

Jonathon Sendall

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过交互条件语义消解量子力学中的多个经典悖论,提出基于物理测量几何的相对谓词原则,重构贝尔定理和科赫-斯佩克尔定理,实现对经验现实的客观解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00008 2026-01-28 q-bio.NC 50%

The Copernican Argument for Alien Consciousness; The Mimicry Argument Against Robot Consciousness

第谷论证与机器人意识的反对论;模仿论证

Eric Schwitzgebel, Jeremy Pober

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 基于第谷观点和模仿论证,推翻平衡原则,探讨外星人和机器人意识的判断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏