arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2602.20183 2026-02-25 math.GM 50%

Quantile-Based Skewness for Fuzzy Numbers with Probabilistic Foundations: With an Application in Portfolio Optimization

基于分位数的模糊数偏度:具有概率基础的方法:在投资组合优化中的应用

Jan Schneider, Kaja Bilińska, Paul Schneider, Tomasz Szandała

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于分位数的模糊数偏度系数,通过概率基础解决模糊数不对称性量化问题,并在投资组合优化中展示其计算效率和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19560 2026-02-24 cs.HC 50%

Identifying, Explaining, and Correcting Ableist Language with AI

通过人工智能识别、解释和纠正歧视性语言

Kynnedy Simone Smith, Lydia B. Chilton, Danielle Bragg

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究探讨了大型语言模型在纠正歧视性语言和促进包容性沟通中的潜力,并通过实验评估了AI与人类注释在效果和用户偏好上的差异。

Comments 17 pages, 6 figures, Accepted for publication in CHI'26, Barcelona, Spain, April 13 - 17, 2026; CHI '26: ACM CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19276 2026-02-24 cs.SE 50%

ComUICoder: Component-based Reusable UI Code Generation for Complex Websites via Semantic Segmentation and Element-wise Feedback

ComUICoder:基于语义分割和元素反馈的组件式可重用UI代码生成用于复杂网站

Jingyu Xiao, Jiantong Qin, Shuoqi Li, Man Ho Lam, Yuxuan Wan, Jen-tse Huang, Yintong Huo, Michael R. Lyu

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 ComUICoder通过语义分割和元素反馈技术,提升复杂网站中可重用UI代码的生成质量与重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22774 2026-02-24 cs.CL 50%

Counting trees: A treebank-driven exploration of syntactic variation in speech and writing across languages

树的数量:一种基于树库的探索,研究语言中口语和写作中的句法变异

Kaja Dobrovoljc

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于树库的方法,研究口语和写作中句法结构的差异,发现口语结构较少且多样性低,揭示了模态特定的句法偏好。

Comments Accepted manuscript. Published in Corpus Linguistics and Linguistic Theory (2026)

Journal ref Corpus Linguistics and Linguistic Theory, 2026. Advance online publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18967 2026-02-24 cs.RO 50%

TactEx: An Explainable Multimodal Robotic Interaction Framework for Human-Like Touch and Hardness Estimation

TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计

Felix Verstraete, Lan Wei, Wen Fan, Dandan Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18203 2026-02-23 q-bio.BM 50%

Metrology of Complexity and Implications for the Study of the Emergence of Life

复杂性的计量及其对生命起源研究的启示

Sara Imari Walker

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过分子组装理论测量分子复杂性,以研究生命起源的物理机制,并推动跨学科的统一研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16206 2026-02-23 cs.HC 50%

The Agony of Opacity: Foundations for Reflective Interpretability in AI-Mediated Mental Health Support

透明的痛苦:面向人工智能辅助心理健康支持的反思可解释性基础

Sachin R. Pendse, Darren Gergle, Rachel Kornfield, Kaylee Kruzan, David Mohr, Jessica Schleider, Jina Suh, Annie Wescott, Jonah Meyerhoff

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种面向人工智能辅助心理健康支持的反思可解释性方法,旨在提升用户对模型输出的理解和自主性,以应对严重心理困扰的特殊需求。

Comments Accepted to IASEAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18145 2026-02-23 cs.CL 50%

Detecting Contextual Hallucinations in LLMs with Frequency-Aware Attention

基于频率感知注意力的LLM幻觉检测

Siya Qi, Yudong Chen, Runcong Zhao, Qinglin Zhu, Zhanghao Hu, Wei Liu, Yulan He, Zheng Yuan, Lin Gui

机构 * Department of Informatics, King's College London, UK(伦敦国王学院信息学院) Department of Statistics, University of Warwick, UK(沃里克大学统计系) School of Computer Science, The University of Sheffield, UK(谢菲尔德大学计算机科学学院) The Alan Turing Institute, UK(艾伦·图灵研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于频率感知注意力的轻量级幻觉检测方法,通过分析生成过程中注意力的高频成分,有效识别幻觉token,提升了LLM在上下文生成中的可靠性。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16633 2026-02-19 q-bio.PE 50%

Behavioral change models for infectious disease transmission: a systematic review (2020-2025)

传染病传播中的行为变化模型:系统综述(2020-2025)

Youngji Jo, Sileshi Sintayehu Sharbayta, Bruno Buonomo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文综述了2020-2025年间关于传染病传播中行为变化模型的研究,分析了行为适应在传播、疫苗接种和合规性中的影响,并提出了一种分类体系以指导行为过程在流行病学建模中的整合。

Comments 23 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16551 2026-02-19 cs.DB 50%

Automated Extraction of Mechanical Constitutive Models from Scientific Literature using Large Language Models: Applications in Cultural Heritage Conservation

利用大语言模型自动化提取科学文献中的机械本构模型:应用于文化遗产保护

Rui Hu, Yue Wu, Tianhao Su, Yin Wang, Shunbo Hu, Jizhong Huang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究利用大语言模型自动化提取科学文献中的机械本构模型,应用于文化遗产保护,构建了结构化数据库并提高了数据处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15766 2026-02-18 cs.SD 50%

TAC: Timestamped Audio Captioning

TAC:带时间戳的音频描述

Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, Justin Salamon

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Adobe Research, USA(Adobe 研究院) OpenAI, USA (work done while at Adobe)(OpenAI, USA)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 TAC通过生成时间接地的音频描述提升复杂声音场景的理解,结合TAC-V实现音频-视觉语义桥梁,提升文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15591 2026-02-18 cs.SE 50%

Req2Road: A GenAI Pipeline for SDV Test Artifact Generation and On-Vehicle Execution

Req2Road: 一个用于SDV测试资产生成和车载执行的生成式AI管道

Denesa Zyberaj, Lukasz Mazur, Pascal Hirmer, Nenad Petrovic, Marco Aiello, Alois Knoll

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 本文提出了一种生成式AI管道,用于SDV子系统的测试资产生成和车载执行,通过自动化生成Gherkin场景并验证其可执行性。

Comments accepted at CAiSE 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10902 2026-02-18 cs.CL 50%

Multimodal Peer Review Simulation with Actionable To-Do Recommendations for Community-Aware Manuscript Revisions

多模态同行评审模拟:面向社区意识的论文修订可操作待办推荐系统

Mengze Hong, Di Jiang, Weiwei Zhao, Yawen Li, Yihang Wang, Xinyuan Luo, Yanjie Sun, Chen Jason Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出一个多模态同行评审模拟系统,通过整合文本和视觉信息,利用检索增强生成技术提升评审质量,并生成可操作的待办列表,以提高论文修订的效率和准确性。

Comments Accepted by TheWebConf 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14653 2026-02-17 cs.CL 50%

Is Information Density Uniform when Utterances are Grounded on Perception and Discourse?

当话语基于感知和话语进行 grounding 时,信息密度是否均匀?

Matteo Gay, Coleman Haley, Mario Giulianelli, Edoardo Ponti

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究首次探讨了基于感知和话语的视觉环境对信息密度均匀性的影响,发现 grounding 能提高信息分布的均匀性,并在话语单元开始处产生最大的惊奇度降低。

Comments Accepted as main paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11848 2026-02-17 physics.geo-ph 50%

Groundwater dynamics beneath a marine ice sheet

冰架下方的地下水动态

Gabriel Cairns, Graham Benham, Ian Hewitt

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究通过建立数学模型,揭示了冰架下方沉积盆地中地下水动态受海水入侵和盆地几何形状的影响,发现海水可能被困于盆地中,并影响冰流流动。

Comments 33 pages, 11 figures

Journal ref The Cryosphere, 19, 3725-3747, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13833 2026-02-17 cs.RO 50%

Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation

语义接触场用于类别级可泛化的触觉工具操作

Kevin Yuchen Ma, Heng Zhang, Weisi Lin, Mike Zheng Shou, Yan Wu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SCFields通过融合视觉语义与密集接触估计,实现类别级可泛化的触觉工具操作,显著优于视觉和原始触觉基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13179 2026-02-16 cs.IR 50%

Fix Before Search: Benchmarking Agentic Query Visual Pre-processing in Multimodal Retrieval-augmented Generation

在搜索前修复:多模态检索增强生成中代理查询视觉预处理的基准测试

Jiankun Zhang, Shenglai Zeng, Kai Guo, Xinnan Dai, Hui Liu, Jiliang Tang, Yi Chang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出V-QPP-Bench,通过代理决策任务评估视觉查询预处理的改进,揭示视觉不完美对检索性能的严重影响及训练方法的优化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12721 2026-02-16 cs.SE 50%

Reconciling Complexity and Simplicity in the Business Model Canvas Design Through Metamodelling and Domain-Specific Modelling

通过元建模和领域特定建模在商业模型画布设计中调和复杂性与简洁性

Nordine Benkeltoum

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过元建模和领域特定建模方法,提出一种严谨且易用的商业模型画布元模型,提升其建模严谨性与实用性,促进企业建模与架构实践的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18382 2026-02-13 cs.RO 50%

One Demo Is All It Takes: Planning Domain Derivation with LLMs from A Single Demonstration

一个演示就足够:从单个演示中利用LLM进行规划域推导

Jinbang Huang, Yixin Xiao, Zhanguang Zhang, Mark Coates, Jianye Hao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 PDDLLM通过结合LLM推理与物理模拟,从单个演示中自动推导规划域,提升长时间跨度任务规划的自动化与可靠性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09901 2026-02-11 cs.IR cs.CL 50%

QP-OneModel: A Unified Generative LLM for Multi-Task Query Understanding in Xiaohongshu Search

QP-OneModel: 一个用于小红书搜索多任务查询理解的统一生成式大语言模型

Jianzhao Huang, Xiaorui Huang, Fei Zhao, Yunpeng Liu, Hui Zhang, Fangcheng Shi, Congfeng Li, Zechen Sun, Yi Wu, Yao Hu, Yunhan Bai, Shaosheng Cao

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 QP-OneModel通过统一生成式大语言模型提升小红书搜索多任务查询理解的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08545 2026-02-10 cs.IR 50%

DA-RAG: Dynamic Attributed Community Search for Retrieval-Augmented Generation

DA-RAG:动态属性社区搜索用于检索增强生成

Xingyuan Zeng, Zuohan Wu, Yue Wang, Chen Zhang, Quanming Yao, Libin Zheng, Jian Yin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DA-RAG通过动态属性社区搜索提升检索增强生成的效果,有效处理动态复杂查询,减少计算与经济成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08529 2026-02-10 cs.MA 50%

EvoCorps: An Evolutionary Multi-Agent Framework for Depolarizing Online Discourse

EvoCorps:一种用于去极化的进化多智能体框架

Ning Lin, Haolun Li, Mingshu Liu, Chengyun Ruan, Kaibo Huang, Yukun Wei, Zhongliang Yang, Linna Zhou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoCorps通过进化多智能体框架主动应对在线讨论中的极化问题,提升讨论质量并实现闭环干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22246 2026-02-10 quant-ph cond-mat.dis-nn cond-mat.str-el 50%

Complexity in multi-qubit and many-body systems

多量子比特和许多体系统的复杂性

Imre Varga

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种基于熵的复杂性度量,用于识别多量子比特和许多体系统中的非平凡量子相变和临界行为。

Comments 13 pages, 9 figures

Journal ref Phys. Rev. A 113, 022606, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07978 2026-02-10 cs.CL 50%

Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection

跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测

Rui Feng, Zhiyao Luo, Liuyu Wu, Wei Wang, Yuting Song, Yong Liu, Kok Pin Ng, Jianqing Li, Xingyao Wang

机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07371 2026-02-10 cs.DB 50%

DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation

DeepPrep: 一种基于大语言模型的自主数据准备代理系统

Meihao Fan, Ju Fan, Yuxin Zhang, Shaolei Zhang, Xiaoyong Du, Jie Song, Peng Li, Fuxin Jiang, Tieying Zhang, Jianjun Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DeepPrep通过基于树状代理推理和渐进式训练框架,实现高效且准确的数据准备,相比闭源模型具有更低的成本和更广的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23189 2026-02-10 eess.SY cs.SY 50%

The Dawn of Agentic EDA: A Survey of Autonomous Digital Chip Design

代理EDA的黎明:自主数字芯片设计的综述

Zelin Zang, Yuhang Song, Aili Wang, Bingo Wing-Kuen Ling, Qi Sun, Zhen Lei, Fuji Yang, Cheng Zhuo, Jiebo Luo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22978 2026-02-10 cs.CL 50%

ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?

ShoppingComp: LLMs 是否真的准备好为您的购物车服务?

Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia

机构 * ByteDance(字节跳动)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 ShoppingComp通过现实世界基准揭示LLM在购物代理任务中的局限性,强调其在信息定位、多约束验证和风险决策方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06001 2026-02-06 cs.RO 50%

Visuo-Tactile World Models

视觉-触觉世界模型

Carolina Higuera, Sergio Arnaud, Byron Boots, Mustafa Mukadam, Francois Robert Hogan, Franziska Meier

机构 * Paul G. Allen School of Computer Science, University of Washington(华盛顿大学保罗·G·阿伦计算机科学学院) FAIR, Meta(FAIR,Meta)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出视觉-触觉世界模型,通过融合视觉与触觉传感提升机器人在接触丰富任务中的物理建模能力,实验显示其在物体永恒性和运动定律遵守方面表现更优,并在真实机器人任务中实现更高的成功率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00377 2026-02-06 cs.CL 50%

DecompressionLM: Deterministic, Diagnostic, and Zero-Shot Concept Graph Extraction from Language Models

DecompressionLM:从语言模型中确定性、诊断性地提取零样本概念图

Zhaochen Hong, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DecompressionLM通过无状态框架实现零样本概念图提取,揭示语言模型编码内容,解决跨序列耦合、竞争解码效应和可扩展性限制问题,提升压缩模型的知识广度和事实基础评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04450 2026-02-05 cs.HC 50%

Can Theory-Informed Message Framing Drive Honest and Motivated Performance with Better Assessment Experiences in a Remote Assessment?

基于理论的信息框架能否通过更好的评估体验促进诚实和有动力的表现?

Suvadeep Mukherjee, Björn Rohles, Gabriele Lenzini, Pedro Cardoso-Leite

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过基于理论的信息框架减少作弊,同时保持表现和体验,发现不同理论概念的信息效果相似,且支持性动机干预更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏