arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7608 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7608 篇

2512.09056 2026-04-14 cs.CV 50%

ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors

ConceptPose:基于概念向量的无训练零样本物体姿态估计

Liming Kuang, Yordanka Velikova, Mahdi Saleh, Jan-Nico Zaech, Danda Pani Paudel, Benjamin Busam

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 ConceptPose利用视觉语言模型生成开放词汇3D概念图,通过建立概念图间的3D-3D对应关系,实现无训练的零样本物体姿态估计,优于现有最佳基线62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10347 2026-04-14 cs.CV 50%

Multi-modal, multi-scale representation learning for satellite imagery analysis just needs a good ALiBi

多模态、多尺度表示学习用于卫星影像分析只需一个良好的ALiBi

Patrick Kage, Pavlos Andreadis

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出Scale-ALiBi机制,通过空间编码偏置提升多尺度多模态卫星影像表示学习效果,并在GEO-Bench基准上取得改进。

Comments Originally appeared at the 4th Space Imaging Workshop at the Georgia Institute of Technology, October 7-9, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09366 2026-04-13 cs.CV 50%

Robust 4D Visual Geometry Transformer with Uncertainty-Aware Priors

具有不确定性感知先验的鲁棒4D视觉几何变换器

Ying Zang, Yidong Han, Chaotao Ding, Yuanqi Hu, Deyi Ji, Qi Zhu, Xuanfu Li, Jin Ma, Lingyun Sun, Tianrun Chen, Lanyun Zhu

机构 * Zhejiang University(浙江大学) Huzhou University(湖州师范学院) Huawei(华为) Tongji University(同济大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出一种框架,通过建模重建过程中的不确定性,分离动态和静态成分,采用熵引导子空间投影、局部一致性驱动几何净化和不确定性感知多视角一致性机制,提升动态场景重建的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08147 2026-04-10 cs.SD cs.CV 50%

Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning

通过教师引导的双路径实现语义噪声削减

Linge Wang, Yingying Chen, Bingke Zhu, Lu Zhou, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Objecteye Inc.(北京眼神科技有限公司)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出TG-DP框架,通过分离重建与对齐路径,减少语义噪声,提升音频视频表示学习效果,实现零样本检索性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18359 2026-04-08 cs.CV 50%

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds

TRANSPORTER:从VLM流形转移视觉语义

Alexandros Stergiou

机构 * University of Twente, NL(荷兰特温特大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出TRANSPORTER方法,通过logits-to-video任务生成视频,揭示VLM预测背后的规则,为模型可解释性提供新方向。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04608 2026-04-07 cs.CV 50%

Beyond Semantics: Uncovering the Physics of Fakes via Universal Physical Descriptors for Cross-Modal Synthetic Detection

超越语义:通过通用物理描述符揭示合成检测的物理本质

Mei Qiu, Jianqiang Zhao, Yanyun Qu

机构 * SDIC Intelligence Information Technology Co., Ltd.(国投智能信息技术有限公司) Xia'men University(厦门大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出通过通用物理描述符区分真实与AI生成图像,探索跨模态合成检测中的核心物理特征及多模态模型整合方法,实现高准确率检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04496 2026-04-07 cs.CV 50%

The Indra Representation Hypothesis for Multimodal Alignment

多模态对齐的Indra表示假说

Jianglin Lu, Hailing Wang, Kuo Yang, Yitian Zhang, Simon Jenni, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(Adobe研究院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03657 2026-04-07 cs.CV cs.IR cs.MM 50%

Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning

爱我,爱我的标签:重新思考标签在视觉上下文学习中的提示检索中的作用

Tianci Luo, Haohao Pan, Jinpeng Wang, Niu Lian, Xinrui Chen, Bin Chen, Shu-Tao Xia, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出LaPR框架,通过增强标签信息提升视觉上下文学习中提示检索的性能,实验表明其在分割、检测和着色任务中表现优异。

Comments Accepted to CVPR 2026. 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19185 2026-04-06 cs.SE cs.ET 50%

An Empirical Study of Testing Practices in Open Source AI Agent Frameworks and Agentic Applications

对开源AI代理框架和代理应用测试实践的实证研究

Mohammed Mehedi Hasan, Hao Li, Emad Fallahzadeh, Gopi Krishnan Rajbahadur, Bram Adams, Ahmed E. Hassan

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文通过分析39个开源代理框架和439个代理应用,发现确定性组件消耗了70%的测试资源,而FM-based Plan Body测试不足,提出改进测试方法和促进Prompt回归测试的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29624 2026-04-01 cs.SE 50%

EcoScratch: Cost-Effective Multimodal Repair for Scratch Using Execution Feedback

EcoScratch: 低成本多模态修复用于刮痕使用执行反馈

Yuan Si, Ming Wang, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 EcoScratch通过轻量级运行时信号决定是否保持纯文本修复或升级到多模态提示,结合JSON补丁预算和验证努力,提升Scratch修复效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19910 2026-04-01 cs.CV 50%

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

通过半监督率减少实现多模态表示学习的通用类别发现

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。

Comments 15 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27898 2026-03-31 cs.CV 50%

SAGE: Sink-Aware Grounded Decoding for Multimodal Hallucination Mitigation

SAGE:面向sink的 grounded 解码用于多模态幻觉缓解

Tripti Shukla, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 SAGE通过动态调节自注意力机制,实时监控 grounding 可靠性,有效缓解多模态幻觉问题,实验显示在MSCOCO和AMBER基准上取得显著提升。

Comments 25 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23919 2026-03-31 cs.RO 50%

Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation

Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作

Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) Yuanpei College, Peking University(北京大学元培学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27500 2026-03-31 cs.CV 50%

Streamlined Open-Vocabulary Human-Object Interaction Detection

简化开放词汇人类-物体交互检测

Chang Sun, Dongliang Liao, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出SL-HOI框架,基于DINOv3模型简化开放词汇人类-物体交互检测,通过融合特征和跨注意力机制提升性能,实验显示在SWiG-HOI和HICO-DET基准上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27268 2026-03-31 cs.CV 50%

TrackMAE: Video Representation Learning via Track Mask and Predict

TrackMAE:通过轨迹掩码和预测进行视频表示学习

Renaud Vandeghen, Fida Mohammad Thoker, Marc Van Droogenbroeck, Bernard Ghanem

机构 * University of Liège(列日大学) KAUST(阿卜杜拉国王科技大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 TrackMAE通过显式利用运动信息作为重建信号,改进随机管掩码策略,提升视频表示学习的判别性和通用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27014 2026-03-31 cs.CV 50%

GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection

GUIDED: 通过识别、检测和辨别实现细粒度理解的细粒度开放词汇物体检测

Jiaming Li, Zhijia Liang, Weikai Chen, Lin Ma, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Meituan(美团) GuangDong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Research Institute, Sun Yat-sen University(中山大学深圳研究院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 GUIDED通过分解框架解决细粒度提示中主体与属性的语义纠缠问题,通过分离定位与识别任务提升细粒度开放词汇物体检测性能。

Comments NIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05422 2026-03-31 cs.CV 50%

ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

ParaUni: 通过强化驱动的分层并行信息交互增强统一多模态模型的生成

Jiangtong Tan, Lin Liu, Jie Huanng, Xiaopeng Zhang, Qi Tian, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部类脑智能感知与认知重点实验室) Huawei Inc.(华为技术有限公司)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 ParaUni通过并行提取多层视觉语言模型特征并结合强化学习动态调整机制,提升统一多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26486 2026-03-30 cs.CV 50%

ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better

ClipTTT: CLIP引导的测试时间训练帮助LVLMs看得更清楚

Mriganka Nath, Anurag Das, Jiahao Xie, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出ClipTTT方法,通过CLIP模型的图像-文本对齐能力,在测试时引导LVLMs适应退化条件,减少幻觉并提升描述准确性。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25377 2026-03-30 cs.SD 50%

Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition

联合学习全局-局部说话人分类以增强端到端说话人辨识与识别

Yuhang Dai, Haopeng Lin, Jiale Qian, Ruiqi Yan, Hao Meng, Hanke Xie, Hanlin Wen, Shunshun Yin, Ming Tao, Xie Chen, Lei Xie, Xinsheng Wang

机构 * Soul AI Lab, China(中国Soul AI实验室) X-LANCE Lab, Shanghai Jiao Tong University, China(中国上海交通大学X-LANCE实验室)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出GLSC-SDR方法,通过联合训练说话人分类与辨识识别,提升细粒度说话人区分能力,实验表明其在多个数据集上表现优异,无需依赖大规模真实对话数据。

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24653 2026-03-27 cs.CV 50%

From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition

从权重到概念:通过奇异向量分解实现CLIP的数据无关可解释性

Francesco Gentile, Nicola Dall'Asen, Francesco Tonini, Massimiliano Mancini, Lorenzo Vaquero, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Fondazione Bruno Kessler(布鲁诺·凯撒基金会)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出SITH框架,通过奇异向量分解分析CLIP视觉Transformer的权重空间,利用COMP算法实现细粒度概念解释,提升模型可解释性和下游性能。

Comments Accepted @ CVPR 2026. Project page: https://frangente.github.io/SITH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02943 2026-03-27 cs.SE 50%

Hallucination to Consensus: Multi-Agent LLMs for End-to-End JUnit Test Generation

幻觉到共识:多智能体LLM用于端到端JUnit测试生成

Qinghua Xu, Guancheng Wang, Lionel Briand, Kui Liu

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 本文提出CANDOR框架,通过多智能体协作生成Java单元测试,利用共识策略减少幻觉并提升Oracle准确性,实验表明其在代码覆盖率和突变得分上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14652 2026-03-27 hep-ph hep-ex 50%

A Method to Simultaneously Facilitate All Jet Physics Tasks

一种同时促进所有喷流物理任务的方法

Vinicius Mikuni, Benjamin Nachman

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出OmniLearn方法,通过训练特定喷流分类任务的机器学习模型,提升其他喷流物理任务的精度、速度和准确性,适用于多种数据集和碰撞系统。

Comments 12 pages, 7 figures

Journal ref Phys.Rev.D 111 (2025) 5, 054015

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15253 2026-03-25 cs.CV 50%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化模型生成的描述和人工标注揭示了模型在不同难度任务中的表现差异,并发现检测器倾向于认为响应开头的句子正确。

Comments This work was intended as a replacement of arXiv:2511.20515 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20515 2026-03-25 cs.CV 50%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

机构 * OMRON SINICX The University of Tokyo(东京大学) The University of Osaka(大阪大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化VLM生成的描述和人类标注揭示模型差异,发现检测器倾向于认可响应开头的句子,并通过强VLM过滤减少数据噪声。

Comments Previously this version appeared as arXiv:2603.15253 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15919 2026-03-24 cs.CV 50%

Sparse but not Simpler: A Multi-Level Interpretability Analysis of Vision Transformers

稀疏但不更简单:视觉转换器的多级可解释性分析

Siyu Zhang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文通过DeiT-III B/16模型评估了权重稀疏性与可解释性之间的关系,引入IMPACT框架分析四个层级,发现稀疏模型虽减少边数但节点活跃度无显著提升,表明稀疏性不必然提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23495 2026-03-24 cs.CV 50%

Embedding Shift Dissection on CLIP: Effects of Augmentations on VLM's Representation Learning

在CLIP上嵌入位移分析:不同增强对VLM表示学习的影响

Ashim Dahal, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西西比大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 研究分析不同增强技术对CLIP嵌入位移的影响,探讨增强对视觉语言模型表示学习的机械可解释性影响。

Comments accepted at MIV at CVPR 2025

Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20000 2026-03-23 astro-ph.IM 50%

Monte Carlo conformal prediction for quantifying uncertainty in radio galaxy classification under ambiguous ground truth

蒙特卡洛置信预测用于量化射电星系分类中的不确定性

Alex Walls, James Barry, Devina Mohan, Anna M. M. Scaife

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文探讨了蒙特卡洛置信预测在射电星系分类中量化不确定性方面的应用,通过对比不同不确定性度量方法,评估其有效性。

Comments Accepted to RAS Techniques & Instruments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19364 2026-03-23 cs.CV 50%

AURORA: Adaptive Unified Representation for Robust Ultrasound Analysis

AURORA:适应性统一表示用于鲁棒超声分析

Ufaq Khan, L. D. M. S. Sai Teja, Ayuba Shakiru, Mai A. Shaaban, Yutong Xie, Muhammad Bilal, Muhammad Haris Khan

机构 * MBZUAI NIT Silchar(Silchar国立理工学院) Birmingham City University(伯明翰城市大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出基于Transformer视觉编码器的统一多任务框架,解决超声图像在不同设备、操作者和解剖目标下的泛化问题,通过轻量级多尺度特征金字塔实现像素级预测与全局推理,提升多任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV 50%

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18660 2026-03-20 cs.CV 50%

Multimodal Model for Computational Pathology:Representation Learning and Image Compression

多模态模型用于计算病理学:表示学习与图像压缩

Peihang Wu, Zehong Chen, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文探讨了多模态计算病理学中的表示学习和图像压缩技术,分析了自监督学习、多模态数据生成、参数高效适应及多代理协作推理等方向,旨在提升病理诊断的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏