arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 626 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 626 篇

2607.04812 2026-07-07 cs.CV 新提交 50%

TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving

TGRIP:一种用于自动驾驶中车辆实例预测的文本引导方法

Miguel Antunes-García, Santiago Montiel-Marín, Fabio Sánchez-García, Rodrigo Gutiérrez-Moreno, Rafael Barea, Luis M. Bergasa

机构 * Electronics Department, University of Alcalá (UAH)(阿尔卡拉大学(UAH)电子系)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 研究自动驾驶中鸟瞰图实例预测问题,提出TGRIP框架,利用视觉语言基础模型生成语义增强地图作辅助监督,使网络学习时空表征,提升预测能力。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04696 2026-07-07 cs.CV 新提交 50%

Probe-EM: Targeted Neuron Tracing via Training-Free Semantic Verification

Probe-EM:通过无训练语义验证进行靶向神经元追踪

Liuyun Jiang, Yanchao Zhang, Jinyue Guo, Chuanyue Chen, Haiyang Yan, Ye Yuan, Jing Liu, Hua Han

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化所脑认知与脑机智能技术重点实验室) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 为解决自动重建算法过分割瓶颈及传统追踪方法问题,提出无训练靶向神经元追踪框架,利用几何先验和新策略迭代重建神经元形态,集成到平台减少人工校对时间。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03511 2026-07-07 cond-mat.mes-hall 新提交 50%

Robustness of quantized Hall resistivity under cavity coupling at zero temperature

零温下腔耦合时量子化霍尔电阻率的鲁棒性

Juan Román-Roche, Jie Wang, Michael Ruggenthaler, Angel Rubio, Vasil Rokaj

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 研究电磁腔强光-物质耦合对量子霍尔系统输运性质的影响,通过现象学模型揭示强光-物质相互作用下量子霍尔系统电导率和电阻率的不对称性及零温时霍尔电阻率的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01630 2026-07-03 cs.CV 新提交 50%

DRDN: Decoupled Representation Dynamic Network for From-Scratch ViT Class-Incremental Learning

DRDN: 用于从头训练ViT类增量学习的解耦表示动态网络

Bingchen Huang, Yifu Chen, Zhiling Wang, Yuanchao Du

机构 * Meituan Vision AI Department(美团视觉AI部门)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 针对类增量学习中共享表示退化与任务间干扰问题,提出解耦表示动态网络(DRDN),通过掩码图像建模保持骨干网络通用视觉结构,并采用层次化任务令牌扩展减少跨任务干扰,在从头训练的ViT上取得显著提升。

Comments 10 pages, IEEEtran journal format. Preprint submitted to IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00978 2026-07-02 cs.CV cs.RO 新提交 50%

Privacy-Preserving Depth-Only Open-Vocabulary 3D Semantic Segmentation Via Uncertainty-Guided Test-Time Optimization

隐私保护下基于深度图的开放词汇3D语义分割:不确定性引导的测试时优化

Xuying Huang, Sicong Pan, Maren Bennewitz

机构 * Humanoid Robots Lab, University of Bonn(波恩大学仿人机器人实验室) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所) Center for Robotics, Bonn, Germany(波恩机器人中心)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对隐私保护需求,提出不确定性引导的测试时优化框架UTTO,利用深度图几何信息与基础模型语义先验,实现无需RGB图像的开放词汇3D语义分割,在多个数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00638 2026-07-02 cs.CV 新提交 50%

Uncertainty-aware tree height change regression

不确定性感知的树高变化回归

Max Gaber, Dimitri Gominski, Jaime C. Revenga, Stefan Oehmcke, Rasmus Fensholt, Martin Brandt

机构 * Department of Geosciences and Natural Resource Management, University of Copenhagen(哥本哈根大学地球科学与自然资源管理系) Department of Mathematical Sciences, University of Copenhagen(哥本哈根大学数学科学系) Department of Computer Science and Electrical Engineering, University of Rostock(罗斯托克大学计算机科学与电气工程系) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对现有方法忽略连续变化和标签不确定性的问题,提出CHC数据集(含3米分辨率树高变化及不确定性)和不确定性感知变化回归任务,评估了地理空间基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31811 2026-07-01 cs.CV 新提交 50%

MuSViT: A Foundation Vision Model for Sheet Music Representation

MuSViT: 一种用于乐谱表示的基础视觉模型

Carlos Penarrubia, Antonio Rios-Vila, Eliseo Fuentes-Martinez, Juan C. Martinez-Sevilla, Francisco J. Castellanos, María Alfaro-Contreras, Jorge Calvo-Zaragoza

机构 * Pattern Recognition and Artificial Intelligence Group, University of Alicante, Spain(西班牙阿利坎特大学模式识别与人工智能组)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出MuSViT,首个基于ViT的乐谱基础视觉模型,通过掩码自编码器预训练于970万页IMSLP数据,采用两阶段课程学习,在下游任务中优于通用视觉编码器,并直接编码符号音乐结构。

Comments Accepted at European Conference on Computer Vision (ECCV'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26711 2026-07-01 cs.CV 新提交 50%

Mask to Concept: Auto-Promptable SAM3 via Efficient Test-Time Concept Embedding Search for Few-Shot Annotation

掩码到概念:通过高效测试时概念嵌入搜索实现自动可提示的SAM3用于少样本标注

Quan Zhou, Shaoqing Zhai, Qiang Hu, Jia Chen, Qiang Li, Zhiwei Wang

机构 * Wuhan University of Technology(武汉理工大学) Huazhong University of Science and Technology(华中科技大学) Changzhou United lmaging Healthcare Surgical Technology Co. Ltd.(常州联影医疗手术技术有限公司)

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 提出Mask to Concept (M2C)框架,无需外部模块或重训练,仅用少量标注图像,通过可学习概念嵌入搜索和混合不确定性估计,实现SAM3在医学图像中的自动少样本标注,达到SOTA性能。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21252 2026-07-01 cs.CV 新提交 50%

A Neurosymbolic Framework for Interpretable Skeleton-Based Seizure Detection via Concept-Driven Logical Reasoning

一种基于概念驱动逻辑推理的可解释骨架癫痫检测的神经符号框架

Talha Ilyas, Deval Mehta, Zongyuan Ge

机构 * Monash University(莫纳什大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出首个神经符号框架用于视频癫痫检测,通过概念驱动逻辑推理实现可解释性,在SAHZU和IEEE基准上分别达到89.78%和85.27%的灵敏度,误检率低至0.06和0.09次/小时。

Comments Accepted to MICCAI 2026 (Early Accept: top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07100 2026-07-01 cs.CV cs.RO 新提交 50%

LARA: Latent Action Representation Alignment for Vision-Language-Action Models

LARA: 视觉-语言-动作模型的潜在动作表示对齐

Mengya Liu, Baoxiong Jia, Jiangyong Huang, Jingze Zhang, Siyuan Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :post-training(abstract)

AI总结 提出LARA框架,通过表示对齐联合优化潜在动作模型和视觉-语言-动作模型,利用人类视频数据提升机器人操作性能,在模拟和真实基准上平均提升约10%、5%和15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25713 2026-06-25 cs.SD 新提交 50%

Frequency-Aware Self-Supervised Music Representation Learning

频率感知的自监督音乐表示学习

Yicheng Gu, Junan Zhang, Jerry Li, Zhizheng Wu, Lauri Juvela

机构 * Spellbrush Acoustic Lab, Department of Information and Communications Engineering (DICE), Aalto University(阿尔托大学信息与通信工程系声学实验室) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出PupuJEPA,一种直接在2D频谱图上训练的视觉联合嵌入预测架构,通过预测掩码补丁的潜在嵌入学习鲁棒表示,在MARBLE基准上线性探测优于1D序列SSL模型。

Comments Submitted to TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24767 2026-06-24 cs.CV cs.RO 新提交 50%

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization

具有开放词汇理解的紧凑对象级表示用于室内视觉重定位

Zhaopeng Cui, Jiarui Hu, Jingbo Liu, Boming Zhao, Xiyue Guo, Boyin Feng, Haocheng Peng, Yujun Shen, Hujun Bao, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Ant Group(蚂蚁集团)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出OpenReLoc系统,利用基础模型实现多模态开放词汇语义匹配、基于DIOU的参考帧选择和双路径2D ICP损失,仅用对象单元实现室内视觉重定位,提升可解释性和准确性。

Comments Accepted by RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22749 2026-06-23 cs.CV 新提交 50%

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

RaysUp: 基于几何感知射线表示的超轻量通用特征上采样

Yuchuan Ding, Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出RaysUp,一种超轻量、任务无关且VFM无关的特征上采样框架,通过几何感知射线域重建高分辨率特征图,在多种密集预测任务上以16%参数和7倍加速实现最先进性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20419 2026-06-19 cs.CV 新提交 50%

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation

谱查询-键乘积权重引导用于免训练VLM幻觉缓解

Karn Tiwari, Varnith Chordia, Prathosh A P

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) Snap Research(Snap 研究院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出QK乘积引导,一种无数据、免训练、零推理成本的权重编辑方法,通过抑制中间层主导奇异模式减少对象幻觉,在三个GQA基VLM上平均降低CHAIR$_s$ 4.0%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18667 2026-06-18 q-bio.NC q-bio.QM 新提交 50%

Can neurons speak? Semantic narration of vision at single-cell resolution

神经元能说话吗?单细胞分辨率的视觉语义叙述

Arnau Marin-Llobet, Richard Hakim, Sara Matias, Venkatesh N. Murthy, Na Li, Demba Ba

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出NEURRATOR框架,通过将神经元活动解码为自然语言描述,实现单细胞分辨率的视觉语义叙述,并用于量化解码保真度及解析单个神经元和特定细胞类型的功能贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18623 2026-06-18 cs.CV eess.IV 新提交 50%

Intrinsic 4D Gaussian Segmentation from Scene Cues

内在4D高斯分割:基于场景线索

Hasan Yazar, Mohamed Rayan Barhdadi, Erchin Serpedin, Mehmet Tuncel, Hasan Kurban

机构 * Istanbul Technical University(伊斯坦布尔理工大学) Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出Intrinsic-GS方法,无需训练和掩码,通过构建高斯原语的亲和图并利用社区检测实现4D场景分割,在Neu3D和HyperNeRF上达到与掩码监督方法相当的精度,且速度提升12.5倍。

Comments 15 pages, 4 figures, 7 tables. Includes supplementary material. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18609 2026-06-18 cs.CV 新提交 50%

Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification

基于反事实证据验证的医学视觉语言模型幻觉检测与纠正

Nan Zhou, Ke Zou, Meng Liu, Linchao He, Jiaqi Zhu, Yi Zhang, Hu Chen, Huazhu Fu

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(四川大学数据保护与智能管理教育部重点实验室) National Key Laboratory of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(北京理工大学自主智能无人系统国家重点实验室) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出CoEV框架,通过文本与视觉证据的双向验证检测并纠正医学VLM幻觉,无需重新训练,在四个数据集上显著提升检测和纠正性能。

Comments MICCAI 2026 Accept. Submission Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17742 2026-06-17 cs.CV q-bio.NC 新提交 50%

BrainWorld: A Structural-Prior-Conditioned Generative Model for Whole-Brain 4D fMRI Dynamics

BrainWorld:一种用于全脑4D fMRI动力学的结构先验条件生成模型

Junfeng Xia, Wenhao Ye, Junxiang Zhang, Xuanye Pan, Mo Wang, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出BrainWorld模型,利用结构MRI作为解剖先验条件,通过去噪过程生成全脑4D fMRI动态,在22个数据集上稳定生成400帧轨迹,并通过生成样本增强提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14862 2026-06-16 cs.RO 新提交 50%

TacStyle: Personalizing Tactile Robot Policies using Structured Behavior Representations

TacStyle: 使用结构化行为表示个性化触觉机器人策略

Kevin Robledo, Matías I. Torres Galaz, Kumar Dixhant Rai, Shelly Sara Ulman, Tasmia Tasrin, Heramb Nemlekar

机构 * Department of Computer Science, California State University, Northridge(加州州立大学北岭分校计算机科学系) Department of Mechanical Engineering, California State University, Northridge(加州州立大学北岭分校机械工程系)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出通过结构化潜在表示组织用户偏好,结合基础模型解释语言指令,实现机器人行为精细调整,减少偏好标签需求。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14808 2026-06-16 eess.IV cs.CV cs.IT math.IT 新提交 50%

Explainable Task-Oriented Token Communication for AI-Native 6G Networks

面向AI原生6G网络的可解释任务导向Token通信

Feibo Jiang, Lei Mao, Li Dong, Kezhi Wang, Cunhua Pan, Jiangzhou Wang

机构 * IEEE

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出ET-TokenCom框架,通过跨模态注意力融合视觉Token与任务Token,实现可解释的任务导向图像通信,解决Token表示不足、协作差和可解释性低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14803 2026-06-16 cs.CV 新提交 50%

HSQ-VLM: A Novel Spatially-Constrained Quadrant Segmentation VLM Model for Explainability in Diabetic Retinopathy

HSQ-VLM: 一种用于糖尿病视网膜病变可解释性的新型空间约束象限分割VLM模型

Shivum Telang

机构 * Pittsburgh, Pennsylvania(宾夕法尼亚州匹兹堡)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出HSQ-VLM,利用地标锚定笛卡尔交叉注意力机制和四象限拓扑潜在分割,实现眼底图像中病变的解剖精确量化与自然语言报告生成,在出血和微动脉瘤检测上达到99.6%和96.4%的灵敏度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14740 2026-06-16 cs.CV 新提交 50%

GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

GridVQA-X: 评估多模态可解释性方法的框架

Sujay Belsare, Sudarshan Nikhil, Sushant Kumar, Ponnurangam Kumaraguru, Chirag Agarwal

机构 * IIIT Hyderabad(印度海得拉巴国际信息技术学院) University of Virginia(弗吉尼亚大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出GridVQA-X诊断框架,通过合成数据生成数学保证的解释,并训练纯推理与捷径依赖的配对模型,揭示现有可解释性方法无法区分真实跨模态推理与浅层捷径。

Comments 23 pages, 15 Figures, Accepted for poster presentation at CVPR 2026 TRUE-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11510 2026-06-11 q-bio.QM q-bio.PE stat.ML 新提交 50%

Continuous biome representations from Earth observation embeddings

从地球观测嵌入中提取连续生物群落表示

Maxwell B. Joseph, Flávia De Souza Mendes, Dieu My T. Nguyen, Camile Sothe, Christopher B. Anderson

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对离散生物群落图压缩生态连续性的问题,提出从卫星图像嵌入中学习连续概率表示,在巴西6个生物群落和4672种植物数据上验证,优于离散标签预测物种分布。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11096 2026-06-10 cs.CV 新提交 50%

IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

IDEAL: 深度对齐实现离散表示自编码器

Yitong Chen, Zijie Diao, Junke Wang, Lingyu Kong, Yixuan Ren, Bo He, Yu-Gang Jiang, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Innovation Institute(上海创新研究院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出IDEAL框架,通过联合对齐量化令牌与浅层和深层VFM特征,提升离散表示自编码器的重建质量,在ImageNet上实现0.61 rFID,并创下自回归图像生成新纪录(gFID 1.89)。

Comments Code is available at https://github.com/Row11n/IDEAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09474 2026-06-09 cs.CV 新提交 50%

Training-Free Generalized Few-Shot Segmentation through Open-Vocabulary Semantic Arbitration

无需训练的通用的少样本分割通过开放词汇语义仲裁

Silas Kwabla Gah, Ebenezer Owusu

机构 * University of Ghana(加纳大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出Open-V框架,通过推理时协调冻结的语义先验(SAM3 PCS与K-shot CLIP支持质心)实现无需训练的通用少样本分割,在多个基准上超越有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08341 2026-06-09 cs.RO 新提交 50%

Uncertainty-Aware Intention Prediction for Human-to-Robot Assembly Teleoperation

面向人机装配遥操作的不确定性感知意图预测

Fnu Heman, Yixuan Wang, Kolin Xu, Conner Wallace, John Dang, Akhil Joshi, Jun Sheng, Pinhas Ben-Tzvi, Mingyu Cai

机构 * University of California, Riverside(加州大学河滨分校) University of Miami(迈阿密大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 提出结合层次迁移学习、共形预测和VLM引导校正的不确定性感知意图预测框架,利用人类演示数据预训练,仅用少量机器人数据即提升动作分割性能。

Comments 7 pages, 6 figures. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏