arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7608 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7608 篇

2606.24767 2026-06-24 cs.CV cs.RO 新提交 50%

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization

具有开放词汇理解的紧凑对象级表示用于室内视觉重定位

Zhaopeng Cui, Jiarui Hu, Jingbo Liu, Boming Zhao, Xiyue Guo, Boyin Feng, Haocheng Peng, Yujun Shen, Hujun Bao, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Ant Group(蚂蚁集团)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出OpenReLoc系统,利用基础模型实现多模态开放词汇语义匹配、基于DIOU的参考帧选择和双路径2D ICP损失,仅用对象单元实现室内视觉重定位,提升可解释性和准确性。

Comments Accepted by RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22749 2026-06-23 cs.CV 新提交 50%

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

RaysUp: 基于几何感知射线表示的超轻量通用特征上采样

Yuchuan Ding, Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出RaysUp,一种超轻量、任务无关且VFM无关的特征上采样框架,通过几何感知射线域重建高分辨率特征图,在多种密集预测任务上以16%参数和7倍加速实现最先进性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20419 2026-06-19 cs.CV 新提交 50%

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation

谱查询-键乘积权重引导用于免训练VLM幻觉缓解

Karn Tiwari, Varnith Chordia, Prathosh A P

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) Snap Research(Snap 研究院)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出QK乘积引导,一种无数据、免训练、零推理成本的权重编辑方法,通过抑制中间层主导奇异模式减少对象幻觉,在三个GQA基VLM上平均降低CHAIR$_s$ 4.0%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18667 2026-06-18 q-bio.NC q-bio.QM 新提交 50%

Can neurons speak? Semantic narration of vision at single-cell resolution

神经元能说话吗?单细胞分辨率的视觉语义叙述

Arnau Marin-Llobet, Richard Hakim, Sara Matias, Venkatesh N. Murthy, Na Li, Demba Ba

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出NEURRATOR框架,通过将神经元活动解码为自然语言描述,实现单细胞分辨率的视觉语义叙述,并用于量化解码保真度及解析单个神经元和特定细胞类型的功能贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18623 2026-06-18 cs.CV eess.IV 新提交 50%

Intrinsic 4D Gaussian Segmentation from Scene Cues

内在4D高斯分割:基于场景线索

Hasan Yazar, Mohamed Rayan Barhdadi, Erchin Serpedin, Mehmet Tuncel, Hasan Kurban

机构 * Istanbul Technical University(伊斯坦布尔理工大学) Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出Intrinsic-GS方法,无需训练和掩码,通过构建高斯原语的亲和图并利用社区检测实现4D场景分割,在Neu3D和HyperNeRF上达到与掩码监督方法相当的精度,且速度提升12.5倍。

Comments 15 pages, 4 figures, 7 tables. Includes supplementary material. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18609 2026-06-18 cs.CV 新提交 50%

Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification

基于反事实证据验证的医学视觉语言模型幻觉检测与纠正

Nan Zhou, Ke Zou, Meng Liu, Linchao He, Jiaqi Zhu, Yi Zhang, Hu Chen, Huazhu Fu

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(四川大学数据保护与智能管理教育部重点实验室) National Key Laboratory of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(北京理工大学自主智能无人系统国家重点实验室) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出CoEV框架,通过文本与视觉证据的双向验证检测并纠正医学VLM幻觉,无需重新训练,在四个数据集上显著提升检测和纠正性能。

Comments MICCAI 2026 Accept. Submission Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17742 2026-06-17 cs.CV q-bio.NC 新提交 50%

BrainWorld: A Structural-Prior-Conditioned Generative Model for Whole-Brain 4D fMRI Dynamics

BrainWorld:一种用于全脑4D fMRI动力学的结构先验条件生成模型

Junfeng Xia, Wenhao Ye, Junxiang Zhang, Xuanye Pan, Mo Wang, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出BrainWorld模型,利用结构MRI作为解剖先验条件,通过去噪过程生成全脑4D fMRI动态,在22个数据集上稳定生成400帧轨迹,并通过生成样本增强提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14862 2026-06-16 cs.RO 新提交 50%

TacStyle: Personalizing Tactile Robot Policies using Structured Behavior Representations

TacStyle: 使用结构化行为表示个性化触觉机器人策略

Kevin Robledo, Matías I. Torres Galaz, Kumar Dixhant Rai, Shelly Sara Ulman, Tasmia Tasrin, Heramb Nemlekar

机构 * Department of Computer Science, California State University, Northridge(加州州立大学北岭分校计算机科学系) Department of Mechanical Engineering, California State University, Northridge(加州州立大学北岭分校机械工程系)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出通过结构化潜在表示组织用户偏好,结合基础模型解释语言指令,实现机器人行为精细调整,减少偏好标签需求。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14808 2026-06-16 eess.IV cs.CV cs.IT math.IT 新提交 50%

Explainable Task-Oriented Token Communication for AI-Native 6G Networks

面向AI原生6G网络的可解释任务导向Token通信

Feibo Jiang, Lei Mao, Li Dong, Kezhi Wang, Cunhua Pan, Jiangzhou Wang

机构 * IEEE

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出ET-TokenCom框架,通过跨模态注意力融合视觉Token与任务Token,实现可解释的任务导向图像通信,解决Token表示不足、协作差和可解释性低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14803 2026-06-16 cs.CV 新提交 50%

HSQ-VLM: A Novel Spatially-Constrained Quadrant Segmentation VLM Model for Explainability in Diabetic Retinopathy

HSQ-VLM: 一种用于糖尿病视网膜病变可解释性的新型空间约束象限分割VLM模型

Shivum Telang

机构 * Pittsburgh, Pennsylvania(宾夕法尼亚州匹兹堡)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出HSQ-VLM,利用地标锚定笛卡尔交叉注意力机制和四象限拓扑潜在分割,实现眼底图像中病变的解剖精确量化与自然语言报告生成,在出血和微动脉瘤检测上达到99.6%和96.4%的灵敏度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14740 2026-06-16 cs.CV 新提交 50%

GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

GridVQA-X: 评估多模态可解释性方法的框架

Sujay Belsare, Sudarshan Nikhil, Sushant Kumar, Ponnurangam Kumaraguru, Chirag Agarwal

机构 * IIIT Hyderabad(印度海得拉巴国际信息技术学院) University of Virginia(弗吉尼亚大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出GridVQA-X诊断框架,通过合成数据生成数学保证的解释,并训练纯推理与捷径依赖的配对模型,揭示现有可解释性方法无法区分真实跨模态推理与浅层捷径。

Comments 23 pages, 15 Figures, Accepted for poster presentation at CVPR 2026 TRUE-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11510 2026-06-11 q-bio.QM q-bio.PE stat.ML 新提交 50%

Continuous biome representations from Earth observation embeddings

从地球观测嵌入中提取连续生物群落表示

Maxwell B. Joseph, Flávia De Souza Mendes, Dieu My T. Nguyen, Camile Sothe, Christopher B. Anderson

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对离散生物群落图压缩生态连续性的问题,提出从卫星图像嵌入中学习连续概率表示,在巴西6个生物群落和4672种植物数据上验证,优于离散标签预测物种分布。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09896 2026-06-11 physics.chem-ph 50%

High-Accuracy Physical Property Prediction for Organics via Molecular Representation Learning: Bridging Data to Discovery

通过分子表示学习实现有机物高精度物理性质预测:连接数据与发现

Qi Ou, Hongshuai Wang, Minyang Zhuang, Shangqian Chen, Lele Liu, Ning Wang, Zhifeng Gao

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 本文提出Org-Mol模型,利用3D transformer算法预训练并微调,实现有机物多种物理性质的高精度预测,用于高效筛选新型冷却液。

Journal ref npj Computational Materials volume 11, Article number: 224 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11096 2026-06-10 cs.CV 新提交 50%

IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

IDEAL: 深度对齐实现离散表示自编码器

Yitong Chen, Zijie Diao, Junke Wang, Lingyu Kong, Yixuan Ren, Bo He, Yu-Gang Jiang, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Innovation Institute(上海创新研究院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出IDEAL框架,通过联合对齐量化令牌与浅层和深层VFM特征,提升离散表示自编码器的重建质量,在ImageNet上实现0.61 rFID,并创下自回归图像生成新纪录(gFID 1.89)。

Comments Code is available at https://github.com/Row11n/IDEAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09474 2026-06-09 cs.CV 新提交 50%

Training-Free Generalized Few-Shot Segmentation through Open-Vocabulary Semantic Arbitration

无需训练的通用的少样本分割通过开放词汇语义仲裁

Silas Kwabla Gah, Ebenezer Owusu

机构 * University of Ghana(加纳大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出Open-V框架,通过推理时协调冻结的语义先验(SAM3 PCS与K-shot CLIP支持质心)实现无需训练的通用少样本分割,在多个基准上超越有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08341 2026-06-09 cs.RO 新提交 50%

Uncertainty-Aware Intention Prediction for Human-to-Robot Assembly Teleoperation

面向人机装配遥操作的不确定性感知意图预测

Fnu Heman, Yixuan Wang, Kolin Xu, Conner Wallace, John Dang, Akhil Joshi, Jun Sheng, Pinhas Ben-Tzvi, Mingyu Cai

机构 * University of California, Riverside(加州大学河滨分校) University of Miami(迈阿密大学)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 提出结合层次迁移学习、共形预测和VLM引导校正的不确定性感知意图预测框架,利用人类演示数据预训练,仅用少量机器人数据即提升动作分割性能。

Comments 7 pages, 6 figures. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18020 2026-06-09 cs.CV cs.RO 版本更新 50%

UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models

UAOR: 面向视觉-语言-动作模型的不确定性感知观测重注入

Jiabing Yang, Yixiang Chen, Yuan Xu, Peiyan Li, Zichen Wen, Bowen Fang, Tao Yu, Xiangnan Wu, Qisen Ma, Kai Wang, Ziheng He, Yingda Li, Zhengbo Zhang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新技术实验室) Shanghai Jiao Tong University(上海交通大学) FiveAges(五代)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出UAOR模块,通过动作熵检测不确定性,在语言模型高不确定层重注入观测信息,无需额外训练或数据,提升VLA模型在仿真和真实任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15741 2026-06-04 cs.CV 50%

HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion

HyperDiT: 用于高保真像素空间扩散的超连接Transformer

Yu He, Lichen Ma, Zipeng Guo, Xinyuan Shan, Jingling Fu, Dong Chen, Junshi Huang, Yan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对像素空间扩散模型中全局语义与细粒度细节难以兼顾的粒度困境,提出HyperDiT框架,通过超连接跨尺度交互和尺度感知旋转位置编码,结合预训练视觉基础模型的密集语义,在像素空间实现高保真生成,在ImageNet 256×256上取得1.56的SoTA FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15748 2026-06-03 cs.CV 50%

Concept-wise Attention for Fine-grained Concept Bottleneck Models

面向细粒度概念瓶颈模型的概念级注意力机制

Minghong Zhong, Guoshuai Zou, Kanghao Chen, Dexia Chen, Ruixuan Wang

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出概念级注意力机制(CoAt-CBM),通过可学习概念视觉查询和概念对比优化,实现自适应细粒度图像-概念对齐,解决预训练偏差和概念互斥问题,显著提升性能。

Comments Withdrawn by authors for revision and improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02305 2026-06-02 q-bio.NC cs.HC 50%

Mapping Whisper Representations to Human ECoG Responses with Interpretable Time-Resolved Neural Encoding

将Whisper表示映射到人类ECoG响应:可解释的时间分辨神经编码

Matteo Ciferri, Tommaso Boccato, Michal Olak, Matteo Ferrante, Nicola Toschi

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 通过时间分辨神经编码器结合语音嵌入与循环时间模型及软注意力,研究Whisper内部表示如何预测颅内ECoG响应,发现中间层与神经活动对应最强,且高分辨率ECoG受益于时间结构化建模。

Comments Presented at ICLR 2026 Workshop on Representational Alignment (Re-Align)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31234 2026-06-01 cs.RO 50%

HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model

HARP-VLA:面向视觉-语言-动作模型的人机对齐表示学习

Xiang Zhu, Puzhen Yuan, Yichen Liu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, China(清华大学交叉信息研究院) Shanghai Qi Zhi Institute, China(上海启智研究院)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 提出HARP框架,通过有限配对人机演示和未配对视频,学习对齐的人机视觉与潜在动作表示,提升VLA模型预训练效果,在CALVIN和真实世界任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24863 2026-06-01 eess.AS cs.SD 50%

Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems

重新思考语音和音频的持续学习:基于表征的分类法与开放问题

Yang Xiao, Siyi Wang, Eun-Jung Holden, Ting Dang

机构 * University of Melbourne, Melbourne, Australia(墨尔本大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文从表征中心视角重新审视语音持续学习,提出基于表征几何演化的新分类法,并指出现有假设与语音基础模型行为的关键不匹配,最后概述开放挑战与未来方向。

Comments 4 pages, 1 figure, working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22067 2026-06-01 cs.CV 50%

Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation

捕捉注视转移以引导:跨模态融合增强用于VLM幻觉缓解

Zheng Qi, Chao Shang, Evangelia Spiliopoulou, Nikolaos Pappas

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出GIFT方法,通过预计算视觉显著性图并跟踪注视转移,在解码时增强对显著视觉信息和用户查询的注意力,以缓解视觉语言模型中的幻觉问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13600 2026-05-29 cs.CV 50%

SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification

SAVAA: 通过逐步自适应视觉注意力放大减轻LVLMs中的幻觉

Jiacheng Zhang, Feng Liu, Chao Du, Tianyu Pang

机构 * Sea AI Lab(海思人工智能实验室) The University of Melbourne(墨尔本大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出SAVAA框架,通过视觉接地熵估计幻觉风险并自适应调整视觉注意力放大因子,在多个基准上显著减轻大型视觉语言模型的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12369 2026-05-28 cs.IR 50%

A Hierarchical Quantized Tokenization Framework for Task-Adaptive Graph Representation Learning

面向任务自适应图表示学习的层次量化分词框架

Yang Xiang, Li Fan, Chenke Yin, Lutz Oettershagen, Chengtao Ji

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出一种层次量化分词框架,通过任务条件路由和双视角令牌流生成多尺度离散码,并融合局部与多跳序列,提升图表示学习在节点分类和链接预测任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27038 2026-05-27 cs.RO 50%

TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving

TPS-Drive: 基于VLM的自动驾驶任务引导表示净化

Jiaxiang Li, Yumao Liu, Ke Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 提出TPS-Drive框架,通过任务引导的表示净化(Agent-Centric Tokenizer)解决VLM在自动驾驶中的空间幻觉和表示干扰问题,实现精确的3D空间预测与安全规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19939 2026-05-27 cs.CE 50%

Uncertainty-aware Machine Learning Interatomic Potentials via Learned Functional Perturbations

通过学习功能扰动实现不确定性感知的机器学习原子间势

Olga Zaghen, Maksim Zhdanov, Dario Coscia, David R. Wessels, Erik J. Bekkers

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出通过学习功能扰动将确定性MLIP转化为概率模型,并用连续排序概率分数(CRPS)端到端微调,以高效量化不确定性,在带电粒子基准和二氧化硅上分别比现有贝叶斯方法BLIP提升CRPS 19-32%和Spearman相关系数从0.75到0.84。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25328 2026-05-26 cs.CV cs.MM 50%

DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement

DIVA: 利用统一多模态模型中的表示差异实现相互增强

Renjie Lu, Xulong Zhang, Xiaoyang Qu, Shangfei Wang, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国) University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :post-training(abstract)

AI总结 针对统一多模态模型中理解与生成任务因监督信号差异导致相互干扰的问题,提出DIVA框架,通过分解视觉表示为共享和独有成分并利用互信息估计实现内部协同,在理解与生成任务上分别提升7.82%和8.46%。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22777 2026-05-22 cs.CV 50%

DecQ: Detail-Condensing Queries for Enhanced Reconstruction and Generation in Representation Autoencoders

DecQ:用于增强表示自编码器中重建和生成的细节压缩查询

Tianhang Wang, Yitong Chen, Wei Song, Zuxuan Wu, Min Li, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出DecQ框架,通过引入轻量级细节压缩查询,有效缓解了表示自编码器中重建与生成之间的权衡问题,提升了重建质量和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21300 2026-05-21 cs.CV 50%

Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens

通过强调图像负样本token减少LVLMs中的物体幻觉

Meng Shen, Minghao Wu, Deepu Rajan

机构 * Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文通过强调图像负样本token来减少LVLMs中的物体幻觉问题,提出调整不同token的训练权重和数据过滤策略以控制幻觉。

Comments 20 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏