arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-11 至 2025-12-11 共收录 136 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 24 篇

2504.03166 2025-12-11 cs.CV 78%

RingMoE: Mixture-of-Modality-Experts Multi-Modal Foundation Models for Universal Remote Sensing Image Interpretation

RingMoE:面向通用遥感图像解释的多模态专家混合多模态基础模型

Hanbo Bi, Yingchao Feng, Boyuan Tong, Mengyu Wang, Haichen Yu, Yongqiang Mao, Hao Chang, Wenhui Diao, Peijin Wang, Yue Yu, Hanyang Peng, Yehong Zhang, Kun Fu, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(目标认知与应用技术重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Peng Cheng Laboratory, Shenzhen(鹏城实验室)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 RingMoE是一种多模态专家混合模型,通过自监督学习和物理信息嵌入,提升遥感图像的多模态处理能力,实现从单模态到多模态的高效适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09872 2025-12-11 cs.CR cs.AI 77%

FlipLLM: Efficient Bit-Flip Attacks on Multimodal LLMs using Reinforcement Learning

FlipLLM: 通过强化学习高效攻击多模态大语言模型的位翻转攻击

Khurram Khalil, Khaza Anuarul Hoque

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) University of Missouri-Columbia(密苏里大学哥伦比亚分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 FlipLLM通过强化学习高效识别多模态大语言模型的位翻转攻击漏洞,显著提升攻击检测速度和防御指导价值。

Comments Accepted in IEEE HOST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09304 2025-12-11 cs.AR 75%

RACAM: Enhancing DRAM with Reuse-Aware Computation and Automated Mapping for ML Inference

RACAM:通过重用感知计算和自动映射增强DRAM用于ML推理

Siyuan Ma, Jiajun Hu, Jeeho Ryoo, Aman Arora, Lizy Kurian John

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 RACAM通过重用感知计算和自动映射提升DRAM性能,实现LLM推理的高加速和高能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18496 2025-12-11 cs.SE 75%

AI-powered Code Review with LLMs: Early Results

基于AI的代码审查与LLM:初步结果

Zeeshan Rasheed, Malik Abdul Sami, Muhammad Waseem, Kai-Kristian Kemell, Xiaofeng Wang, Anh Nguyen, Kari Systä, Pekka Abrahamsson

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于LLM的代码审查方法,旨在提高代码质量和开发者教育,通过检测代码问题和减少发布后bug来优化开发流程。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09555 2025-12-11 cs.CV 73%

Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment

构建合理的视觉-语言模型推理以实现盲图像质量评估

Yuan Li, Zitang Sun, Yen-ju Chen, Shin'ya Nishida

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院)

专题命中 效率与部署 :language model(title,journal_ref)

AI总结 本文提出一种两阶段调优方法,通过分离视觉感知与质量推断,提升视觉-语言模型在盲图像质量评估中的推理稳定性与可靠性。

Comments Accepted to the ICONIP (International Conference on Neural Information Processing), 2025

Journal ref Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment. In: Taniguchi, T., et al. Neural Information Processing. ICONIP 2025. Lecture Notes in Computer Science, vol 16310. Springer, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09487 2025-12-11 cs.CL cs.AI cs.IR 73%

RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning

RouteRAG: 通过强化学习实现文本和图的高效检索增强生成

Yucan Guo, Miao Su, Saiping Guan, Zihao Sun, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Laboratory of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所网络数据科学与技术重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RouteRAG通过强化学习实现文本和图的高效混合检索增强生成,提升多轮推理和复杂任务的适应性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09010 2025-12-11 cs.CV cs.AI 70%

Towards Lossless Ultimate Vision Token Compression for VLMs

面向视觉语言模型的无损终极视觉标记压缩

Dehua Zheng, Mouxiao Huang, Borui Jiang, Hailin Hu, Xinghao Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LUVC框架,通过正交空间轴的迭代合并和频谱修剪单元,实现视觉语言模型中视觉标记的无损压缩,提升推理速度并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09619 2025-12-11 cs.RO 67%

GLaD: Geometric Latent Distillation for Vision-Language-Action Models

GLaD:面向视觉-语言-动作模型的几何潜在蒸馏

Minghao Guo, Meng Cao, Jiachen Tao, Rongtao Xu, Yan Yan, Xiaodan Liang, Ivan Laptev, Xiaojun Chang

机构 * MBZUAI University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :LLM(abstract);pretraining(abstract)

AI总结 GLaD通过引入几何意识的预训练机制,提升了视觉-语言-动作模型的空间推理和策略泛化能力,无需依赖深度传感器或3D标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09548 2025-12-11 cs.MA 67%

Supporting Dynamic Agentic Workloads: How Data and Agents Interact

支持动态代理工作负载:数据与代理如何相互作用

Ioana Giurgiu, Michael E. Nidd

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种以代理为中心的数据织物,旨在高效支持动态、多模态的代理工作负载,通过注意力引导的数据检索、语义微缓存等机制提升数据处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22348 2025-12-11 cs.AR 67%

FADiff: Fusion-Aware Differentiable Optimization for DNN Scheduling on Tensor Accelerators

FADiff: 面向张量加速器的DNN调度融合感知可微优化

Shuao Jia, Zichao Ling, Chen Bai, Kang Zhao, Jianwang Zhai

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 FADiff通过融合感知的可微优化框架,实现了对DNN调度的高效优化,提升张量加速器上的推理性能。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20427 2025-12-11 cs.CV 67%

Seedream 4.0: Toward Next-generation Multimodal Image Generation

Seedream 4.0:迈向下一代多模态图像生成

Team Seedream, :, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang, Xiaowen Jian, Huafeng Kuang, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yanzuo Lu, Zhengxiong Luo, Tongtong Ou, Guang Shi, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Wenxu Wu, Yonghui Wu, Xin Xia, Xuefeng Xiao, Shuang Xu, Xin Yan, Ceyuan Yang, Jianchao Yang, Zhonghua Zhai, Chenlin Zhang, Heng Zhang, Qi Zhang, Xinyu Zhang, Yuwei Zhang, Shijia Zhao, Wenliang Zhao, Wenjia Zhu

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :LLM(abstract);post-training(abstract)

AI总结 Seedream 4.0通过高效多模态框架实现文本到图像生成、图像编辑和多图像组合,展示卓越的多模态能力与高效推理性能。

Comments Seedream 4.0/4.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09723 2025-12-11 cs.LG 57%

Mixture of Lookup Key-Value Experts

检索键值专家的混合

Zongcheng Wang

机构 * The School of Mathematics, Renmin University of China(中国人民大学数学学院)

专题命中 效率与部署 :LLM(abstract);分类 cs.LG

AI总结 本文提出MoLKV模型,通过上下文感知机制改进MoLE,降低验证损失,提升小规模任务性能。

Comments Preliminary Version; Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09666 2025-12-11 cs.CL 57%

Neurosymbolic Information Extraction from Transactional Documents

从交易文件中提取神经符号信息

Arthur Hemmer, Mickaël Coustaty, Nicola Bartolo, Jean-Marc Ogier

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文提出了一种神经符号框架,通过结合符号验证方法提升交易文件信息提取的准确性和效率。

Comments 20 pages, 2 figures, accepted to IJDAR (ICDAR 2025)

Journal ref IJDAR 28, 475-485 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07100 2025-12-11 cs.LG 57%

Dual Refinement Cycle Learning: Unsupervised Text Classification of Mamba and Community Detection on Text Attributed Graph

双精炼循环学习:Mamba和社区检测在文本属性图上的无监督文本分类

Hong Wang, Yinglong Zhang, Hanhan Guo, Xuewen Xia, Xing Xu

机构 * College of Physics and Information Engineering, Minnan Normal University(物理与信息工程学院,福建师范大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 DRCL通过双向精炼循环整合结构和语义信息,实现无监督文本属性图的社区检测与分类,其Mamba分类器在无标注数据下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18485 2025-12-11 cond-mat.mtrl-sci 50%

Active Δ-learning with universal potentials for global structure optimization

具有通用势函数的主动Δ学习用于全局结构优化

Joe Pitfield, Mads-Peter Verner Christiansen, Bjørk Hammer

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出了一种基于主动学习的Δ模型方法,用于改进通用机器学习势函数以实现更高效的全局结构优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 11 篇

2501.05382 2025-12-11 physics.data-an cs.AI hep-ph physics.comp-ph physics.hist-ph 92%

Large Physics Models: Towards a collaborative approach with Large Language Models and Foundation Models

大规模物理模型:迈向与大规模语言模型和基础模型的协作方法

Kristian G. Barman, Sascha Caron, Emily Sullivan, Henk W. de Regt, Roberto Ruiz de Austri, Mieke Boon, Michael Färber, Stefan Fröse, Faegheh Hasibi, Andreas Ipp, Rukshak Kapoor, Gregor Kasieczka, Daniel Kostić, Michael Krämer, Tobias Golling, Luis G. Lopez, Jesus Marco, Sydney Otten, Pawel Pawlowski, Pietro Vischia, Erik Weber, Christoph Weniger

机构 * CLPS - Centre for Logic and Philosophy of Science(逻辑与哲学科学中心) UGent(根特大学) IMAPP, Radboud University and Nikhef(IMAPP、拉德堡德大学和荷兰皇家科学院) Utrecht University(乌特勒支大学) Institute for Science in Society, Radboud University(社会科学研究院,拉德堡德大学) Instituto de Física Corpuscular (IFIC), CSIC-UV, Spain(Corpuscular 物理研究所(IFIC),CSIC-UV,西班牙) University of Twente(代尔夫特理工大学) TU Dresden & ScaDS.AI(德累斯顿技术大学及ScaDS.AI) ErUM-Data-Hub & TU Dortmund University(ErUM-Data-Hub及多特蒙德技术大学) Computing and Information Science, Radboud University(计算与信息科学,拉德堡德大学) TU Wien(维也纳技术大学) Thapar Institute of Engineering & Technology (TIET), Patiala, India(泰帕尔工程与技术学院(TIET),帕蒂亚,印度) Universität Hamburg(汉堡大学) Institute of Philosophy, University of Leiden(哲学研究所,莱顿大学) RWTH Aachen University(亚琛工业大学) University of Geneva(日内瓦大学) Munich Center for Mathematical Philosophy, LMU Munich(慕尼黑数学哲学中心,慕尼黑大学) Institute of Physics of Cantabria (IFCA), CSIC-UC, Spain(坎塔布里亚物理研究所(IFCA),CSIC-UC,西班牙) Radboud University(拉德堡德大学) Ippen Digital, Germany(Ippen 数字,德国) Universidad de Oviedo and ICTEA, Spain(奥维多大学及ICTEA,西班牙) CLPS - Centre for Logic and Philosophy of Science, UGent(逻辑与哲学科学中心) GRAPPA, Institute of Physics, University of Amsterdam(GRAPPA,物理研究所,阿姆斯特丹大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);分类 cs.AI

AI总结 本文提出通过跨学科协作开发大规模物理模型,旨在解决物理研究中的特定需求。

Journal ref Eur. Phys. J. C 85, 1066 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09127 2025-12-11 cs.CL cs.AI 90%

Knowledge-Guided Large Language Model for Automatic Pediatric Dental Record Understanding and Safe Antibiotic Recommendation

基于知识引导的大型语言模型用于自动解析儿童牙科记录并安全推荐抗生素

Zihan Han, Junyan Ge, Caifeng Li

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于知识引导的大型语言模型,通过整合知识图谱、检索增强生成和多阶段安全验证,提升儿童牙科记录解析与安全抗生素推荐的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08946 2025-12-11 cs.CY cs.CL 89%

Large Language Models as Search Engines: Societal Challenges

大语言模型作为搜索引擎:社会挑战

Zacchary Sadeddine, Winston Maxwell, Gaël Varoquaux, Fabian M. Suchanek

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨大语言模型取代搜索引擎带来的社会挑战,分析了提供者、创作者和用户的角色,并提出缓解策略与未来研究方向。

Journal ref SIGIR Forum 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09370 2025-12-11 cs.DL cond-mat.mtrl-sci 88%

Optimizing Data Extraction from Materials Science Literature: A Study of Tools Using Large Language Models

优化材料科学文献中的数据提取:一种利用大语言模型工具的研究

Wenkai Ning, Musen Li, Jeffrey R. Reimers, Rika Kobayashi

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究利用大语言模型评估五种AI工具在材料科学文献中提取带隙数据的效果,探讨其在提升科学发现中的应用与改进方向。

Comments 15 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09088 2025-12-11 cs.AI 86%

Calibrated Trust in Dealing with LLM Hallucinations: A Qualitative Study

校准信任以应对大语言模型幻觉:一项定性研究

Adrian Ryser, Florian Allwein, Tim Schlippe

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract,journal_ref);language model(abstract,journal_ref);分类 cs.AI

AI总结 本文通过定性研究发现,用户对LLM的信任校准受情境、感知风险和直觉等多因素影响,并提出信任校准模型的扩展及实用建议。

Journal ref The 3rd International Conference on Foundation and Large Language Models (FLLM2025), Vienna, Austria, 25-28 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17918 2025-12-11 cs.LG 85%

LLM Meeting Decision Trees on Tabular Data

基于逻辑决策树的表格数据LLM决策树

Hangting Ye, Jinmeng Li, He Zhao, Dandan Guo, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) CSIRO’s Data61(CSIRO数据61) Monash University(墨尔本大学) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DeLTa方法,通过逻辑决策树规则中介将LLM整合到表格数据中,避免数据序列化,实现全数据学习,提升表格预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07170 2025-12-11 cs.AI cs.CL cs.CY 81%

That's So FETCH: Fashioning Ensemble Techniques for LLM Classification in Civil Legal Intake and Referral

That's So FETCH: 为LLM在民事法律受理与转介中的分类构建集成技术

Quinten Steenhuis

机构 * Suffolk University Law School(苏富比大学法学院)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出FETCH分类器,通过混合LLM/ML方法和自动生成后续问题,提升法律问题分类的准确率至97.37%。

Comments Submission to JURIX 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09483 2025-12-11 cs.CL cs.CY 79%

Source Coverage and Citation Bias in LLM-based vs. Traditional Search Engines

基于大语言模型的搜索引擎与传统搜索引擎的来源覆盖与引用偏见

Peixian Zhang, Qiming Ye, Zifan Peng, Kiran Garimella, Gareth Tyson

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Rutgers University(罗格斯大学) Rutgers University New Brunswick United States(罗格斯大学新 Brunswick美国)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的搜索引擎与传统搜索引擎在来源覆盖和引用偏见方面的差异,发现LLM-SEs在资源多样性上优于传统搜索引擎,但其可信度和中立性仍需进一步提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09403 2025-12-11 cs.LG 77%

Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs

黑盒行为蒸馏破坏医疗大语言模型的安全对齐

Sohely Jahan, Ruimin Sun

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 黑盒行为蒸馏攻击揭示医疗大语言模型的安全对齐漏洞,通过低成本手段复制模型能力并破坏安全机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08143 2025-12-11 cs.LG 70%

PolyLingua: Margin-based Inter-class Transformer for Robust Cross-domain Language Detection

PolyLingua: 基于边界的跨领域语言识别变换器

Ali Lotfi Rezaabad, Bikram Khanal, Shashwat Chaurasia, Lu Zeng, Dezhi Hong, Hossein Bashashati, Thomas Butler, Megan Ganji

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PolyLingua是一种轻量级变换器模型,通过两级对比学习框架实现精确的跨领域语言识别,以高准确率和低资源消耗应对复杂语言识别挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07302 2025-12-11 cs.CY cs.CL cs.HC 70%

Effects of a Prompt Engineering Intervention on Undergraduate Students' AI Self-Efficacy, AI Knowledge and Prompt Engineering Ability: A Mixed Methods Study

提示工程干预对本科生人工智能自我效能、人工智能知识和提示工程能力的影响:一项混合方法研究

David James Woo, Deliang Wang, Tim Yung, Kai Guo

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过混合方法探讨提示工程干预对本科生人工智能自我效能、知识及能力的影响,发现干预显著提升学生在AI相关领域的技能和理解。

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识编辑与模型理解 11 篇

2512.09444 2025-12-11 cs.CL 88%

Advancing Text Classification with Large Language Models and Neural Attention Mechanisms

基于大语言模型和神经注意力机制的文本分类进展

Ning Lyu, Yuxi Wang, Feng Chen, Qingyuan Zhang

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出基于大语言模型和神经注意力机制的文本分类方法,通过改进表示和聚合策略,提升分类性能并增强模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09440 2025-12-11 cs.CL 88%

Knowledge-Augmented Large Language Model Agents for Explainable Financial Decision-Making

基于知识增强的大语言模型代理的可解释金融决策方法

Qingyuan Zhang, Yuxi Wang, Cancan Hua, Yulin Huang, Ning Lyu

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出基于知识增强的大语言模型代理,通过整合外部知识检索、语义表示和推理生成,提升金融决策的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07564 2025-12-11 cs.CV cs.AI cs.CL cs.LG 83%

Toward More Reliable Artificial Intelligence: Reducing Hallucinations in Vision-Language Models

迈向更可靠的人工智能:减少视觉-语言模型中的幻觉

Kassoum Sanogo, Renzo Ardiccioni

机构 * Department of CS AI and Data Science(计算机科学与数据科学系) ESEO Engineering School(ESEO工程学院) Faculty of Law, Economy, Management(法学院、经济与管理学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出无需训练的自我纠正框架,通过不确定性引导的视觉再注意力减少视觉-语言模型中的幻觉,提升响应准确性。

Comments 24 pages, 3 figures, 2 tables. Training-free self-correction framework for vision-language models. Code and implementation details will be released at: https://github.com/kassoumsanogo1/self-correcting-vlm-re-Attention.git

Journal ref The 4th National and International Academic Conference Celebrating the 20th Anniversary of Rajapruk University (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09441 2025-12-11 cs.CV cs.AI 79%

Representation Calibration and Uncertainty Guidance for Class-Incremental Learning based on Vision Language Model

基于视觉语言模型的类增量学习中的表示校准与不确定性引导

Jiantao Tan, Peixian Ma, Tong Yu, Wentao Zhang, Ruixuan Wang

机构 * Guangdong Province Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(广东省机器智能与先进计算重点实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Peng Cheng Laboratory(鹏城实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(广东省机器智能与先进计算重点实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于视觉语言模型的类增量学习框架,通过引入任务特定适配器和跨任务表示校准策略,提升类别区分能力,并利用预测不确定性优化图像特征选择,实现更准确的分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏