arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 617 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 617 篇

2607.09998 2026-07-14 cs.LG q-bio.BM 新提交 79%

Vilya-1: An all-atom foundation model for macrocycle structure prediction and design

Vilya-1:用于大环结构预测与设计的全原子基础模型

Vilya Research, :, Pascal Sturmfels, Milad Salem, Naozumi Hiranuma, Stephen Rettie, Xiaoliang Pan, Benjamin D. Sellers, Adam P. Moyer, Patrick J. Salveson, Ivan Anishchanka

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对现有大环肽结构和性质建模方法的局限,提出全原子深度学习模型Vilya-1,可跨化学结构采样及预测属性,在异构数据集训练,提高几何精度且覆盖小分子,支持生成应用,为大环治疗药物开发加速。

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07507 2026-07-09 cs.CV cs.AI 新提交 79%

HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

HIVE:理解视觉语言模型中的幻觉后推理

Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) Meta AI Kent State University(肯特州立大学) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06224 2026-07-08 cs.LG 新提交 79%

Canopy: A Heterograph Foundation Model for Metabolic Engineering

Canopy:用于代谢工程的异构图基础模型

Jake Bowden, Laurence Legon, Satnam Surae

机构 * an in-house laboratory information management system (LIMS)(一个内部实验室信息管理系统(LIMS))

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 代谢工程中设计高产微生物菌株有挑战,Canopy异构图基础模型集成多数据源成知识图谱,用特定模型编码特征,经自监督目标预训练,在发酵滴度预测任务中表现优于基线。

Comments Accepted at ICML GenBio Workshop 2026 https://openreview.net/forum?id=H8bvgKoT7j

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04593 2026-07-07 cs.CV cs.AI 新提交 79%

TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

TORINO:通过视觉语言模型中可解释的概念重叠进行令牌减少

Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda, Alaa Eddine Mazouz, Van-Tam Nguyen

机构 * University of Turin, Italy(意大利都灵大学) Eindhoven University of Technology, The Netherlands(荷兰埃因霍温理工大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型计算成本高问题,提出TORINO框架,利用稀疏自动编码器将视觉令牌投影到可解释潜在空间,通过概念重叠分组并减少令牌,兼顾效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04163 2026-07-07 cs.CV cs.AI 新提交 79%

SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering

SeeMe:通过有效的视觉令牌工程减轻大型视觉语言模型中的幻觉

Kai Tang, Jinhao You, Bohua Zhang, Yichen Guo, Yiding Sun, Dongxu Zhang, Chenxi Li, Xiande Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) University of Pennsylvania(宾夕法尼亚大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) De Artificial Intelligence Lab(德人工智能实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究大型视觉语言模型易产生幻觉问题,提出无训练框架SeeMe,引入传统机器学习特征工程概念,经三阶段令牌工程重组视觉令牌抑制幻觉源,实验证明其能减轻幻觉并提高输出一致性。

Comments 12 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31976 2026-07-01 cs.AI cs.MA 新提交 79%

TreeAgent: A Generalizable Multi-Agent Framework for Automated Bias Labeling in Forestry via Compiled Expert Rules and Vision-Language Models

TreeAgent: 一种基于编译专家规则和视觉语言模型的通用多智能体框架,用于林业自动化偏差标注

Shiyi Chen, Nicholas Saban, Collin Hargreaves, Huiqi Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 提出TreeAgent多智能体框架,结合专家决策树与视觉语言模型,通过解耦声明式决策实现零修改泛化,在树木偏差分类中超越监督学习基线并降低标注成本。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31577 2026-07-01 cs.CV cs.LG 新提交 79%

Localized Conformal Prediction for Image Classification with Vision-Language Models

基于视觉语言模型的图像分类局部化共形预测

Clément Fuchs, Tim Bary, Benoît Macq

机构 * CÉCI F.R.S.-FNRS(比利时国家科学研究基金会) Walloon Region(瓦隆大区)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 针对图像分类中局部化共形预测未充分探索的问题,提出一种简单的余弦相似度非线性变换,在保持边际覆盖保证的同时显著降低平均集大小。

Comments 7 pages, 2 figures, 3 tables, code availables, accepted to EUVIP 2025

Journal ref 2025 13th European Workshop on Visual Information Processing (EUVIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31338 2026-07-01 cs.SD cs.AI eess.AS 新提交 79%

Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models

超越二元乐器问答:探究音乐音频-语言模型中的乐器接地

Yujun Lee, Joonhyeok Shin, Hyoeun Kim, Kyuhong Shim

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文通过多轴诊断基准测试发现,音乐音频-语言模型在二元乐器问答中的高准确率常掩盖选项位置偏差、易混淆乐器错误和时间响应偏差等问题,表明乐器接地评估需采用多维度基准而非单一准确率。

Comments Workshop on Machine Learning for Audio, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28273 2026-06-29 cs.CL 新提交 79%

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models

视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制

Niclas Lietzow, Danielle Bitterman, Carsten Eickhoff, William Rudman, Michal Golovanevsky

机构 * University of Tübingen(图宾根大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 通过激活修补和消融实验,发现VLM中视觉默认激活,而先验知识依赖少量因果注意力头(2.5-4.8%),形成不对称因果结构。

Comments 14 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27460 2026-06-29 cs.CL 新提交 79%

Developmental approach reveals the statistical learning of Neural Language Models: Transformers generalize from the most abstract statistical patterns

发展方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化

Wang Bojun, Holly Jenkins, Elizabeth Wonnacott

机构 * Department of Education, University of Oxford(牛津大学教育学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究采用发展方法,通过训练生成式Transformer模型并分析其内部表征变化,发现神经语言模型先习得最抽象的全局统计知识,后习得局部统计依赖,并提出新的统计学习与语言认知框架。

Comments 10 pages, 7 figures, oral presentation at Interdisciplinary Advances in Statistical Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24026 2026-06-24 cs.AI 新提交 79%

Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?

语言模型代理能否成为机械可解释性中有用的电路解释器?

Ayan Antik Khan, Harsh Kohli, Yuekun Yao, Huan Sun, Ziyu Yao

机构 * George Mason University(乔治梅森大学) The Ohio State University(俄亥俄州立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究语言模型代理在机械可解释性中自动解释已定位电路的能力,提出HyVE方法,通过迭代观察、假设生成和因果验证生成组件级解释,实验表明代理有潜力但可靠验证仍是关键障碍。

Comments 23 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19815 2026-06-19 cs.CL 新提交 79%

Clusters are All You Need: Pre-Training the Tsetlin Machine with Semantic Clusters from Language Models for Interpretability

聚类即一切:利用语言模型中的语义聚类预训练Tsetlin Machine以实现可解释性

Jiechao Gao, Rohan Kumar Yadav, Yuangang Li, Yuandong Pan, Jie Wang, Ying Liu, Michael Lepech

机构 * Independent Researcher(独立研究员) University of California, Irvine(加州大学尔湾分校) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 提出一种语义预训练框架,通过K-means或Top2Vec将文本聚类,用聚类-样本对预训练Tsetlin Machine,使其学习可解释的语义关键词,在五个数据集上性能优于传统方法且与BERT竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17417 2026-06-17 cs.SD cs.LG 新提交 79%

A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models

大型音频语言模型时间理解失败模式的深入分析

Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh, Sarah Wiegreffe, Dinesh Manocha, Ramani Duraiswami

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文通过行为与因果机制分析,揭示大型音频语言模型在时间推理中因模态不平衡而失败,并提出注意力重分配方法提升准确率。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16044 2026-06-16 cs.LG q-bio.QM 新提交 79%

Circuit Tracing in Autoregressive Protein Language Models

自回归蛋白质语言模型中的电路追踪

Darin Tsui, William Deinzer, Daniel Saeedi, Amirali Aghazadeh

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 提出ProGenMech框架,通过跨层稀疏编码器忠实恢复ProGen3的生成计算,并零样本发现与蛋白质生成和适应性预测相关的稀疏电路,揭示生物意义基序。

Comments Accepted into the Mechanistic Interpretability Workshop at ICML 2026. 24 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14373 2026-06-15 hep-ex cs.LG hep-ph physics.data-an physics.ins-det 新提交 79%

Machine-learned particle flow as a foundation model for collider physics

机器学习粒子流作为对撞机物理学的基础模型

Farouk Mokhtar, Joosep Pata, Michael Kagan, Javier Duarte

机构 * University of California San Diego(加州大学圣地亚哥分校) National Institute of Chemical Physics and Biophysics(化学物理与生物物理国家研究所) SLAC National Accelerator Laboratory(斯坦福线性加速器中心国家加速器实验室)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 将事件重建视为机器学习问题,利用MLPF模型学习到的潜在表示,在喷注味识别、喷注能量回归和缺失动量回归三项分析任务上显著提升性能,且单线性层即可媲美先进架构,参数减少约35倍。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08394 2026-06-09 cs.CL 新提交 79%

When Correct Decisions Hide Internal Stress: Decision-State Probing in Multimodal Language Models

当正确决策隐藏内部压力:多模态语言模型中的决策状态探测

Haoran Zhao, Soyeon Caren Han, Eduard Hovy

机构 * The University of Melbourne(墨尔本大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 提出S³E框架,通过正锚定A/B强制选择任务和隐藏状态分析,发现多模态语言模型在正确行为下仍存在语义压力导致的决策状态位移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07861 2026-06-09 cs.CV cs.AI 新提交 79%

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

最后一个可见像素:探究视觉-语言模型中的精细尺度感知

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A. Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07771 2026-06-09 astro-ph.IM astro-ph.GA cs.AI 新提交 79%

Beyond Point Estimates: Benchmarking Uncertainty Quantification Methods on the AION-1 Astronomical Foundation Model

超越点估计:在AION-1天文基础模型上基准测试不确定性量化方法

Karla Tame-Narvaez, Aleksandra Ćiprijanović, Shubhendu Trivedi

机构 * Scientific Computing Division Fermi National Accelerator Laboratory(费米国家加速器实验室科学计算部) Fermi National Accelerator Laboratory(费米国家加速器实验室) Department of Astronomy and Astrophysics University of Chicago(芝加哥大学天文学与天体物理学系) NSF and Simons SkAI Institute(国家科学基金会与Simons SkAI研究所) Google DeepMind(谷歌DeepMind)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文在AION-1基础模型嵌入上比较七种不确定性量化方法,发现共形预测(尤其是LVD框架)在星系属性回归中提供可靠的边际和局部覆盖,优于非共形基线。

Comments 7 pages, 1 table, 1 figure

Journal ref Contribution to Conference on Physics and AI at Stanford University (PAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17883 2026-07-21 cs.CL cs.AI 新提交 79%

Zero Hallucination, by Construction: Hallucination-Aware Layered Oversight for Trustworthy Enterprise AI

通过构建实现零幻觉:用于可信企业人工智能的幻觉感知分层监督

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究企业AI因幻觉难以被信任的问题时,提出HALO架构,通过六层防御将幻觉视为可控制故障模式,详细介绍各层并关注基于证据的置信度,以实现可信企业AI,在索赔提取工作负载上进行了架构说明。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16262 2026-07-21 cs.LG cs.AI 新提交 79%

Autonomous mechanistic discovery of colorectal cancer vulnerabilities via multi-scale AI swarms

通过多尺度人工智能群体自主进行结直肠癌脆弱性的机制发现

Christopher Baker, Tianyu Ren, Karen Rafferty, Hui Wang, Simon McDade

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决自动化科学发现中语言模型与生物物理的认知差距。通过多尺度自主发现引擎Octopus,结合大语言模型群体和算法物理引擎,针对结直肠癌转录组进行无监督扫描,发现IGF2是5-氟尿嘧啶耐药脆弱性,建立了可验证的生物医学发现范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09706 2026-07-14 cs.AI cs.GT cs.LG 新提交 79%

YUKTI: From Natural-Language Situations to Robust, Verifiable Decisions An Uncertainty-Typed Proposition IR, Assumption-Robust Pareto Frontiers, and a Regret Certificate

YUKTI:从自然语言情境到稳健、可验证的决策——一种不确定性类型的命题IR、假设稳健帕累托前沿和遗憾证书

Suyash Mishra

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究从自然语言情境生成稳健决策,核心方法是用类型命题图表示,经多求解器及分布帕累托交接耦合,并引入ARPF等。主要贡献是证明rho与决策遗憾关系,增加可追溯性,合成数据基础,通过多种验证方式展示方法有效性。

Comments 19 Pages , 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03325 2026-07-07 cs.CL cs.AI cs.IR 新提交 79%

From Judgments to Issues: Structured Extraction of Legal Reasoning with Citation-Hallucination Control

从判决到问题:具有引用幻觉控制的法律推理结构化提取

Giovanni Piccioli, Alessia Fidelangeli, Piera Santin, Pierpaolo Vivo

机构 * Quantitative and Digital Law Laboratory(量化与数字法律实验室) CIRSFID - Alma AI, Faculty of Law University of Bologna(CIRSFID - 阿尔玛AI,博洛尼亚大学法学院) Robert Schuman Centre European University Institute(罗伯特·施曼中心欧洲大学研究所)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出自动化流程,将意大利税务法庭判决分解为法律问题,基于IRAC框架和法律三段论提取结构化XML表示,用通用模型并结合幻觉检测过滤器处理大量判决,经专家验证,为下游应用提供起点。

Comments 33 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23989 2026-07-02 cs.CL cs.AI 新提交 79%

Faithful by Construction: Claim-Anchored Attribution for Multi-Document Summarization

通过构造忠实:面向多文档摘要的基于主张的归因

Shuo Guan

机构 * UBS AG(瑞银集团)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CAMS框架,通过提取原子主张、聚类、选择并重写为摘要,实现细粒度、多源可追溯的归因,显著提升忠实度和引用精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22686 2026-07-01 cs.CR cs.AI cs.LG 新提交 79%

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

拒绝的几何:安全对齐大语言模型中的线性不稳定性

Shivam Ratnakar, Kartikeya Vats

机构 * University of Southern California(南加州大学) Independent Researcher(独立研究员)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过对比安全与不安全系统提示的隐藏状态,提出对比逻辑操控(CLS)框架,揭示安全对齐的线性脆弱性,并证明逻辑级干预比隐藏状态方法更有效,同时可实现双向控制。

Comments Accepted at TrustNLP 2026 (Sixth Workshop on Trustworthy Natural Language Processing, ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23276 2026-06-25 cs.LG cs.AI cs.CR 新提交 79%

Exposing the Illusion of Erasure in Knowledge Editing for LLMs

揭露大语言模型知识编辑中的擦除幻象

Advik Raj Basani, Anshuman Chhabra

机构 * Birla Institute of Technology and Science, Goa(比拉理工学院与科学学院,果阿校区) University of South Florida(南佛罗里达大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文从对抗性诱发角度揭示知识编辑并未真正擦除旧知识,而是将其重新分布并抑制表达,且易受间接提示和对抗攻击,证明知识编辑算法本质上可被绕过。

Comments Preprint, 26 pages + 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18984 2026-08-20 cs.CV 新提交 78%

Uncertainty-Aware Art-Historical Dating with Vision-Language Models

基于视觉语言模型的不确定性感知艺术史年代测定

Stefanie Schneider, Peter Bell

机构 * Marburg University(马尔堡大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 该研究针对艺术品年代测定中的时间纠缠问题,将其转化为不确定性感知回归任务,通过在Wikidata艺术品语料库上实验发现视觉语言模型(VLMs)在该任务上优于纯视觉自监督基线,但存在偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11474 2026-08-13 cs.CV 新提交 78%

Test-Time Hallucination Control in Large Vision-Language Models

大型视觉语言模型的测试时幻觉控制

Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian, Mohammadreza Alimoradijazi, Aijun An, Hossein Rahmani

机构 * Australian National University(澳大利亚国立大学) The University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) York University(约克大学) Lancaster University(兰卡斯特大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 针对大型视觉语言模型的物体幻觉问题,提出无训练的测试时幻觉缓解(TTH)方法,通过令牌验证器模块等技术提升模型准确性与稳健性,通用性和实用性良好。

Comments Accepted at ECCV 2026 MUCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11024 2026-08-12 cs.CV 新提交 78%

When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models

当视觉信号产生误导:视觉语言模型中属性幻觉的机制研究

Yufei Zhang, Chenlu Zhan, Hongwei Wang

机构 * Zhejiang University(浙江大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 针对视觉语言模型的属性幻觉问题,提出VISOR框架,通过VSNR诊断区分失败模式并路由适配操作,在三类模型上减少属性假阳性且不依赖先验主导假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09427 2026-08-11 cs.CV 新提交 78%

Foundation Models are Implicit Deepfake Detectors

基础模型是隐式深度伪造检测器

Stefan Smeu, Dragos-Alexandru Boldisor, Elisabeta Oneata, Dan Oneata

机构 * AAAI Press(AAAI出版社)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 该研究发现基础模型的特征幅度可区分真实与伪造媒体,将深度伪造检测建模为异常检测,简单统计指标即可达到竞争性能,且模型规模越大判别信号越强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05945 2026-08-07 cs.CV 新提交 78%

Respect Your Zero-Shot Uncertainty: Conservative Calibration for Test-Time-Adapted Vision-Language Models

重视零样本不确定性:面向测试时自适应视觉-语言模型的保守校准

Jingyan Jiang, Yaru Sun, Xiao Chen, Jiazhen Huang, Caiting Li, Zhijian He, Yin Chen, Pingting Hao

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 针对测试时自适应(TTA)视觉-语言模型校准度下降的问题,提出零样本锚定熵校准(ZAEC)方法,通过最小温度缩放恢复锐化预测的零样本熵,在多模型多数据集上实现了更低的期望校准误差(ECE)。

详情

展开后加载摘要…

URL PDF HTML 收藏