arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-29 至 2025-12-29 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 5 篇

2510.23671 2025-12-29 cs.LG cs.AI 73%

Sparsity and Superposition in Mixture of Experts

稀疏性与叠加在专家混合模型中的作用

Marmik Chaudhari, Jeremi Nuer, Rome Thorstenson

机构 * Arcadia Research Team(Arcadia研究团队)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究探讨了混合专家模型中稀疏性和叠加的关系,发现网络稀疏性更能表征MoE,并提出了基于单语义特征表示的专家专业化定义,表明适当初始化下专家会围绕一致特征组合组织,从而提升模型可解释性而不牺牲性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21999 2025-12-29 cs.CV cs.LG 70%

Look Closer! An Adversarial Parametric Editing Framework for Hallucination Mitigation in VLMs

更仔细地看!一种对抗性参数编辑框架用于减轻视觉语言模型中的幻觉

Jiayu Hu, Beibei Li, Jiangwei Xia, Yanjun Qin, Bing Ji, Zhongshi He

专题命中 知识编辑与模型理解 :LLM(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种对抗性参数编辑框架,通过激活-定位-编辑-对抗范式减轻视觉语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21670 2025-12-29 cs.CV cs.LG 57%

The Deepfake Detective: Interpreting Neural Forensics Through Sparse Features and Manifolds

深度伪造侦探:通过稀疏特征和流形进行神经取证解释

Subramanyam Sahoo, Jared Junkin

机构 * Berkeley AI Safety Initiative (BASIS) University of California, Berkeley(伯克利人工智能安全倡议(BASIS)大学伯克利) Department of Electrical and Computer Engineering Johns Hopkins University(电气与计算机工程系约翰霍普金斯大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种通过稀疏特征和流形分析来解释深度伪造检测模型的框架,揭示了模型内部特征的使用规律和几何属性变化,以提升模型的可解释性和鲁棒性。

Comments 10 pages, 5 figures, Initial Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21331 2025-12-29 cs.CV 50%

TICON: A Slide-Level Tile Contextualizer for Histopathology Representation Learning

TICON:用于病理学表示学习的滑片级上下文化器

Varun Belagali, Saarthak Kapse, Pierre Marza, Srijan Das, Zilinghan Li, Sofiène Boutaj, Pushpak Pati, Srikar Yellapragada, Tarak Nath Nandi, Ravi K Madduri, Joel Saltz, Prateek Prasanna, Stergios Christodoulidis, Maria Vakalopoulou, Dimitris Samaras

机构 * Stony Brook University(石溪大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS、CentraleSupélec、巴黎-萨克雷大学) UNC Charlotte(北卡罗来纳大学夏洛特分校) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学) Archimedes/Athena RC Independent Researcher(独立研究者)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 TICON通过统一的Transformer模型提升病理学滑片和全滑片表示学习的性能,实现多个基准的新状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14330 2025-12-29 cs.IR 50%

Ensembling Multiple Hallucination Detectors Trained on VLLM Internal Representations

集成多个基于VLLM内部表示的幻觉检测器

Yuto Nakamizo, Ryuhei Miyazato, Hikaru Tanabe, Ryuta Yamakura, Kiori Hatanaka

专题命中 知识编辑与模型理解 :LLM(abstract)

AI总结 本文提出通过集成多个基于VLLM内部表示的幻觉检测模型,以减少幻觉并提高VQA任务的准确性。

Comments 5th place solution at Meta KDD Cup 2025

详情

展开后加载摘要…

URL PDF HTML 收藏