arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7583 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7583 篇

2608.09011 2026-08-20 cs.LG 版本更新 57%

Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning

视觉-语言表示学习中的动态分布感知不确定性跟踪

Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Shufan Yang, Haoru Chen, Qing Gu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance Inc(字节跳动公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 针对视觉-语言模型事后不确定性量化方法忽略测试分布动态性的问题,提出DDA-UQ框架,通过高斯混合模型建模嵌入空间,实现动态不确定性估计,性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09764 2026-08-20 cs.LG 版本更新 57%

Prototype-based Self-Supervised Multimodal Learning for PPG and Accelerometry Signals

基于原型的PPG与加速度计信号自监督多模态学习

Wanting Mao, Maxwell A Xu, Harish Haresamudram, Mithun Saha, Santosh Kumar, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Memphis(密苏里大学孟菲斯分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 针对PPG与加速度计等生物信号的多模态学习局限,提出基于原型的SSL框架ProtoMM,开发Pulse-Motion基础模型,性能优于现有对比式及多模态SSL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16931 2026-08-19 cs.LG 新提交 57%

SW-ProxyCE: Zero-Query Adversarial Transfer from Public EEG Encoders to Private Downstream Models

SW-ProxyCE:从公开EEG编码器到私有下游模型的零查询对抗迁移

Linhua Cong, Dingkun Liu, Dongrui Wu

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 本文针对公开编码器与私有下游模型场景,提出无查询的任务感知攻击框架SW-ProxyCE,实验表明其生成的对抗样本可有效迁移至下游模型,且性能优于任务无关攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17203 2026-08-19 stat.ML cs.LG math.ST stat.TH 新提交 57%

Expressivity In Multimodal Contrastive Learning

多模态对比学习中的表达能力

Andrew Stuart, Florian Wolf

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15239 2026-08-18 cs.LG stat.ML 新提交 57%

Learning reshapes power-law anisotropy in internal representations

学习重塑内部表征中的幂律各向异性

Asahi Nakamuta, Jun-nosuke Teramae

机构 * Graduate School of Informatics(情报学研究科) Kyoto University(京都大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 该研究通过求解线性神经网络学习动力学,揭示输入统计与任务结构的动态相互作用是幂律内部表征的形成机制,且非线性网络中存在类似指数演化规律。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15082 2026-08-18 cs.AI 新提交 57%

Beyond Thresholds: A Quality-Aware Decision Intelligence Framework for Cold Chain IoT Systems

Aashna Sofat, Balwinder Sodhi

机构 * IIT Ropar(印度理工学院罗帕尔分校)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22771 2026-08-18 cs.CV cs.AI 版本更新 57%

When Do Cheap Probes Predict Expensive Training? Probing 3D-CT Encoders for Text Generation

廉价探针预测3D-CT视觉语言模型中的昂贵训练

Renjie Liang, Zijian Xu

机构 * University of Florida(佛罗里达大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究为3D-CT视觉语言模型选编码器及压缩方案时,候选组合多难比较。提出用廉价探针替代,构建含验证门限的探测基准,比较读出头并配对探针与下游任务,早期结果显示廉价探针排序与昂贵微调一致,有望快速筛选方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10204 2026-08-18 cs.LG math.OC 版本更新 57%

Adaptive Optimization via Momentum on Variance-Normalized Gradients

通过动量优化变分归一化梯度

Francisco Patitucci, Aryan Mokhtari

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 MVN-Grad通过动量优化变分归一化梯度,在稳定性和性能上优于Adam等优化器,适用于图像分类和语言模型任务。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14355 2026-08-17 cs.AI 新提交 57%

Disentangled Shared Representations Improve Morpho-Transcriptomic Integration

解耦共享表示可改进形态-转录组整合

Julian Ostermaier, Swann Ruyter, Reuben Dorent, Daniel Racoceanu

机构 * ESPCI Paris, PSL University(巴黎高等物理化工学院,PSL大学) Sorbonne Université(索邦大学) CNRS(法国国家科学研究中心) Inserm(法国国家健康与医学研究院) AP-HP(巴黎公共医疗集团) Inria(法国国家信息与自动化研究所) Paris Brain Institute – ICM(巴黎脑研究所 – ICM)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 本研究针对空间转录组学的多模态表示学习问题,对比不同模型的标准与解耦变体,发现解耦共享与模态特有信息可提升相关指标,为多模态学习提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12695 2026-08-14 cs.LG eess.SP 新提交 57%

The Impact of Temporal Context Length and Encoding Strategies on Self-Supervised ECG Representation Learning

时间上下文长度与编码策略对自监督心电图表征学习的影响

Ahmed Sameh, Ramzi Al-Sharawi, Yogatheesan Varatharajah

机构 * University of Minnesota Twin Cities(明尼苏达大学双子城分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 该研究在Icentia11k数据集上对比不同时间上下文长度与编码策略,发现扩展上下文、采用连续补丁嵌入的自监督ECG模型在心律检测与跨会话检索任务中性能更优,为临床ECG模型构建提供了指导。

Comments Accepted at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026). 6 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29055 2026-08-13 cs.AI cs.MA 版本更新 57%

Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

基于智能体AI、嵌套学习与语义缓存的幻觉缓解与AI可持续性

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);分类 cs.AI

AI总结 提出一种HOPE启发的嵌套学习架构,结合连续记忆系统和语义缓存,通过三阶段智能体管道在混合基准上实现幻觉缓解,同时降低能耗并提高可观测性。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10835 2026-08-12 cs.CV cs.LG 新提交 57%

UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations

UniProbe:基于多结构内部表征的可学习大视觉语言模型(VLM) token 级幻觉检测器

Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya, Yftah Ziser, Gal Chechik, Haggai Maron

机构 * NVIDIA Research(英伟达研究院) Technion(以色列理工学院) Bar-Ilan University(巴伊兰大学) University of Groningen(格罗宁根大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 UniProbe 是基于 LVLM 异构计算轨迹的可学习 token 级幻觉检测器,通过多结构模块交互实现 SOTA 检测性能,解码时可降 55% 对象幻觉且延迟仅增 6%

Comments Project Page: https://research.nvidia.com/labs/par/uniprobe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10374 2026-08-12 cs.LG 新提交 57%

Fisher8: Stabilizing Neural Heteroscedastic Regression via Output-Layer Fisher Geometry

Fisher8:通过输出层Fisher几何稳定神经异方差回归

Sumedh Vemuganti, Nickvash Kani

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.LG

AI总结 Fisher8是一种输出层梯度修正方法,通过Fisher几何稳定神经异方差回归,无数据依赖超参数,在多维回归等任务中实现了更优的似然-误差权衡与校准不确定性估计。

Journal ref Proceedings of the 42nd Conference on Uncertainty in Artificial Intelligence (UAI), PMLR 337:6885-6899, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08167 2026-08-11 cs.CV cs.LG 新提交 57%

Wiener Representation Filtering for VLM Hallucination Suppression

用于抑制视觉语言模型幻觉的维纳表示滤波

Ameen Ali, Tamim Zoabi, Lidor Brami, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08398 2026-08-11 cs.AI astro-ph.IM 新提交 57%

Estimating Uncertainty in Galaxy Morphology Classification

星系形态分类中的不确定性估计

Kai Cheng, Ruoqi Wang, Qiong Luo

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 针对星系形态分类(GMC)中基础模型无法量化不确定性的问题,提出后验框架UEGMC,可从冻结骨干网络提取的表示中直接预测不确定性,实验显示其不确定性量化性能具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00421 2026-08-11 cs.AI 版本更新 57%

Self-Routing: Parameter-Free Expert Routing from Hidden States

自路由:从隐藏状态中无参数的专家路由

Jama Hussein Mohamud, Drew Wagner, Mirco Ravanelli

机构 * Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) Universite de Montreal(蒙特利尔大学) Concordia University(康考迪亚大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出自路由机制,通过直接利用隐藏状态子空间作为专家logits,无需额外路由参数,实现更平衡的专家利用。在GPT-2语言模型和ImageNet-1K分类任务中,自路由在性能上与传统路由方法相当,且提升专家利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10168 2026-08-11 cs.CV cs.AI cs.RO 版本更新 57%

RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation

RAG-3DSG: 通过重拍引导的检索增强生成增强3D场景图

Yue Chang, Rufeng Chen, Zhaofan Zhang, Yi Chen, Yifan Tian, Sihong Xie

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 RAG-3DSG通过重拍引导的不确定性估计缓解3D场景图中的语义不一致问题,利用对象级检索增强生成方法提升机器人任务中的场景表示可靠性。

Comments Accepted by ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07302 2026-08-10 cs.CV cs.AI 新提交 57%

Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

相同注意力,不同真相:在视觉注意力上应用Logit-Lens检测并缓解LVLM的物体幻觉

Zichuan Wang, Songlin Yang, Bo Peng, Zhenchen Tang, Yang Li, Beibei Dong, Jing Dong

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 该研究针对LVLM的物体幻觉问题,通过Logit Lens分析视觉注意力,揭示两种幻觉机制,提出无需训练的Detect-Mitigate框架,在多个基准上实现最优结果。

Comments CVPR2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07176 2026-08-10 cs.CV cs.AI 新提交 57%

Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation

面向隐空间生成的表征驱动型内窥镜视觉嵌入对齐

Francisco Caetano, Tim J. M. Jaspers, Haiko Middeljans, Martijn R. Jong, Rixta A. H. van Eijck van Heslinga, Floor Slooter, Albert J. de Groof, Jacques J. Bergman, Peter H. N. De With, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) Amsterdam University Medical Centers(阿姆斯特丹大学医学中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 本研究针对内窥镜生成模型的领域差距与计算成本问题,提出REVEAL模型,基于500万帧内窥镜数据训练,在多任务中性能优于同类模型,为临床智能工具开发提供基础。

Comments Accepted at the DCA-MI Workshop (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07154 2026-08-10 cs.RO cs.AI 新提交 57%

Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation

基于OpenArm的实验室移动操作的表示交接

Yang Shen, Chonghao Cheng, Ziyi Zhao, Jialuo Zhu, Zhenyi Yi, Qi Zhao, Jian Yang, Yuhui Shi, Chin-Teng Lin

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。

Comments Robotics: Science and Systems (RSS) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21607 2026-08-10 cs.AI 版本更新 57%

INTRYGUE: Induction-Aware Entropy Gating for Reliable RAG Uncertainty Estimation

INTRYGUE:面向可靠RAG不确定性估计的诱导感知熵门控

Alexandra Bazarova, Andrei Volodichev, Daria Kotova, Alexey Zaytsev

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出INTRYGUE方法,通过诱导头激活模式门控预测熵,解决RAG中熵基不确定性估计的机械悖论问题,提升hallucination检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06300 2026-08-07 cs.AI 新提交 57%

Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

基于概念激活向量的L2口语评估系统的偏差分析

Arya Labroo, Mengjie Qian, Kate Knill

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 该研究将概念激活向量(CAV)分析扩展到BERT和Whisper两个L2口语评估系统,发现概念可恢复性及对概念的敏感性依赖于模型架构,稀疏自编码器(SAEs)可提升概念线性恢复性但会减弱激活空间敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03855 2026-08-07 cs.LG 版本更新 57%

Bi-semantic Chemical Embedder for Joint Representation Learning of SMILES and Natural Language

用于SMILES与自然语言联合表示学习的双语义化学嵌入器

David Ming Segura, Jeremy Goumaz, Joshua W. Sin, Bojana Ranković, Philippe Schwaller

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 该研究提出双语义化学嵌入模型CheMatE,通过两阶段训练将SMILES与自然语言联合表示,在分子性质预测等下游任务上表现具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27237 2026-08-07 cs.CL 版本更新 57%

LMs as Task-Specific Knowledge Bases: An Interpretability Analysis

语言模型作为任务特定知识库:一种可解释性分析

Amit Elhelo, Amir Globerson, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学布拉瓦特尼克计算机科学与人工智能学院) Google Research(谷歌研究院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 通过行为和机制分析,发现语言模型以任务特定方式编码知识,不同任务对同一事实的查询结果不一致,且参数定位实验揭示了不同任务涉及不同参数子集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04902 2026-08-06 cs.CV cs.LG cs.SD 新提交 57%

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

视觉表示很重要:利用视频到音频生成中的时间差异

Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 针对现有基于条件扩散的视频到音频(V2A)生成方法需额外网络或强归纳偏置的问题,提出TD-V2A框架,利用时间差异(TD)增强视觉条件,提升了V2A生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04732 2026-08-06 eess.SY cs.AI cs.RO cs.SY 新提交 57%

Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control

在安全Actor-Critic最优控制中融合自适应经验回放与在线不确定性估计

Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima Samadzadeh

专题命中 知识编辑与模型理解 :post-training(abstract);分类 cs.AI

AI总结 该研究在安全Actor-Critic最优控制中提出融合自适应经验回放与在线不确定性估计的集成架构,在二维机器人导航任务的测试中,该集成配置在极端压力测试下实现零接触且全部种子到达目标,性能优于仅移除不确定性估计的配置。

Comments Code, deterministic seeds, data, figures, and protocol files are archived at https://doi.org/10.5281/zenodo.21515850 and https://github.com/SDNT8810/safe-actor-critic-aer-ue-reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04510 2026-08-06 cs.RO cs.AI 新提交 57%

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

GUARD:面向扩散型视觉-语言动作(VLA)的不确定性与基于消融的风险检测

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出GUARD方法,无需修改预训练扩散型VLA策略即可检测其故障,在多基准测试中提升未见过任务的ROC-AUC,提供可跨多维度迁移的故障信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03817 2026-08-05 cs.CV cs.AI 新提交 57%

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

UHP检测:大型视觉语言模型(LVLMs)在一致性空间中具有独特的幻觉模式

Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本研究针对LVLMs的幻觉问题,提出UHP检测框架,通过图像与文本扰动模态、陈述与否定逻辑极性构建四组一致性特征,训练分类器,在AMBER和PhD数据集上显著优于现有基线。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17447 2026-08-05 stat.ME cs.CL math.ST stat.ML stat.TH 版本更新 57%

Calibrating Semantic Uncertainty from Observable Language-Model Probabilities

从可观察的语言模型概率校准语义不确定性

Matthew F. Dixon

机构 * Artificial Intelligence Finance Institute (AIFI)(人工智能金融研究所) Quiota LLC(Quiota公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 研究如何从语言模型概率校准语义不确定性,引入语义映射方法,经测试该方法在处理专业市场文本和模拟时,语言衍生概率表现良好,能恢复后验且稳定,语义映射将问题转化为可测试统计问题并产生可审计后验估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13300 2026-08-05 eess.AS cs.AI cs.SD 交叉投稿 57%

PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement

PASE:利用WavLM的语音学先验实现低幻觉生成式语音增强

Xiaobin Rong, Qinwen Hu, Mansur Yesilbursa, Kamil Wojcicki, Jing Lu

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本研究针对生成式语音增强的幻觉问题,提出PASE框架,通过适配WavLM为去噪专家、双流声码器训练,实现低幻觉的语音增强,性能优于现有最优模型。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏