arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-26 至 2026-08-26 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 18 篇

2608.24492 2026-08-26 cs.LG cs.AI cs.CL 新提交 90%

When Do Supervised UQ Ensembles Improve LLM Hallucination Detection? A Robustness Study

当监督式不确定性量化集成能提升大语言模型幻觉检测性能?一项鲁棒性研究

Mohit Singh Chauhan, Vipin Gyanchandani, Dylan Bouchard

机构 * CVS Health(CVS健康公司)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究监督式UQ集成对LLM幻觉检测的鲁棒性,在多模型、多数据集、多生成范式下分析其性能,发现其多数场景优于单个评分器,采样黑盒集成效果接近全集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13979 2026-08-26 cs.AI 版本更新 89%

ReflCtrl: Controlling LLM Reflection Efficiently via Representation Engineering

ReflCtrl: 通过表征工程控制LLM的反思

Ge Yan, Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * CSE, UCSD(计算机科学与工程系,加州大学圣塔克鲁兹分校) HDSI, UCSD(人类-数字系统研究所,加州大学圣塔克鲁兹分校)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 ReflCtrl通过表征工程控制LLM的反思行为,减少冗余推理并提升效率。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18346 2026-08-26 cs.CL cs.AI 版本更新 88%

Comparing Uncertainty Measurement and Mitigation Methods for Large Language Models: A Systematic Review

比较大型语言模型的不确定性测量与缓解方法:系统综述

Toghrul Abbasli, Kentaroh Toyoda, Yuan Wang, Leon Witt, Muhammad Asif Ali, Yukai Miao, Dan Li, Qingsong Wei

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文系统回顾了大型语言模型中不确定性测量与缓解方法的有效性,提出严谨的基准测试,并通过实验证明了现有方法的显著发现,为未来研究方向和开放挑战提供了展望。

Comments Accepted to IEEE Transactions on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24807 2026-08-26 cs.SE cs.AI 新提交 87%

Automatic Model Card Generation Using an LLM

基于大语言模型的自动模型卡片生成

Tajkia Rahman Toma, Balreet Grewal, Cor-Paul Bezemer

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究提出基于LLM的MCTidy与MCGenie,前者重组模型卡片为标准化模板,后者从仓库数据直接生成,经48个Hugging Face模型验证,可实现标准化、可扩展的模型卡片文档生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24758 2026-08-26 cs.AI 新提交 87%

RACE: Scalable Statistical Estimation of Functional Consistency in LLM Neurons

RACE:LLM神经元中功能一致性的可扩展统计估计

Runyu Wang, Bo Liu, Xiaxin Zhang, Yu Han, Jiawei Cao, Xiaoye Zhang, Zhe Zhang, Yifan Yang, Peng Ping

机构 * Nantong University(南通大学) Chongqing University of Post and Telecommunications(重庆邮电大学) China Southern Power Grid Company Limited(中国南方电网有限责任公司) Meituan(美团)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM神经元功能一致性的可扩展统计估计难题,提出RACE框架,其领域特异性更优、计算开销低两个数量级,可有效评估Transformer神经元的全领域功能一致性。

Comments EMNLP-26 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24688 2026-08-26 cs.LG 新提交 79%

A Multimodal Foundation Model for Longitudinal Patient Representation and Scalable Insight Generation in Oncology

面向肿瘤学纵向患者表示与可扩展洞察生成的多模态基础模型

Eugene Vorontsov, Yi Kan Wang, Alican Bozkurt, Adam Casson, Ludmila Tydlitatova, Michal Zelechowski, Ezra E. W. Cohen, Jyoti D. Patel, Max Banaszak, Caitlin McWilliams, Shane Colley, Kate Sasser, Ryan Fukushima, Eric Lefkofsky, Razik Yousfi, Siqi Liu

机构 * Tempus AI, Inc.(Tempus AI公司)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究推出多模态基础模型oFM,基于167万肿瘤患者数据整合多模态信息,在预后基准及治疗队列中表现优于基线特征,还开发了机制发现框架以解释模型,助力肿瘤学临床与药物开发应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23965 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交 79%

RAGSentinel: Certifiable Geometric Consensus for Robust Retrieval-Augmented Generation

RAGSentinel:用于鲁棒检索增强生成的可验证几何共识

Yueyang Quan, Anjun Gao, Yufei Xia, Minghong Fang, Zhuqing Liu

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对RAG系统的中毒攻击漏洞,提出无训练无标签的RAGSentinel防御方法,通过几何共识过滤中毒文档,实验显示其能低攻高保准且抗自适应攻击。

Comments To appear in EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24142 2026-08-26 cs.CV 新提交 78%

What Does Prompt Learning Change? -A Natural-Language Concept Analysis of Vision-Language Models

提示学习改变了什么?——视觉-语言模型的自然语言概念分析

Ryo Kamiya, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 该研究提出PromptSpLiCE方法分析视觉-语言模型提示学习后的概念分布变化,发现概念分布变化与准确率提升正相关,还推导了局部梯度表达式解释相关几何直觉。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23628 2026-08-26 cs.SE 新提交 78%

Callability Is Not Operability: Controlled Interface Interventions for LLM Agents

可调用性并非可操作性:针对大语言模型智能体的受控接口干预

Zihao Wang

专题命中 知识编辑与模型理解 :LLM(title);language model(abstract)

AI总结 该研究针对大语言模型智能体的工具调用问题,提出以智能体为核心的工具设计AFT机制,并构建受控接口干预框架AFT-Bench,探究工具接口暴露与智能体安全操作的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24350 2026-08-26 cs.CL cs.AI 新提交 73%

FARCA: Fact-Aligned Reliability-Aware Credit Assignment for Reinforcement Learning with Factual Supervision

FARCA:面向具备事实监督的强化学习的事实对齐可靠性感知信用分配

Qiming Xie, Wenjie Zheng, Xiangqing Shen, Rui Xia

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FARCA是一种面向具备事实监督的强化学习的策略优化框架,通过对齐事实验证与策略更新的粒度、引入反事实证据归因计算可靠性权重,提升模型事实性并保留通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24467 2026-08-26 cs.AI 新提交 70%

HMGCLIP: Heterogeneous Multi-Granularity Contrastive Learning for E-commerce Representation Learning

HMGCLIP:面向电商表征学习的异构多粒度对比学习

Qiuyu Zhu, Yi Gao, Zhichao Wan, Mingyang Ma

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型难以捕获电商产品细粒度属性的问题,提出异构多粒度对比学习框架HMGCLIP,构建异构超图对齐多粒度语义,发布细粒度电商数据集,在多基准上性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24065 2026-08-26 cs.LG cs.AI cs.CL 新提交 67%

Mechanistic Circuit Identification for Controllable Data Generation

可控数据生成的机制电路识别

Nakyung Lee, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔大学) Konkuk University(建国大学)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出基于电路的框架,结合训练动态数据估值与机制可解释性,引入SAMS方法实现可控数据生成,在多项选择问答任务中提升了下游性能与校准度。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24859 2026-08-26 cs.LG 新提交 57%

Improving Cross-Problem Vehicle Routing with Locally Augmented Preferences and Representation Disentanglement

通过局部增强偏好与表示解耦改进跨问题车辆路径规划

Arthur Corrêa, Paulo Nascimento, Samuel Moniz

机构 * University of Coimbra(科英布拉大学)

专题命中 知识编辑与模型理解 :preference optimization(abstract);分类 cs.LG

AI总结 该研究针对多任务VRP求解器的训练与架构缺陷,提出POLAR算法与PLE编码器,在16个分布内变体上平均差距降21.3%,27个未见变体优于现有方法,提升了跨问题泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23903 2026-08-26 cs.CV cs.CL 新提交 57%

Continual Visual Learning under Evolving Semantic Concept Shift

演化语义概念偏移下的持续视觉学习

Ismail Lamaakal, Chaymae Yahyati, Yassine Maleh, Khalid El Makkaoui, Ibrahim Ouahbi

机构 * Mohammed Premier University(穆罕默德一世大学) Sultan Moulay Slimane University(苏丹穆莱·斯利曼大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.CL

AI总结 针对演化语义概念偏移问题,本文提出SemReWrite框架,结合低秩重写机制与结构化语义记忆等,构建EvoShift-Bench基准并引入多评价指标,在视觉持续学习中实现了修订语义与保留知识的更优平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12695 2026-08-26 cs.LG eess.SP 版本更新 57%

The Impact of Temporal Context Length and Encoding Strategies on Self-Supervised ECG Representation Learning

时间上下文长度与编码策略对自监督心电图表征学习的影响

Ahmed Sameh, Ramzi Al-Sharawi, Yogatheesan Varatharajah

机构 * University of Minnesota Twin Cities(明尼苏达大学双子城分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 该研究在Icentia11k数据集上对比不同时间上下文长度与编码策略,发现扩展上下文、采用连续补丁嵌入的自监督ECG模型在心律检测与跨会话检索任务中性能更优,为临床ECG模型构建提供了指导。

Comments Accepted at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026). 6 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05154 2026-08-26 cs.CL cs.CV 版本更新 57%

RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates

RIG-RoPE:具有时长感知时间坐标的关系与实例门控旋转位置编码

Donggen Li

机构 * Sichuan University(四川大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 本研究针对多模态场景中静态多维位置分配的局限,提出RIG-RoPE机制,通过关系与实例门控及时长感知时间坐标优化位置编码,未增加可学习参数,确立了相关公式与验证路径。

Comments 26 pages, 2 figures, 4 tables. This revision adds matched, inference-only Qwen2-VL-2B native/RIG L1 mechanism evidence: exact text-only equivalence, exact RIG Gauge invariance, native Gauge sensitivity, and retained same-instance spatial effects. Task-level Qwen benchmarks, training gains, stable task improvement, universality, and empirical superiority remain unestablished

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23728 2026-08-26 cs.CV 新提交 50%

Velocity-coupled Representation Refinement for Satellite Orbit Prediction

用于卫星轨道预测的速度耦合表示精化

Yue Yang, Zhiqiang Wu, Saiyu Qi, Fan Ma

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang University(浙江大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 该研究针对现有卫星轨道预测方法未利用位置与速度耦合关系的问题,提出OrbitNet方法,通过速度耦合表示精化和轨道片段建模,在Starlink域内及6个星座零样本评估中均优于对比模型。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18994 2026-08-26 cs.HC 版本更新 50%

TractorBeam: Personalized AI Sensemaking Support via Collaborative Machine Annotation

TractorBeam:通过协作机器标注实现个性化AI意义建构支持

Sireesh Gururaja, Jordan Taylor, Emma Strubell

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本研究提出TractorBeam浏览器扩展系统,通过协作机器标注隐喻解决语言模型文档问答系统的事实性与来源性问题,初步用户研究显示其可支持用户迭代优化模型输出并促进探索性意义建构。

Comments UIST Poster Extended Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏