arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 46 篇

2605.23080 2026-06-02 cs.LG 79%

The Attribution Contract: Feature Attribution for Generative Language Models

归因契约:生成式语言模型的特征归因

Giang Nguyen

机构 * Guide Labs(Guide实验室)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 针对生成式语言模型中特征归因的歧义性,提出归因契约规范,明确归因对象、特征范围、生成过程等要素,并通过自回归和扩散模型案例展示不同契约下的归因效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23593 2026-06-02 hep-ex hep-ph physics.data-an 78%

Searching for Anomalies with Foundation Models

使用基础模型搜索异常

Vinicius Mikuni, Benjamin Nachman

专题命中 其他LLM :foundation model(title,abstract)

AI总结 本文利用大型基础模型OmniLearned分析CMS实验数据,发现质量边带中的异常行为,并通过完整背景估计验证,指出背景估计在验证区拟合良好但无法准确建模信号区。

Comments 19 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30443 2026-06-02 cs.CL 77%

Cross-Lingual Steering for Figurative Language Generation

跨语言引导的比喻语言生成

Linfeng Liu, Tiffany Zhan, Louie Hong Yao, Saptarshi Ghosh, Tianyu Jiang

机构 * Department of Computer Science, University of Cincinnati(卡内基梅隆大学计算机科学系) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Independent Researcher(独立研究者)

专题命中 其他LLM :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过激活引导技术,研究多语言大模型中比喻语言生成的内部信号是否跨语言可复用,发现跨语言方向可有效转移并增强目标行为。

Comments 40 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02569 2026-06-02 cs.CV cs.AI cs.CL 73%

AdaCodec: A Predictive Visual Code for Video MLLMs

AdaCodec: 面向视频多模态大语言模型的预测性视觉编码

Haowen Hou, Zhen Huang, Zheming Liang, Qingyi Si, Chenglin Li, Shuai Dong, Kele Shao, Ruilin Li, Dianyi Wang, Nan Duan, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) JD.com(京东公司)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对视频帧间冗余问题,提出预测性视觉编码AdaCodec,通过条件预测代价决定是否发送完整参考帧或紧凑P-令牌,在匹配视觉令牌预算下提升性能,并大幅降低首令牌延迟。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02322 2026-06-02 cs.LG cs.AI 73%

Repurposing Adversarial Perturbations for Continual Learning: From Defense to Active Alignment

重新利用对抗扰动进行持续学习:从防御到主动对齐

Ran Liu, Min Yu, Mingqi Liu, Jianguo Jiang, Gang Li, Rongsheng Li, Ning Li, Zhen Xu, Weiqing Huang, Ming Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Deakin University(德肯大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出AdvCL框架,通过将对抗扰动重新用作几何控制信号,结合三个即插即用模块(Intra-Smooth、Proto-Clip、Inter-Align),在持续学习中同时提升标准性能、鲁棒性、降低遗忘并增强迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14134 2026-06-02 cs.CV cs.AI cs.LG 73%

DenseMLLM: Standard Multimodal LLMs for Dense Prediction

DenseMLLM:用于密集预测的标准多模态大语言模型

Yi Li, Hongze Shen, Lexiang Tang, Xin Li, Xinpeng Ding, Yinsong Liu, Deqiang Jiang, Xing Sun, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学电子与计算机工程系) Tencent, Youtu-Lab, China(腾讯优图实验室)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DenseMLLM,通过标准多模态大语言模型架构和视觉令牌监督策略,无需任务特定解码器即可实现语义分割、深度估计等密集预测任务,在多个基准上取得竞争性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02328 2026-06-02 cs.LG 70%

Riemannian Gradient Descent for Low-Rank Architectures

低秩架构的黎曼梯度下降

Nicholas Knight

专题命中 其他LLM :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 针对低秩矩阵参数,探索黎曼优化技术,并在小语言模型的多头注意力参数上应用,但未显著优于AdamW基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01672 2026-06-02 cs.LG 70%

RDA: Reward Design Agent for Reinforcement Learning

RDA:用于强化学习的奖励设计智能体

Hojoon Lee, Ajay Subramanian, Ben Abbatematteo, Vijay Veerabadran, Pedro Matias, Karl Ridgeway, Nitin Kamra

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度Mind)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出基于视觉语言模型的奖励设计智能体RDA,通过任务分解、视觉轨迹评估和失败模式总结迭代优化奖励函数,在操作任务中生成更符合指令的策略。

Comments Accepted to RLC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01246 2026-06-02 cs.AI 70%

SIRIUS-SQL: Anchoring Multi-Candidate Text-to-SQL in Execution Feedback

SIRIUS-SQL: 在执行反馈中锚定多候选文本到SQL

Leo Luo, Haining Xie, Siqi Shen, Zhipeng Ma, Rui Ling, Hang Xu, Hefeng Jiang, Dingwei Chen, Yang Li, Peng Chen, Jie Jiang

机构 * TEG, Tencent Inc., China(腾讯科技(TEG),腾讯公司,中国) Peking University, China(北京大学,中国)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出SIRIUS-SQL系统,通过难度平滑强化学习、执行生命周期分类和置信门控混合选择器,解决多候选SQL生成中的冗余、修复和选择问题,在BIRD dev和SPIDER test上达到75.88%和91.20%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00402 2026-06-02 stat.ME cs.AI stat.AP 70%

A Distribution-Free Framework for Rewrite-Based Human-text Detection via Knockoff Filtering

基于重写的人类文本检测的无分布框架:通过Knockoff过滤

Yi Liu

机构 * Prorata.ai

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种无分布统计框架,将任意基于重写的检测器转化为具有有限样本FDR保证的检测器,无需重新训练,通过将重写检测视为具有knockoff结构的多重假设检验问题实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00278 2026-06-02 cs.AI 70%

Evaluating Bivariate Causal Statements Based on Mutual Compatibility

基于相互兼容性评估双变量因果陈述

Erik Jahn, Dominik Janzing

机构 * California Institute of Technology, USA(加州理工学院,美国)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对一组变量上的双变量因果陈述,提出基于兼容性分数的评估方法,通过量化因果模型引入的额外混杂程度或全局一致性约束来区分正确与错误的因果陈述,并应用于大语言模型生成的因果主张。

Comments accepted for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20803 2026-06-02 cs.CL 70%

Structured Semantic Information Helps Retrieve Better Examples for In-Context Learning Applied to Few-Shot Relation Extraction

结构化语义信息有助于为上下文学习检索更好的示例,应用于少样本关系抽取

Aunabil Chakma, Mihai Surdeanu, Eduardo Blanco

机构 * University of Arizona(亚利桑那大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出基于句法-语义结构相似性的示例选择策略,结合大语言模型生成示例,构建混合系统提升少样本关系抽取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00088 2026-06-02 cs.CR cs.CY 67%

From Frontier to Shadow AI: A Simmering Threat to Assurance and Security in Critical Infrastructure

从前沿AI到影子AI:对关键基础设施保障与安全的潜伏威胁

Mohan Baruwal Chhetri, Shahroz Tariq, Tooba Aamir, Marthie Grobler, Chandra Thapa, Ronal Singh

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本研究通过访谈澳大利亚27家关键基础设施组织的高管,首次实证分析了影子AI在关键基础设施中的表现、风险及安全退化机制,提出了边界绕过、未评估能力扩展和治理规避三种威胁模型。

Comments 21 pages, 2 figures, 2 tables, paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04672 2026-06-02 cs.CV cs.GR cs.RO 67%

AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation

AGILE: 通过代理生成从视频重建手-物体交互

Jin-Chuan Shi, Binhong Ye, Tao Liu, Junzhe He, Yangjinhui Xu, Xiaoyang Liu, Zeju Li, Hao Chen, Chunhua Shen

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学)

专题命中 其他LLM :language model(abstract);foundation model(abstract)

AI总结 提出AGILE框架,利用视觉语言模型引导生成完整物体网格,结合锚定-跟踪策略和接触感知优化,从单目视频鲁棒重建手-物体交互,生成可直接用于仿真的资产。

Comments 16 pages, SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00050 2026-06-02 cs.AI cs.CL cs.DB cs.IR 62%

Grokers: Bottom-Up Inductive Comprehension and Write-Time Intelligence over Typed Knowledge Graphs

Grokers: 基于类型化知识图谱的自底向上归纳理解与写入时智能

Gregory Magarshak

机构 * Gregory Magarshak

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Grokers架构,通过自底向上的依赖子图归纳遍历构建持久结构化理解,将智能推至写入时,实现零额外LM成本的查询,并证明字节同一性、累积单调性和双遍历顺序三个形式性质。

Comments 6 pages; second in a series with the Magarshak Machine / SPACER paper and the Context paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01964 2026-06-02 cs.CL 57%

Eyettention II: A Dual-Sequence Architecture for Modeling Fixation Location, Within-Word Landing Position, and Fixation Duration in Reading

Eyettention II: 一种用于建模阅读中注视位置、词内着陆位置和注视持续时间的双序列架构

Shuwen Deng, Cui Ding, David R. Reich, Paul Prasse, Lena A. Jäger

机构 * Department of Computer Science, University of Potsdam(波恩大学计算机科学系) Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系) Department of Informatics, University of Zurich(苏黎世大学信息学系)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 提出端到端训练的轻量级深度学习模型Eyettention II,通过双序列架构生成包含注视位置、词内着陆位置和注视持续时间的完整扫描路径,在预测性能上超越现有模型并捕捉关键心理语言学现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01557 2026-06-02 cs.LG eess.SP 57%

Everywhere Learning: Artificial Intelligence with Pointwise Constraints

处处学习:具有逐点约束的人工智能

Ignacio Boero, Ignacio Hounie, Luiz Chamon, Alejandro Ribeiro

机构 * Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系) École polytechnique, Institut Polytechnique de Paris(巴黎理工学院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 提出“处处学习”新范式,通过近似对偶理论分析泛化性能,并用稀疏L1惩罚控制泛化,在语言模型任务中验证其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29488 2026-06-02 cs.LG 57%

What Cosine Similarity of Label Representations Can and Cannot Tell us

标签表示的余弦相似度能告诉我们什么,不能告诉我们什么

Beatrix M. G. Nielsen, Andreas Grivas

机构 * IT University of Copenhagen(丹麦哥本哈根技术大学) School of Mathematics, University of Edinburgh(爱丁堡大学数学学院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 本文证明对于softmax分类器,标签表示(称为unembedding)之间的余弦相似度不提供模型概率的任何信息,而对于sigmoid分类器,所有成对余弦相似度定义了可能的标签组合集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09456 2026-06-02 cs.CV cs.CL cs.CR 57%

IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

IAG: 基于输入感知的后门攻击针对VLM视觉定位

Junxian Li, Beining Xu, Simin Chen, Jiatong Li, Jingdi Lei, Haodong Zhao, Di Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 提出IAG方法,通过文本条件UNet动态生成输入感知的触发器,实现首个多目标后门攻击VLM视觉定位,在多个模型和基准上达到最佳攻击成功率且不影响正常性能。

Comments Accepted by CVPR 2026; Code is at https://github.com/lijunxian111/IAG

Journal ref https://openaccess.thecvf.com/content/CVPR2026/papers/Li_IAG_Input-aware_Backdoor_Attack_on_VLM-based_Visual_Grounding_CVPR_2026_paper.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01275 2026-06-02 cs.GT 50%

Domination-Avoiding Learning Agents Cannot Collude

避免支配的学习代理无法合谋

Noam Nisan, Emmanuel Zerah

专题命中 其他LLM :LLM(abstract_cn)

AI总结 本文证明避免支配的代理(包括基于均值和内部遗憾最小化代理)在市场中不会合谋,并保证几乎从不玩被重复消除纯支配策略消除的策略。

Comments 27 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00418 2026-06-02 cs.RO cs.HC 50%

Literary Emotions in Motion: A Soft Robotics Installation for Tactile Storytelling

文学情感在运动中:用于触觉叙事的软体机器人装置

Carolina Silva-Plata, Abraham Villavicencio-Carmona, Miguel Silva Plata, Stefan Escaida, Ruben Fernandez

机构 * Department of Mechanical Engineering, University of Chile(智利大学机械工程系) Independent Researcher(独立研究员) Bolivian Catholic University(玻利维亚天主大学) Institute of Engineering Sciences, University of O’Higgins(奥希金斯大学工程科学研究所)

专题命中 其他LLM :language model(abstract)

AI总结 提出一种将叙事文本语义情感分析映射到软体气动模块可变刚度的交互装置,通过用户研究评估刚度与LED强度多感官耦合对情感感知的影响。

Comments 8 pages, 8 figures

Journal ref IEEE Robotics and Automation Magazine, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01728 2026-06-02 cs.CE 50%

Aligning Shared and Routed Experts for Cross-Subject EEG Generalization

对齐共享专家和路由专家以实现跨被试脑电图泛化

Zhi Zhang, Yan Liu, Zhejing Hu, Gong Chen, Sheng-hua Zhong, Changhong Jing, Shuqiang Wang, Jibin Wu, KC Tan, Jiannong Cao

专题命中 其他LLM :foundation model(abstract)

AI总结 提出共享-路由专家对齐(SREA)框架,通过联合嵌入、原型稀疏路由和互导重加权,协同共享专家与路由专家,解决跨被试EEG泛化中个体差异与可迁移结构的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏