arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12321 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12321 篇

2608.15475 2026-08-18 cs.CR cs.AI 新提交 57%

Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability

针对视觉-语言-动作模型的位翻转攻击:动作解码架构决定漏洞

Yudong Gao, Linghan Chen, Wenhan Wu, Mia Zhou, Jiyao Wang, Kaiyan Ji, Mingyu Guo, Honglong Chen

专题命中 其他LLM :foundation model(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言-动作模型提出位翻转攻击,发现动作解码架构决定漏洞,少量梯度选择的位翻转可大幅降低闭环成功率,权重完整性是具身基础模型的安全边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17678 2026-08-18 cs.CV cs.AI 版本更新 57%

TIMA: Text-Image Mutual Awareness for Balancing Zero-Shot Adversarial Robustness and Generalization Ability

TIMA:用于平衡零样本对抗鲁棒性与泛化能力的文本-图像互感知框架

Fengji Ma, Hei Victor Cheng, Chenxing Li, Li Liu

专题命中 其他LLM :foundation model(abstract);分类 cs.AI

AI总结 本研究针对CLIP等基础模型在零样本场景下难平衡对抗鲁棒性与泛化能力的问题,提出TIMA框架,通过TAI与IAT两个模块校准Logit间距、保留语义一致性,实验显示其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13605 2026-08-17 cs.AI cs.RO 新提交 57%

Active Perception for Embodied Disambiguation

用于具身消歧的主动感知

Yiwei Liu, Luwei Yang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 该研究针对具身环境中目标歧义问题,提出以主动观测为核心的主动感知框架,结合视觉语言模型实现信息获取与用户意图澄清,经真实机器人实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11629 2026-08-17 cs.CR cs.LG 版本更新 57%

Semantic Differentiation for Tackling Challenges in Watermarking Low-Entropy Constrained Generation Outputs

语义分化用于解决水印标记低熵约束生成输出的挑战

Nghia T. Le, Alan Ritter, Kartik Goyal

机构 * School of Interactive Computing(交互计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 SeqMark通过语义分化解决低熵约束生成任务中水印标记的挑战,提升检测准确率并保持生成质量。

Comments 23 pages, 5 figures, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13433 2026-08-14 cs.FL cs.AI 新提交 57%

Algebraic Decomposition Theory for Transformer Length Generalization

Transformer长度泛化的代数分解理论

Andy Yang, Blerta Veseli, Corentin Barloy, Michaël Cadilhac, Andreas Krebs, Charles Paperman, Howard Straubing, Michael Hahn

机构 * DePaul University(德保罗大学) University of Tübingen(蒂宾根大学) University of Lille(里尔大学) Boston College(波士顿学院) University of Notre Dame(圣母大学) Saarland University(萨尔大学) Ruhr University Bochum(波鸿鲁尔大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 本文针对Transformer的长度泛化问题,建立了正则语言上长度泛化的完整代数刻画,提出多项式时间决策算法,实验验证其能更准确捕捉Transformer的长度泛化行为。

Comments 54 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11424 2026-08-13 cs.LG cs.CV 新提交 57%

Click2Poly: A VLM for vector mapping buildings and walls

Click2Poly:用于建筑物和墙壁矢量绘制的VLM

Nicolas Girard, Jawher Ben Abdallah, Arno Gobbin, Liuyun Duan, Sacha Lepretre

机构 * LuxCarta

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 该研究提出基于Florence-2 VLM的人在环AI助手Click2Poly,以QGIS插件形式实现,可响应用户点击编辑矢量层,加快建筑物和墙壁矢量绘制的手动编辑流程。

Journal ref IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12271 2026-08-13 cs.LG physics.ao-ph 新提交 57%

Earth observation embeddings are effective sub-grid descriptors for probabilistic weather downscaling

地球观测嵌入是概率性天气降尺度的有效亚网格描述符

Pedro Sousa, Will Tebbutt, Sadiq Jaffer, Robin Young, Anil Madhavapeddy, Richard E. Turner

机构 * University of Cambridge(剑桥大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.LG

AI总结 该研究提出用TESSERA嵌入增强卷积条件神经过程,用于概率性天气降尺度,在五个气候区提升了2米温度和10米风速的降尺度技能,且对不同变量和新站点均有效。

Comments 39 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01985 2026-08-13 cs.GT cs.AI 版本更新 57%

Proportional Committee Elections with Positive and Negative Votes

带有赞成票与反对票的比例代表委员会选举

Sonja Kraiczy, Georgios Papasotiropoulos, Grzegorz Pierczyński, Piotr Skowron

机构 * University of Oxford(牛津大学) University of Warsaw(华沙大学) AGH University of Science and Technology(AGH科技大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI

AI总结 本研究针对允许投反对票的委员会选举场景,提出两种反对票解释及对应比例性公理,检验Phragmén规则、PAV、MES变体的公理满足情况,拓展了比例代表制的适用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02078 2026-08-11 cs.CL cs.CV 版本更新 57%

CAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal Grounding

CAVE:面向视频时序定位的能力感知视觉边界证据对齐

Wei Jia, Zhicong Lu, Yu Chen, Xiang Wang, Shuai Li, Wenqian Lv, Jiayue Cao, Huaxing Liu

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 针对视频时序定位中视觉证据与时间戳错位的问题,提出CAVE方法,通过边界证据奖励、轻量级热身及性能感知门控,在公开基准上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01043 2026-08-11 cs.CR cs.AI 版本更新 57%

Decoy Images Amplify Caption-Mediated Defenses Against Encoded Jailbreaks

诱饵图像增强针对编码越狱的字幕介导防御

Haoyu Zhang, Xiangchen Guan, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 该研究发现附加诱饵图像可降低VLMs的编码越狱攻击成功率,通过编码输入检测器门控附加诱饵,可在保留安全增益的同时控制良性弃权率,该效应在多模型、多场景下可复现。

Comments There is bug in algorithm implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06968 2026-08-10 physics.soc-ph cs.AI cs.CY 新提交 57%

Same physical state, different collective dynamics: state encodings select synchronization outcomes in language-model agents

相同物理状态,不同集体动力学:状态编码选择语言模型智能体的同步结果

Takahiro Ezaki, Naoto Imura, Katsuhiro Nishinari

机构 * Research Center for Advanced Science and Technology, The University of Tokyo(东京大学先进科学技术研究中心) School of Engineering, The University of Tokyo(东京大学工学院)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 该研究通过循环同步实验发现,状态编码(低阶循环矩vs直方图)会影响语言模型智能体的同步结果,且效应因模型而异,状态编码是依赖模型的有效交互法则的组成部分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05675 2026-08-10 cs.LG 版本更新 57%

Consistency Has a Computable Blind Spot: A Commutation Theory of Label-Free Reliability for Vision-Language Figure Reading

一致性存在可计算的盲区:视觉-语言图表阅读的无标签可靠性交换理论

Rasul Khanbayov, Hasan Kurban

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 该研究提出视觉-语言图表阅读的无标签可靠性交换理论,构建无标签、无需训练的检测器,发布REND-EQUIV数据集,揭示一致性盲区可计算,循环重标记可提升性能,解释排序反转现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03902 2026-08-10 cs.LG 57%

A phase transition between positional and semantic learning in a solvable model of dot-product attention

Hugo Cui, Freya Behrens, Florent Krzakala, Lenka Zdeborová

机构 * EPFL(洛桑联邦理工学院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

Journal ref Advances in Neural Information Processing Systems 37 (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06154 2026-08-07 cs.RO cs.AI cs.CV 新提交 57%

Visual Grounding in Zero-Shot Vision-Language Control

零样本视觉语言控制中的视觉 grounding

J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 本文针对零样本视觉语言控制中VLMs决策是否基于视觉输入的问题,通过多组消融实验分析了多种VLMs的表现,提出对称共识守护者方法,验证了VLMs可作为有界的危险助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05172 2026-08-07 cs.CY cs.AI 新提交 57%

Estimating time spent on work tasks

估算工作任务所花费的时间

Stephane Hatgis-Kessell, Tomás Aguirre, Alexander Wan, Rishi Bommasani

机构 * University of Pittsburgh(匹兹堡大学) Stanford University(斯坦福大学) University of São Paulo(圣保罗大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 本研究提出一种原则性方法估算美国近18000项任务的时间份额,用于分析AI对美国职业的影响,发现时间权重会改变AI暴露度的测量结果,可作为劳动经济研究的通用基础要素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04299 2026-08-06 cs.CL 新提交 57%

Searching for Sound-Meaning Collisions: Graph-Based Affordance Retrieval and Multi-Evaluator Ranking for Pun Translation at CLEF 2026 JOKER Task 2

寻找音义碰撞:CLEF 2026 JOKER任务2中基于图的可供性检索与多评估者排名的双关语翻译

Russell Taylor, Adam Brikman, Prateek Awate

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 该研究针对CLEF 2026 JOKER任务2,提出基于图的可供性检索与多评估者排名的双关语翻译方法,证实检索音义可供性是计算双关语翻译的核心瓶颈,结果契合Low的设想。

Comments CLEF 2026 Working Notes, 21-24 September 2026, Jena, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15395 2026-08-06 cs.AI 版本更新 57%

Corrigibility Transformation: Constructing Goals That Accept Updates

可修正性转换:构建接受更新的目标

Rubi Hudson

机构 * University of Toronto(多伦多大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 该研究提出一种可修正性转换方法,可在不牺牲性能的情况下将几乎任何目标转换为可修正版本,能诱导AI产生可修正行为,为AI安全提供了关键的可修正目标方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03270 2026-08-05 cs.CV cs.AI 新提交 57%

GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs

GUI-Lens:面向通用视觉语言模型(VLM)的GUI定位粗到精裁剪框架

Zichuan Fu, Shirong Wang, Wenlin Zhang, Guojing Li, Yimin Deng, Jingtong Gao, Junjia Qi, Hanyu Yan, Yefeng Zheng, Xiaopeng Li, Wanyu Wang, Xian Wu, Xiangyu Zhao

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 GUI-Lens是面向通用VLM的GUI定位粗到精裁剪框架,通过主动视觉观察逐步聚焦确定目标,在四个基准和三个VLM后端上使定位准确率最高提升24.9个百分点,在GPT-5.5上达SOTA性能。

Comments Preprint. Code: https://github.com/Fzkuji/GUI-Agent-Harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03210 2026-08-05 cs.CL 新提交 57%

ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization

ICO:通过迭代上下文优化增强语义偏移越狱攻击

Hujian Zhu, Yihao Huang, Felix Juefei-Xu, Xinfeng Li, Peng Zeng, Simeng Qin, Qing Guo, Geguang Pu

专题命中 其他LLM :foundation model(abstract);分类 cs.CL

AI总结 本研究针对现有语义偏移越狱攻击有效性有限的问题,提出带迭代上下文优化(ICO)的黑盒上下文感知框架,经多数据集与多模型实验,其攻击效果优于现有基线,平均成功率达74.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03050 2026-08-05 cs.SD cs.AI cs.MM eess.AS 新提交 57%

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

通过跨模态自举学习音乐风格以实现钢琴编曲

Jingwei Zhao, Gus Xia, Ziyu Wang, Ye Wang

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 本文提出跨模态框架,受BLIP-2启发用Q-Former从预训练音频LM提取风格表示,经两阶段训练实现可控风格钢琴编曲,在多项任务中提升了风格对齐与音乐质量。

Comments Accepted by ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02935 2026-08-05 cs.CL 新提交 57%

Character Iconicity vs. Arbitrariness: An Arabic NLP Perspective

字符象似性与任意性:阿拉伯语自然语言处理视角

Dorieh Alomari, Irfan Ahmad, Maged S. Al-shaibani

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 本研究从NLP视角探究阿拉伯语字符形式-功能关系,对比加点、无点及随机重映射的阿拉伯语,发现随机重映射可在降本减存的同时保持良好性能,表明阿拉伯语字符形式-功能关系具任意性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01793 2026-08-04 cs.LG 新提交 57%

ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection

ReFP-AD:用于基于能量的异常检测的整流流预处理

Camile Lendering, Erkut Akdag, Joaquín Figueira, Egor Bondarev

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.LG

AI总结 该研究针对统一异常检测中高维token空间EBM训练不稳定问题,提出ReFP-AD方法,经实验在MVTec-AD和VisA数据集上取得优于基线的异常检测性能。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01414 2026-08-04 cs.AI cs.CR 新提交 57%

No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks

无单一失效神经元:针对白盒攻击的分布式安全对齐

Simiao Xie, Chuancheng Shi, Shangze Li, Wenhua Wu, Fei Shen, Ying Zhou, Zhiyong Wang, Tat-Seng Chua

机构 * The University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI

AI总结 针对现有安全对齐方法的单点失效问题,提出分布式安全对齐(DSA),通过冗余编码安全能力提升模型对抗白盒神经元级攻击的鲁棒性,且保留通用语言与多模态效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01238 2026-08-04 cs.CL cs.MM 新提交 57%

Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

评估视觉语言模型(VLMs)在亚里士多德式多模态说服任务上的表现

Khondoker Ittehadul Islam

机构 * Saarland University(萨尔大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 该研究采用ImageArg数据集评估VLMs在亚里士多德式多模态说服任务的表现,发现Qwen系列模型在相关检测任务上性能提升并发布代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00284 2026-08-04 cs.RO cs.AI 新提交 57%

Hybrid Attention Estimation Pipeline for Adaptive HRI Using an Expressive Robotic Head

基于富有表现力的机器人头部的自适应人机交互混合注意力估计流程

Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

机构 * Technological University of Uruguay(乌拉圭科技大学) Ostfalia University of Applied Sciences(奥斯特法利亚应用科技大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 该研究提出结合几何与语义感知层的混合注意力估计流程,通过有限状态机调节自适应人机交互,经10人40次试验验证其交互启动可靠、暂停行为一致且输出信息非冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00247 2026-08-04 cs.SD cs.AI 版本更新 57%

Adaptive Perturbation Selection for Contrastive Audio Decoding

对比音频解码的自适应扰动选择

Aaron Isidore Grace, Zhouyuan Huo, Weiran Wang

机构 * Google(谷歌) University of Iowa(爱荷华大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 针对大型音频语言模型幻觉问题,提出自适应选择最优音频扰动作为对比解码负分支的方法,在时序、存在性等任务上提升准确率。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29585 2026-08-03 cs.CL 新提交 57%

Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks

谄媚行为破坏合作型视觉-语言任务中的认知警觉性

Rupak Sarkar, Neha Srikanth, Saloni Gupta, Claire Bonial, Philip Resnik, Rachel Rudinger

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 该研究针对合作型视觉-语言任务,提出信息不对称的“找不同”任务,发现模型存在谄媚行为破坏认知警觉性的问题,通过学习向量调整模型可减少此类错误,提升模型可靠性。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07267 2026-08-03 cs.CY cs.CL physics.soc-ph 版本更新 57%

Billions of Sketches Reveal Hidden Cultural Variation in Human Concepts

数十亿草图揭示人类概念中隐藏的文化差异

Arianna Pera, Mauro Martino, Nima Dehmamy, Douglas Guilbeault, Luca Maria Aiello, Andrea Baronchelli

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 研究通过分析236个国家和地区的26亿张手绘草图,探讨人类概念结构。发现单一概念有多种视觉范例,跨文化差异在触觉概念中最强。比较草图与词嵌入模型,发现视觉表征保留更多语义文化结构,基于草图的跨文化相似性与文化距离契合度更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04463 2026-08-03 cs.LG 57%

GFocal: A Global-Focal Neural Operator for Solving PDEs on Arbitrary Geometries

Fangzhi Fei, Jiaxin Hu, Qiaofeng Li, Zhenyu Liu

机构 * Fangzhi Fei 1(某机构) Jiaxin Hu 1(某机构) Qiaofeng Li 1,2,*(某机构) Zhenyu Liu 1,3,*(某机构)

专题命中 其他LLM :language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18866 2026-07-31 econ.EM cs.LG stat.ML 版本更新 57%

Optimizing Regret

优化遗憾值

Irene Aldridge

专题命中 其他LLM :LLM(abstract);分类 cs.LG

AI总结 本文基于成本与决策协方差发展协方差遗憾泛函导数理论,推导线性策略梯度,扩展到约束优化等,得出通用最速下降方向,还给出收敛界及算法,应用于投资组合倾斜与大语言模型分配策略。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏