arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12266 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12266 篇

2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 70%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20065 2026-06-19 cs.IR cs.CL cs.CY 新提交 70%

Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines

生成式引擎优化规模化:衡量AI搜索引擎中的品牌可见性

Pratyush Kumar

机构 * Ranqo

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过分析10万+提示响应,提出衡量AI搜索引擎中品牌可见性的方法,发现品牌成熟度形成三级阶梯,并识别出最受引用的内容格式和情感不稳定性。

Comments 14 pages, 4 tables; v1.0 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19698 2026-06-19 cs.CL 新提交 70%

What sentiment analysis can't see: Measuring whether customers were helped, and what went wrong, across 70,000 support conversations

情感分析看不到的:衡量客户是否得到帮助以及出了什么问题——基于70,000次客服对话

Jason Potteiger

机构 * Dimension Labs(Dimension实验室)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究使用GPT-5.4从70,450次客服对话中估计客户满意度并标记具体问题,发现满意度估计比情感分析更准确,且能揭示情感分析无法捕捉的客户状态和问题原因。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19630 2026-06-19 cs.AI cs.DL cs.SY eess.SY 新提交 70%

AI4SE and SE4AI Exploration: A Decade Looking Back and Forward

AI4SE 与 SE4AI 探索:回顾与展望的十年

H. Sinan Bank, Daniel R. Herber, Thomas Bradley

机构 * Colorado State University(科罗拉多州立大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文回顾了人工智能与系统工程在三个阶段的进展,通过人机一致性文献综述识别出五个关键研究空白,并提供了AI采纳、保障和劳动力转型的指导。

Comments 10 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15531 2026-06-17 cs.LG cs.CR 新提交 70%

Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance

贪婪坐标扩散:通过扩散引导实现有效且语义一致的对抗攻击

Bohdan Turbal, Blossom Metevier, Max Springer, Aleksandra Korolova

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出贪婪坐标扩散方法,利用扩散模型引导生成语义连贯的对抗样本,在保持自然性的同时实现高攻击成功率。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09465 2026-06-16 stat.ML cs.LG 版本更新 70%

Branching Flows: Discrete, Continuous, and Manifold Flow Matching with Splits and Deletions

分支流:带有分裂和删除的离散、连续和流形流匹配

Lukas Billera, Hedwig Nora Nordlinder, Jack Collier Ryder, Anton Oresten, Aron Stålmarck, Theodor Mosetti Björk, Ben Murrell

机构 * Department of Microbiology, Tumor and Cell Biology, Karolinska Institutet(卡罗林斯卡研究所微生物学、肿瘤和细胞生物学系)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出分支流框架,通过随机分支和死亡过程控制序列元素数量,适用于变长数据生成,并在小分子、抗体序列和蛋白质骨架生成中验证效果。

Comments 39 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06855 2026-06-16 math.OC cs.LG 版本更新 70%

Design and Scheduling of an AI-based Queueing System

基于AI的排队系统的设计与调度

Jiung Lee, Hongseok Namkoong, Yibo Zeng

机构 * Columbia University(哥伦比亚大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对预测模型在服务系统中与人类服务器交互的场景,研究预测误差对拥塞成本的影响,提出一种基于索引的策略,在重流量下近最优地利用预测类别信息,并指导预测模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13991 2026-06-15 cs.CL 新提交 70%

Fusing Stylometric and Embedding Systems to Estimate Authorship Likelihood Ratios in Japanese

融合文体特征与嵌入系统以估计日语作者身份似然比

Praju Ghatpande, Satoru Tsuge, Shunichi Ishihara, Wataru Zaitsu, Mitsuyuki Inaba

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 首次将似然比框架应用于日语数字文本,通过融合文体特征系统与基于嵌入的系统,提高了似然比量值和判别能力,最佳融合的log-likelihood-ratio成本为0.32484。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14560 2026-06-15 math.OC cs.LG stat.ML 新提交 70%

Free Heavy-Tailed Lunch for Muon: A Theoretical Justification of Empirical Success

Muon 的免费重尾午餐:实证成功的理论证明

Florian Hübler, Thomas Pethick, Suvrit Sra

机构 * Department of Computer Science, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机科学系) Department of Mathematics, Technical University of Munich, Germany(慕尼黑技术大学数学系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文在重尾非凸优化中证明,Muon 等非欧几里得方法在核范数平稳性下达到最优样本复杂度,避免了欧几里得方法的维度依赖,并通过大语言模型实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21363 2026-06-15 cs.CL 版本更新 70%

"I Didn't Make the Micro Decisions": Measuring, Inducing, and Exposing Goal-Level AI Contributions in Collaboration

我没有做出微决策:在协作中测量、诱导和暴露目标级AI贡献

Eunsu Kim, Jessica R. Mindel, Kyungjin Kim, Sherry Tongshuang Wu

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) Seoul National University(首尔国立大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CoTrace框架,用于测量和暴露协作中目标级AI贡献,发现模型在目标塑造中贡献有限,但在引入具体要求和间接影响方面作用显著,且交互设计影响模型行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13256 2026-06-12 cs.RO cs.AI 新提交 70%

Humor Style Drives Laughter, Topic Shapes Acceptability: Evaluating Bilingual Personal and Political Robot-Delivered AI Jokes

幽默风格驱动笑声,话题塑造可接受性:评估双语个人与政治机器人交付的AI笑话

Anna-Maria Velentza, Anne-Gwenn Bosser

机构 * Univ Brest-Bretagne INP, COMMEDIA team, Lab-STICC CNRS UMR 6285(布列塔尼大学-INP,COMMEDIA团队,Lab-STICC CNRS UMR 6285)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过混合因素设计,评估机器人用双语讲AI生成笑话时,幽默类型(亲和、自我增强、攻击、自贬)和内容(个人vs政治)对趣味性和适当性的影响,发现幽默类型显著影响趣味性,内容影响适当性,语言偏好受内容及参与者流利度影响。

Comments Accepted in the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026), Kitakyushu, Fukuoka, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10302 2026-06-10 cs.CL 新提交 70%

Where You Inject Diversity Matters: A Unified Framework for Diverse Generation

注入多样性的位置至关重要:统一框架下的多样化生成

Cheng Zhang, Rui Xin, Chudi Zhong

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Washington(华盛顿大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出统一框架,通过多样性源和传输分数衡量测试时多样化生成方法,并基于此提出全自动规范级方法,在五个开放任务中提升输出多样性且保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05013 2026-06-10 cs.SE cs.AI 70%

Scaling Coding Agents via Atomic Skills

通过原子技能扩大编码代理

Yue Liu

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出通过原子技能提升编码代理的新型方法,通过联合强化学习提升五个基础技能,从而提高复杂软件任务的泛化能力。

Comments We request standard withdrawal of this submission because significant errors were discovered in the data after submission, which affect the validity of the results. We may submit a corrected version later

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09301 2026-06-09 cs.LG 新提交 70%

PRISM: Topology-Aware Cross-Modal Imputation for Modality-Deficient Federated Graph Learning

PRISM: 面向模态缺失联邦图学习的拓扑感知跨模态插补

Zekai Chen, Miao Zhang, Jiayang Xing, Xunkai Li, Xun Wu, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 其他LLM :prompting(abstract,abstract_cn);分类 cs.LG

AI总结 针对联邦图学习中客户端级模态缺失问题,提出拓扑感知跨模态插补框架PRISM,通过联邦检索缺失模态语义并利用拓扑控制注入局部图传播,在六个多模态图数据集上平均提升4.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09024 2026-06-09 cs.IR cs.CL cs.HC cs.SI 新提交 70%

Personal Salience: Highlighting Is Social, but Individuality Lives in Selection

个人显著性:高亮是社交性的,但个性存在于选择中

Kazuki Nakayashiki, Keisuke Watanabe

机构 * Glasp Inc.(Glasp公司)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过共同阅读身份控制实验,发现高亮行为主要受群体影响(群体模型预测显著优于个人模型),但个人历史在选择已显著段落时表现出强预测力(差距+0.14),揭示个性更多体现在选择而非显著性上。

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17855 2026-06-09 cs.AI cs.RO 版本更新 70%

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents

QuickLAP: 为半自主代理快速语言-动作偏好学习

Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16551 2026-06-09 cs.CL 版本更新 70%

PQR: A Framework to Generate Diverse and Realistic User Queries that Elicit QA Agent Failures

PQR:一个生成多样化且逼真用户查询的框架,以引发问答代理失败

Yunan Lu, Luigi Liu, Omar Yahia, Arpit Sharma, Zhou Yu

机构 * Columbia University(哥伦比亚大学) University of California San Diego(加州大学圣地亚哥分校) Walmart(沃尔玛)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 PQR框架通过迭代交互生成多样化且逼真的用户查询,以发现问答代理的失败案例,其方法比现有方法更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18388 2026-06-09 cs.AI cs.MA 版本更新 70%

Reflection in the Dark: Exposing and Escaping the Black Box in Reflective Prompt Optimization

暗箱中的反射:在反射提示优化中揭示并逃离黑箱

Shiyan Liu, Qifeng Xia, Qiyun Xia, Yisheng Liu, Xinyu Yu, Rui Qu

机构 * University of California, Berkeley(加州大学伯克利分校) Huazhong University of Science and Technology(华中科技大学) Hefei University of Technology(合肥工业大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出VISTA框架,通过解耦假设生成与提示重写,实现可解释的提示优化,有效解决GEPA在缺陷种子下的性能下降问题。

Comments Accepted at ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05847 2026-06-05 cs.AI 70%

Agentic Molecular Recovery via Molecule-Aware Exploration

通过分子感知探索实现智能体分子恢复

Suwan Yoon, Changhee Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对文本引导分子生成中无效SMILES问题,提出AMREC方法,通过分子感知失配追踪、扩展候选探索和轨迹级选择,在恢复化学有效性的同时保留目标相关结构线索和分子身份。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03173 2026-06-03 cs.CY cs.LG cs.SI 70%

Auditing Engagement Incentives in the Kidfluencer Ecosystem: A Multimodal Weak Supervision Approach

审计儿童网红生态系统中的参与激励:一种多模态弱监督方法

Zijing Wei, Chao Peter Yang, Xuanjie Chen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究采用多模态弱监督方法审计YouTube儿童网红频道,发现剥削信号与观看量显著正相关,且表演性劳动、情感诱饵和隐私侵犯能带来参与度溢价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30166 2026-06-03 cs.SI cs.LG 70%

SAHG: Sector-Anisotropic Hyperbolic Graph Model for Social Bot Detection

SAHG:用于社交机器人检测的扇区各向异性双曲图模型

Hanning Lu, Yingguang Yang, Jinwei Su, Yang Liu, Zhaoqian Yao, Yaoming Li, Taoran Liang, Ziyi Zhang, Ran Ran, Kefu Xu, Bin Chong

机构 * University of Leeds(利兹大学) University of Science and Technology of China(中国科学技术大学) South China Normal University(华南师范大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Harbin University of Commerce(哈尔滨商业大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出扇区各向异性双曲图模型SAHG,通过方向依赖曲率场和扇区原型解决欧几里得GNN在层次无标度社交图中的失真问题以及异质连接导致的信号污染问题,在三个基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02328 2026-06-02 cs.LG 70%

Riemannian Gradient Descent for Low-Rank Architectures

低秩架构的黎曼梯度下降

Nicholas Knight

专题命中 其他LLM :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 针对低秩矩阵参数,探索黎曼优化技术,并在小语言模型的多头注意力参数上应用,但未显著优于AdamW基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01672 2026-06-02 cs.LG 70%

RDA: Reward Design Agent for Reinforcement Learning

RDA:用于强化学习的奖励设计智能体

Hojoon Lee, Ajay Subramanian, Ben Abbatematteo, Vijay Veerabadran, Pedro Matias, Karl Ridgeway, Nitin Kamra

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度Mind)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出基于视觉语言模型的奖励设计智能体RDA,通过任务分解、视觉轨迹评估和失败模式总结迭代优化奖励函数,在操作任务中生成更符合指令的策略。

Comments Accepted to RLC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01246 2026-06-02 cs.AI 70%

SIRIUS-SQL: Anchoring Multi-Candidate Text-to-SQL in Execution Feedback

SIRIUS-SQL: 在执行反馈中锚定多候选文本到SQL

Leo Luo, Haining Xie, Siqi Shen, Zhipeng Ma, Rui Ling, Hang Xu, Hefeng Jiang, Dingwei Chen, Yang Li, Peng Chen, Jie Jiang

机构 * TEG, Tencent Inc., China(腾讯科技(TEG),腾讯公司,中国) Peking University, China(北京大学,中国)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出SIRIUS-SQL系统,通过难度平滑强化学习、执行生命周期分类和置信门控混合选择器,解决多候选SQL生成中的冗余、修复和选择问题,在BIRD dev和SPIDER test上达到75.88%和91.20%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00402 2026-06-02 stat.ME cs.AI stat.AP 70%

A Distribution-Free Framework for Rewrite-Based Human-text Detection via Knockoff Filtering

基于重写的人类文本检测的无分布框架:通过Knockoff过滤

Yi Liu

机构 * Prorata.ai

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种无分布统计框架,将任意基于重写的检测器转化为具有有限样本FDR保证的检测器,无需重新训练,通过将重写检测视为具有knockoff结构的多重假设检验问题实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00278 2026-06-02 cs.AI 70%

Evaluating Bivariate Causal Statements Based on Mutual Compatibility

基于相互兼容性评估双变量因果陈述

Erik Jahn, Dominik Janzing

机构 * California Institute of Technology, USA(加州理工学院,美国)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对一组变量上的双变量因果陈述,提出基于兼容性分数的评估方法,通过量化因果模型引入的额外混杂程度或全局一致性约束来区分正确与错误的因果陈述,并应用于大语言模型生成的因果主张。

Comments accepted for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20803 2026-06-02 cs.CL 70%

Structured Semantic Information Helps Retrieve Better Examples for In-Context Learning Applied to Few-Shot Relation Extraction

结构化语义信息有助于为上下文学习检索更好的示例,应用于少样本关系抽取

Aunabil Chakma, Mihai Surdeanu, Eduardo Blanco

机构 * University of Arizona(亚利桑那大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出基于句法-语义结构相似性的示例选择策略,结合大语言模型生成示例,构建混合系统提升少样本关系抽取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30615 2026-06-01 cs.LG 70%

Improving Selective Classification with Pairwise Queries for Binary Classification

通过成对查询改进二分类的选择性分类

Harsh Vardhan, Sunav Choudhary, Natwar Modani, Arya Mazumdar

机构 * Adobe Research(Adobe研究院)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对选择性分类中模型置信度与预测不一致导致高错误率的问题,提出使用成对查询检测高错误样本,以降低非拒绝样本的错误率,并通过理论和实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17306 2026-06-01 cs.CL q-bio.NC 70%

Evidence for systematic semantic structure in individual phonemes

单个音素中系统性语义结构的证据

Gexin Zhao

机构 * Columbia University(哥伦比亚大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过大型语言模型、跨语言听者实验和发音特征分析,证明英语单个音素携带结构化的多维语义轮廓,挑战了音义关系任意性的传统假设。

Comments 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29971 2026-05-29 cs.CL 70%

Causal Interventions on Continuous Variables: A Case Study on Verb Bias in Steering Vectors for In-Context Learning

连续变量的因果干预:以上下文学习中转向向量的动词偏向为例

Zhenghao Herbert Zhou, R. Thomas McCoy, Robert Frank

机构 * Yale University(耶鲁大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种对连续变量进行因果干预的方法,通过定位低维方向并编辑向量实现反事实目标值,应用于动词偏向特征,证明其在语言模型中的因果表示,并探讨与上下文学习的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏