arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12287 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12287 篇

2608.02345 2026-08-17 cs.CL cs.AI stat.AP 版本更新 62%

Can AI Agents Simulate A/B Test Outcomes? A Validation Framework for Agentic Experimentation

AI智能体能模拟A/B测试结果吗?智能体实验的验证框架

Stefan Hut, Lorenzo Masoero

机构 * Amazon(亚马逊公司)

专题命中 其他LLM :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出智能体实验的验证框架S-RCT,用AI智能体模拟A/B测试结果,经67个营销A/B测试验证,校准后可降低预测误差,为实验者提供智能体信号支持。

Comments Accepted as a workshop paper at https://www.aiagentbehavior.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21497 2026-08-17 cs.LG cs.AI cs.DS 版本更新 62%

Breaking Chains with Trees: Model-Parallel Deep Learning with $\mathcal{O}(\log N)$ Time Complexity

用树打破链:具有 $\mathcal{O}(\log N)$ 并行时间复杂度的深度学习

Neeraj Mohan Sushma, Aditya Nagarsekar, Cabrel Teguemne Fokam, Robin Schiewer, Amit Kumar Pal, Anand Subramoney, David Kappel

机构 * Center for Cognitive Interaction Technology, Bielefeld University(比勒费尔德大学认知交互技术中心) Ruhr Universität Bochum(波鸿鲁尔大学) Birla Institute of Technology and Science, Pilani, Goa Campus(比拉理工学院皮拉尼校区果阿分校) Royal Holloway, University of London(伦敦大学皇家霍洛威学院)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出分层块局部学习(HBLL)框架,通过变分局部目标分解网络,实现 $\mathcal{O}(\log N)$ 并行训练复杂度,在视觉和语言任务上取得竞争性能。

Comments 25 pages, 7 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11822 2026-08-13 cs.CL cs.LG 新提交 62%

Located but Not Releasable: Silent Gate Inversion and Bounded Linear Release

已定位但不可释放:静默门控反转与有界线性释放

Xining Xun

机构 * Tsingjiao Information Science (Beijing) Co., Ltd.(清教信息科学(北京)有限公司)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究在2570万参数的因果证据判别Transformer模型上,测试了检测、定位与释放潜在结构的流程,发现定位成功但门控反转、线性释放有界,两种失效可分离且未推翻定位结果。

Comments 16 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10424 2026-08-12 cs.AI cs.LG 新提交 62%

Recovering Wasted Compute in Autoresearch Agents

恢复自动研究智能体中浪费的计算资源

Au Kwok Chun, Abhigyan Acherjee, Amrutha Rao, Zaiqian Chen, Kazem Meidani, C. Bayan Bruss, Micah Goldblum

机构 * Columbia University(哥伦比亚大学) Georgetown University(乔治城大学) Capital One(第一资本金融公司)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文针对自动研究智能体应用于表格数据集时的四类计算资源浪费问题,提出针对性干预措施,仅通过优化智能体设计即可大幅提升其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07555 2026-08-11 cs.CL cs.LG 版本更新 62%

Persistent Priors, Preserved Targets: A Stroop-Style Paradigm for Lexical Override

先验通过抑制持续存在:词汇覆盖的斯特鲁普范式

Han-yu Wang

机构 * The University of Hong Kong(香港大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.LG

AI总结 通过斯特鲁普范式实验,发现语言模型中的词汇先验在局部规则覆盖后仍持续存在,并通过激活修补定位到源位置三元组,揭示了先验是干扰起源和覆盖痕迹的共同通道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06631 2026-08-10 cs.LG cs.AI 新提交 62%

Cryptanalytic Extraction of Isolated Bias-Free GLU Feed-Forward Blocks by Antipodal Separation

通过对极分离的密码分析提取孤立无偏GLU前馈块

Chunhui Shi, Xinwen Fu

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对现有密码分析提取方法无法恢复现代语言模型的无偏GLU前馈块的问题,提出多阶段前向查询恢复原语,在多种模型上实现亚百分位或低误差,且明确其非端到端攻击的性质。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13491 2026-08-10 cs.LG cs.AI 版本更新 62%

DeepLoop: Depth Scaling for Looped Transformers

DeepLoop:循环变换器的深度缩放

Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang

机构 * Princeton University(普林斯顿大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究循环变换器中深度缩放问题,提出DeepLoop方法,通过控制访问对齐系数形式化绑定深度效应,保持特定架构并设置参数,在不同规模GPT风格模型上实验,结果显示稳定循环深度需考虑参数访问的残差缩放规则。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05949 2026-08-07 cs.AI cs.CV cs.LG 新提交 62%

VLMs for Videogame Data Annotation

用于视频游戏数据标注的视觉语言模型(VLMs)

Katrin Schmid, Iuri Frosio

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对VLMs在视频游戏应用受限的问题,探究其用于游戏帧序列奖励信号标注的可行性,分析其在游戏问答中的不足并提出应对措施,还研究了输入参数对标注质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00073 2026-08-06 cs.SE cs.AI cs.CL 版本更新 62%

Terminal Agents Suffice for Enterprise Automation

终端代理足以实现企业自动化

Patrice Bechard, Orlando Marquez Ayala, Emily Chen, Jordan Skelton, Sagar Davasam, Srinivas Sunkara, Vikas Yadav, Sai Rajeswar

机构 * Mila -- Quebec AI Institute(Mila — 魁北克人工智能研究所)

专题命中 其他LLM :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨终端代理通过直接调用平台API在企业自动化中表现优异,证明简单接口结合强大基础模型足以替代复杂代理架构。

Comments Pre-print. Under review. 51 pages, 6 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03507 2026-08-05 cs.CL cs.AI 新提交 62%

ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels

ChronoLens:测量跨时间、语言和语言层面的语言变化

Gagan Bhatia, Julian Schlenker, Simone Paolo Ponzetto, Steffen Eger

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 ChronoLens框架结合多语言模型等技术,分析1803-2026年五议会传统的海量文本,揭示同语言内各语言层面变化幅度相当、不同语言变化轨迹有差异,为跨语言历史语言变化研究提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01436 2026-08-04 cs.CY cs.AI cs.CL cs.HC 新提交 62%

Same violence, different answer: how AI responds to coercive control against women across languages

相同的暴力,不同的回应:人工智能如何对不同语言中针对女性的胁迫控制做出反应

Lyu Chang, Sònia Estradé Albiol, Núria Vergés Bosch

机构 * Universitat de Barcelona(巴塞罗那大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究分析7种语言模型对9种语言下女性受伴侣胁迫控制场景的回应,发现非英语开发者系统在母语中易失效,前沿系统可实现统一保护,主张为各语言设定AI保护的最低标准。

Comments 16 pages, 1 figure, 2 tables. Supplementary methods, coding manual, and data workbook included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24310 2026-08-04 cs.CL cs.LG 62%

Discovering Lexical Gaps Using Embeddings from Multilingual LLMs

利用多语言大语言模型的嵌入发现词汇空缺

Yoonwon Jung, Aaron S. Cohen, Benjamin K. Bergen

机构 * Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 提出一种数据驱动框架,通过多语言大语言模型的上下文嵌入计算语义相似度,以识别跨语言词汇空缺,在韩英和英韩方向上分别达到0.81和0.76的AUC。

Comments CoNLL 2026

Journal ref Yoonwon Jung, Aaron S. Cohen, and Ben Bergen. 2026. Discovering Lexical Gaps Using Embeddings from Multilingual LLMs. In Proceedings of the 30th Conference on Computational Natural Language Learning, pages 641-660

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09935 2026-08-04 cs.CL cs.AI 版本更新 62%

Unpacking Hateful Memes: Presupposed Context and False Claims

解析仇恨表情包:预设语境与虚假主张

Weibin Cai, Jiayu Li, Reza Zafarani

机构 * Syracuse University(Syracuse大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对仇恨表情包检测中忽略仇恨本质的问题,提出含PCM与FACT模块的SHIELD框架,实验显示其检测性能优于现有最优方法,且可用于假新闻检测等任务。

Comments Accepted to SDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21522 2026-07-24 cs.RO cs.AI cs.CL cs.CV 新提交 62%

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent:通过生成式模拟创建4D物理世界

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Genesis AI(创世纪人工智能公司)

专题命中 其他LLM :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20668 2026-07-24 cs.CL cs.AI 新提交 62%

From Agent Failures to Text Policies: What Works and What Breaks

从智能体失败到文本策略:可行与不可行之处

Jaideep Ray, Ankit Goyal

专题命中 其他LLM :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究智能体中TextGrad应用问题,通过区分遵循与学习策略能力来研究。发现两者有差距,人工编写策略能提升智能体表现,而从轨迹生成的策略无法可靠超越固定提示,主要挑战是从经验中生成和选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18235 2026-07-21 cs.CL cs.AI 新提交 62%

Automated Discovery Has No Universally Superior Harness

自动化发现没有普遍优越的框架

Akshat Gupta, Jermaine Lei, Alexander Lu, Gopala Anumanchipalli, Leshem Choshen

专题命中 其他LLM :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究自主发现系统框架,通过系统分解和评估发现其存在泛化问题,无固定框架普遍优越,OpenEvolve变体表现不佳。利用早期发现进展预测性能,提出自适应分配实验,优于固定和非自适应选择,推动从固定框架选择转向在线适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18482 2026-07-21 cs.CL cs.LG stat.ML 版本更新 62%

The Truncation Blind Spot: How Decoding Strategies Systematically Exclude Human-Like Token Choices

截断盲区:解码策略如何系统性地排除人类样式的令牌选择

Esteban Garces Arias, Nurzhan Sapargali, Christian Heumann, Matthias Aßenmacher

机构 * Department of Statistics, Ludwig Maximilian University, Munich, Germany(统计系,路德维希-马克西米利安大学,慕尼黑,德国) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了文本生成中解码策略与人类语言生成的差异,发现基于概率的解码方法排除了人类可选但统计上稀有的令牌,导致生成文本可检测性增强。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13921 2026-07-20 cs.PL cs.AI cs.LG 版本更新 62%

Generative Compilation: On-the-Fly Compiler Feedback as AI Generates Code

生成式编译:人工智能生成代码时的即时编译器反馈

Niels Mündler-Sasahara, Hristo Venev, Dawn Song, Martin Vechev, Jingxuan He

机构 * ETH Zurich(苏黎世联邦理工学院) Sofia University ``St. Kliment Ohridski''(索菲亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能生成代码时的问题,提出生成式编译方法,核心是sealor技术,能在生成中获取编译器反馈,在Rust编码任务中评估,减少非编译输出、提高功能正确性,使编译器在生成阶段发挥更重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13319 2026-07-16 cs.RO cs.AI cs.LG 新提交 62%

Adapting Generalist Vehicle Models for High-Speed MPC Across Terrains

使通用车辆模型适应不同地形的高速模型预测控制

Rwik Rana, Jesse Quattrociocchi, Christian Ellis, Nathan Tsoi, Garrett Warnell, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究高速越野自主中通用车辆模型适应不同地形的问题,提出OptCar方法,通过历史条件动态适应模块,利用有限真实数据和合成展开微调通用模型,在多种实验中表现良好,提升了跨地形性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09705 2026-07-14 cs.OH cs.AI cs.CY cs.LG 新提交 62%

Model Collapse: On Recursion, Noise, and Uncharted Machine Visions

模型崩溃:关于递归、噪声和未知的机器视觉

Violaine Boutet de Monvel

专题命中 其他LLM :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究模型崩溃现象,通过历史视频合成技术和当代机器学习艺术应用案例,探讨递归训练揭示的AI生成数据依赖性本质,指出崩溃挑战超人类主义理想,引入美学视角,视噪声和递归为理解艺术创作与AI生态系统的关键概念。

Comments Preprint for Ethics and Aesthetics of Artificial Intelligence (Naples: Orthotes Edizioni), October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09678 2026-07-14 cs.AI cs.LG 新提交 62%

Faithful, Not Corrective: Message-Format Effects in Multi-Hop Agent Relays Are Tier-Dependent

忠实而非纠正:多跳智能体中继中的消息格式效应取决于层级

Zayx Shawn

专题命中 其他LLM :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究多跳智能体中继中消息格式效应,引入可控测试平台,发现格式效应取决于层级,强中继近乎无损,弱中继下跨格式差异增大,配对分叉注入中错误值保留情况与真实值保留匹配,结构提供错误定位通道,格式选择应依最弱中继。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08193 2026-07-10 cs.LG cs.AI 新提交 62%

Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

通过多模态大语言模型对策略进行视觉检查实现开放式多智能体自动课程

Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

机构 * Sapienza University of Rome(罗马第一大学) Sony AI(索尼人工智能)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中开放式多智能体自动课程设计难题,提出通过策略视觉检查(VIP)利用视频语言模型处理视频并提供课程建议,经星际争霸多智能体挑战赛实证,显示该方法能生成更有效课程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17077 2026-07-09 cs.LG cs.AI cs.CV 版本更新 62%

ContrastiveCFG: Guiding Diffusion Sampling by Contrasting Positive and Negative Concepts

对比CFG:通过对比正负概念引导扩散采样

Jinho Chang, Changsun Lee, Hyungjin Chung, Jong Chul Ye

机构 * EverEx

专题命中 其他LLM :prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究在条件扩散模型采样中,针对简单否定CFG引导存在的问题,提出用对比损失实现对给定条件引导的新方法,能在多样场景下有效注入或去除给定概念并保持样本质量。

Comments 20 pages, 11 figures. Poster in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04523 2026-07-07 cs.CL cs.AI 新提交 62%

Failures and Successes to Learn a Core Conceptual Distinction from the Statistics of Language

从语言统计中学习核心概念区分的失败与成功

Zhimin Hu, Jeroen van Paridon, Gary Lupyan

机构 * Department of Psychology, University of Wisconsin-Madison(威斯康星大学麦迪逊分校心理学系)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人们能否从语言中学习原则性与统计性属性的区分,发现语言模型对统计流行度敏感,但在表示该区分上有困难,GPT - 4成功做到。

Comments Published at Evolang XV, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02212 2026-07-07 cs.CL cs.AI q-bio.GN 版本更新 62%

Leveraging Natural Language Processing to Unravel the Mystery of Life: A Review of NLP Approaches in Genomics, Transcriptomics, and Proteomics

利用自然语言处理解开生命之谜:基因组学、转录组学和蛋白质组学中自然语言处理方法综述

Ella Rannon, David Burstein

机构 * The Shmunis School of Biomedicine and Cancer Research, George S. Wise Faculty of Life Sciences, Tel-Aviv University(谢蒙尼生物医学与癌症研究学院,乔治·S·威斯生命科学学院,特拉维夫大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 探讨自然语言处理方法在生物序列数据(基因组学、转录组学和蛋白质组学)中的应用,介绍从经典到先进模型的适配,分析分词策略与模型架构,提及生物数据应用进展及语言模型融入生物信息学的前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04126 2026-07-01 cs.CL cs.AI cs.CV 版本更新 62%

InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training

InfiniteWeb: 面向GUI智能体训练的可扩展Web环境合成

Ziyun Zhang, Zezhou Wang, Xiaoyi Zhang, Zongyu Guo, Jiahao Li, Bin Li, Yan Lu

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出InfiniteWeb系统,通过统一规范、任务驱动测试和多样化种子设计自动生成功能完备的Web环境,解决GUI智能体训练数据稀缺问题,在OSWorld和Online-Mind2Web上取得显著性能提升。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27881 2026-06-29 cs.CL cs.AI 新提交 62%

A Study of Temporal Fusion Strategies for Named Entity Recognition in Historical Texts

历史文本中命名实体识别的时间融合策略研究

Emanuela Boros

机构 * Digital Humanities Laboratory, EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院数字人文实验室)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对历史文本中实体随时间漂移的问题,系统研究了将时间元数据嵌入NER模型的轻量级融合策略,实验表明后期融合在早期和噪声时期表现更鲁棒。

Journal ref International Conference on Theory and Practice of Digital Libraries 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20919 2026-06-26 cs.LG cs.AI cs.PL 版本更新 62%

Sutra: Tensor-Op RNNs as a Compilation Target for Vector Symbolic Architectures

Sutra: 以张量操作RNN作为向量符号架构的编译目标

Emma Leonhart

机构 * Emma Leonhart

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 Sutra是一种纯函数式编程语言,通过编译将整个程序降级为融合张量操作图,同时支持符号推理和神经网络训练,实现逻辑程序与可训练网络的统一。

Comments Modified NeurIPS submission, see AI declaration and replication materials at end of paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23816 2026-06-26 cs.LG cs.AI 版本更新 62%

Improved Bounds for Private and Robust Alignment

私有和鲁棒对齐的改进界

Wenqian Weng, Yi He, Xingyu Zhou

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从理论角度研究语言模型的私有和鲁棒对齐,通过建立离线与在线设置下的次优性差距上界,分析隐私与对抗性腐败的两种交互模式,并给出改进的界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22748 2026-06-24 cs.CL cs.AI cs.CY 新提交 62%

AI Fiction in the Wild

野生的AI小说

Neel Gupta, Maria Antoniak, Melanie Walsh

机构 * University of Washington(华盛顿大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 分析50万条ChatGPT用户对话,发现超三分之一涉及小说生成,包括原创故事、角色扮演、同人和色情文学,用户倾向于同人、色情及重复叙事,提出“唯我读者-作者”概念。

Comments Presented at the MFS Cultural AI Conference, Purdue University, September 19, 2025. This essay is provisionally forthcoming in MFS: Modern Fiction Studies

详情

展开后加载摘要…

URL PDF HTML 收藏