arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 762 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 762 篇

2608.10279 2026-08-12 cs.CR cs.AI cs.CL 新提交 84%

Withholding the Completing Chunk: Deterministic Pair-Completion Guardrails for Streaming LLM Output

withhold the Completing Chunk: 面向流式大语言模型输出的确定性配对完成护栏

Christopher M. Frost

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究提出流式LLM输出的确定性配对完成护栏,通过扫描前缀扣留配对完成块,实验验证其效果,表明它是小型固定策略的精确发布边界后盾。

Comments 22 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05232 2026-08-07 cs.CL cs.LG 新提交 84%

Analysis of Numerical Localisation in LLM Translations

大语言模型翻译中数值定位的分析

Patrizia Kaye

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文分析5款可在商用硬件运行的LLMs对时间、数字、日期的定位能力,发现将定位原则嵌入提示上下文可显著提升其定位准确率。

Comments 13 pages, 7 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04192 2026-08-06 cs.CR cs.AI cs.CL 新提交 84%

Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills

行为技能重构:从大语言模型智能体技能中重构隐藏功能

Peichun Hua, Haoxuan Xu, Mengyuan Li

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出SkillClone黑盒攻击方法,可通过合法交互从隐藏的LLM智能体技能中重构其功能,表明仅文件保密无法确保功能保密。

Comments 20 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19629 2026-07-23 cs.CL cs.AI cs.MA 新提交 84%

Adaptive Capitulation: A Structural Failure Mode of LLM Responses in Vulnerability Contexts

适应性屈服:脆弱情境下大语言模型响应的一种结构故障模式

Eunna Lee

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在脆弱情境下的响应问题,通过实验刻画了适应性屈服故障模式,表明困境是结构性的,进而提出架构中立的最小重新归因充分性原则来保留自主重新归因途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18566 2026-07-22 cs.CL cs.AI 新提交 84%

The Story Shapes the Agent: Narrative Priors in LLM Behavior

故事塑造智能体:大语言模型行为中的叙事先验

Yixuan Wang, James Lester, Shashank Srivastava

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 其他LLM :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究探索大语言模型行为中叙事框架的影响,通过构建游戏识别叙事先验,发现其解释行为方差能力强且与任务成功相关,还明确跨叙事角色效应源于行为锚点,框架可推广并产生改进跨叙事转移的角色选择方法。

Comments Accepted at COLM 2026. 10 pages, 3 figures, 16 tables in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08961 2026-07-13 cs.LG cs.AI math.ST stat.TH 新提交 84%

NL-PAC: Specification Ambiguity and Certified Minimax Risk Floors in LLM-Mediated Supervision

NL-PAC:大语言模型介导监督中的规范模糊性与认证极小极大风险下限

Berkay Anahtarci

机构 * Özyeğin University(奥泽金大学)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型介导监督中规范模糊性问题,引入NL-PAC框架,利用固定模型阈值解码法则定义相关内容,通过有限样本置信界认证风险,在Qwen模型审计中得出特定提示有正证书等结果,该保证有特定局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09159 2026-06-09 cs.CL cs.AI 新提交 84%

Unified Energy for Invariant and Independent Decoding in Diffusion Language Models

扩散语言模型中不变性与独立性解码的统一能量

Yuchen Yan, Minkai Xu, Zaiquan Yang, Yatao Bian

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学)

专题命中 其他LLM :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型并行生成文本时与自回归模型的性能差距,提出统一能量(Uni-E)方法,通过不变能量和独立能量解决模型容量、依赖性和不变性问题,无需采样即可精确计算,并能纠正分布偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04768 2026-08-06 cs.CV 新提交 83%

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

专题命中 其他LLM :large language model(title);language model(title)

AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24895 2026-06-25 cs.DL 新提交 83%

Hybrid Metadata Extraction from League of Nations Index Cards: From Feasibility Study to Archival System Integration

国联索引卡片的混合元数据提取:从可行性研究到档案系统集成

Florian Cafiero, Grégoire Mallard

专题命中 其他LLM :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出混合AI工作流从国联索引卡片中提取并整合档案元数据,结合YOLO、TrOCR、本地LLM后校正及微调视觉语言模型,实现从布局感知管道到混合架构的演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08050 2026-06-09 cs.HC 新提交 83%

Automatic, Real-time Classification of User Feedback Using Large Language Models

使用大型语言模型自动实时分类用户反馈

Jim Maddock, Rose Leitner, Anna Wu

专题命中 其他LLM :large language model(title);language model(title)

AI总结 本文介绍一个多年项目,利用大型语言模型自动分类用户反馈,降低时间与知识成本,使非技术用户也能实时访问评论、主题和分析,从而民主化数据分析过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17102 2026-08-19 cs.CL eess.AS eess.IV 新提交 83%

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

跨语音与面部的情感:多模态基础模型中的共享情感机制

Xiutian Zhao, Luqi Sun, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心) Group on Language, Audio & Music (GLAM), Imperial College London(伦敦帝国理工学院语言、音频与音乐组)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.CL

AI总结 该研究在Gemma-4-12B-it等3款多模态基础模型中识别出情感敏感神经元,发现语音与面部情感识别的表征在解码器级部分汇聚,且存在双向因果迁移,为跨模态情感机制提供了新分析。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16650 2026-08-18 cs.CL 新提交 83%

PCA-guided Activation Scaling for Monotonic Bidirectional Control over LLM Sycophancy

基于主成分分析引导的激活缩放实现对大型语言模型谄媚性的单调双向控制

Zheng Chen, Zhaoxin Feng, Yip Tin Po, Jianfei Ma, Emmanuele Chersoni, Bo Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对LLMs的谄媚性问题,提出PCA引导的激活缩放框架,通过分解残差流激活实现单调双向控制,在三个模型和三个数据集上的表现优于基线方法。

Comments accepted by COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15108 2026-08-18 cs.CR cs.AI 新提交 83%

Beyond Direct Access: Resource Hijacking in LLM Agents

超越直接访问:大语言模型智能体中的资源劫持

Puyu Zeng, Qibing Ren

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究首次识别智能体资源劫持这一安全盲区,推出ResourceHijackBench及自动化生成流程,实验显示无防御时OpenClaw平均攻击成功率达84.06%,现有防御仍不足。

Comments 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13944 2026-08-17 cs.HC cs.AI 新提交 83%

Musical Mirrors: The LLM as Sounding Board in Songwriting

音乐镜像:作为歌曲创作共鸣板的大语言模型

Xiao Xiao

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.AI

AI总结 本文通过2025-2026年的第一人称歌曲创作案例研究,探讨了将LLM用作人类创作素材的解释性共鸣板的应用,揭示了该模式的潜力及缺乏校准会引发的谄媚式偏移、魔法式过度解读两种风险。

Comments In Proceedings of The First Reflection in Creative Experience (RiCE) Workshop (RiCE W1) arXiv:2607.24558

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12320 2026-08-14 cs.CY cs.AI 新提交 83%

The AI Accountability Ecosystem in the Era of Language Models

语言模型时代的人工智能问责制生态系统

Chris Percy, Artur d'Avila Garcez

专题命中 其他LLM :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文针对大型语言模型带来的新风险,更新了人工智能问责制生态系统框架,提出三项关联更新,推动问责制向分布式、持续化、制度化转变。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06004 2026-08-07 cs.LG 新提交 83%

Do Tabular Foundation Models Agree with Themselves?

表格基础模型是否与自身一致?

Christian Klötergens, Vijaya Krishna Yalavarthi, Lars Schmidt-Thieme, Tom Hanika

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 本文针对表格基础模型(TFMs),提出其预测是否可由任意联合分布生成的问题,设定边际一致性与分解一致性要求,发现所有评估的TFMs均违反这两项要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22026 2026-07-27 cs.CL 新提交 83%

DWT-Fusion: A Signal-Based Framework for Training-Free LLM-Generated Text Detection

DWT-Fusion:一种用于无训练大语言模型生成文本检测的基于信号的框架

Mehmet Batuhan Özdaş, Murat Osmanoğlu

机构 * Ankara University(安卡拉大学)

专题命中 其他LLM :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究在零样本和无训练条件下检测大语言模型生成文本的挑战,提出基于离散小波分析的DWT-Fusion框架,通过多分辨率信号表示和校准引导投票融合检测文本,实验表明该方法能提供有效可解释信号,提升检测性能。

Comments 40 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20351 2026-07-23 cs.CV cs.CL 新提交 83%

Test-Time Training for Modality Order Consistency in Vision-Language Models

视觉语言模型中模态顺序一致性的测试时训练

Aditi Gupta, Yossi Gandelsman

机构 * University of Chicago(芝加哥大学)

专题命中 其他LLM :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究发现视觉语言模型对图像和问题呈现顺序敏感,利用此设计测试时训练方法,缩小模态顺序差距,使两种顺序相互一致,定位顺序失败区域,证明该方法可缓解故障并提升性能。

Comments 16 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09474 2026-07-13 cs.AI 新提交 83%

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

ProofCouncil:用于解决开放性数学问题的语言模型智能体

Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学) Leiden University(莱顿大学)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在提升大型语言模型解决数学开放性问题的性能,介绍了ProofCouncil智能体,它采用作者-评论家架构,在FirstProof挑战及其他问题测试中表现出色,还介绍了其开发及相关构建库并开源。

Comments 25 pages, 7 figures. ProofCouncil appears as System A (IMProofBench ProofCouncil) in the official FirstProof second-batch report (arXiv:2606.18119). Code and agent-building library: https://github.com/eth-sri/proof-council

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05694 2026-07-08 stat.ML cs.LG 新提交 83%

Beyond Heuristic Tuning: Power-Calibrated LLM Watermarking

超越启发式调优:功率校准的大语言模型水印

Xiaopu Wang, Zelin He, Chengyuan Liu, Runze Li

机构 * Department of Statistics, Pennsylvania State University(统计学系,宾夕法尼亚州立大学)

专题命中 其他LLM :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型水印,针对现有基于对数几率水印在可检测性和语义失真权衡及超参数选择上的问题,开发功率校准统计框架,建立相关定量关系,推导出实用参数选择程序,经实验验证可识别帕累托最优点。

Comments Accepted ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26918 2026-06-26 cs.AI 新提交 83%

Diagnosing Task Insensitivity in Language Agents

诊断语言智能体中的任务不敏感性

Jingyu Liu, Xiaopeng Wu, Kehan Chen, Chuan Yu, Yong Liu

机构 * Gaoling School of Artificial Intelligence Renmin University of China(中国人民大学高瓴人工智能学院) Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京市大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部新一代智能搜索与推荐工程研究中心)

专题命中 其他LLM :language agent(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文发现大语言模型在长程任务中因过度依赖训练模式而忽略任务指令,导致分布外泛化失败,并提出任务扰动负对数似然优化(Task-Perturbed NLL Optimization)来增强任务敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17956 2026-08-19 cs.LG cs.AI cs.SY eess.SY 新提交 82%

An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models

被遗漏的模式即罕见规则:连续代码世界模型中的采样-验证危险定律

Javier Aguilar Martín

机构 * AGILabs

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究揭示连续代码世界模型中采样-验证机制的危险,通过理论分析与实验发现,LLM合成的模式盲模型易被利用,接受仅能证明样本一致性,无法保证连续控制任务的性能。

Comments 92 pages, 5 figures. Code, data and result artifacts: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17471 2026-08-19 cs.AI cs.LG 新提交 82%

When AI Designs AI: Innovation or Imitation?

当AI设计AI:创新还是模仿?

Yikang Yang, Zhengxin Yang, Luzhou Peng, Minghao Luo, Yanqi Kan, Wanling Gao, Jianfeng Zhan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Northwestern University(西北大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究对比LLM智能体与人类设计AI方法的性能和算法差异,发现智能体偶达SOTA但无法泛化,96.8%的设计属人类推导空间,多为算法选择的复用重组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16909 2026-08-19 cs.CY cs.AI cs.CL 新提交 82%

When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice

当个性化成为偏见:AI生成金融建议中的结构性与话语性宗教框架

Muhammad Salar Khan, Hamza Umer, Hasan Mahmud, Sandra Rothenberg

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过432次模拟互动分析3种LLMs在金融建议中的宗教偏见,揭示其结构性与话语性偏见机制,提出双维度框架并指出个性化与中立性的管理困境及相关启示。

Comments 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14944 2026-08-18 cs.RO cs.CL cs.LG 新提交 82%

SkillComposer: Learning Reusable Skills for Natural-Language Robot Programming

SkillComposer:学习可复用技能的自然语言机器人编程系统

John Woods, Hasti Seifi

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 SkillComposer是一款仿真环境下的交互式自然语言机器人编程系统,采用生成-测试架构,通过在线库学习算法生成可复用宏技能,经实验验证可提升任务成功率与可用性并减少用户工作量。

Comments 8 pages, 6 figures. Submitted to IEEE Humanoids 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11483 2026-08-13 cs.AI cs.LG q-bio.QM 新提交 82%

A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization

用于合成约束多目标先导化合物优化的模块化智能体框架

Kelvin P. Idanwekhai, Enes Kelestemur, Benjamin Strickland, Matthew Hart, Steini Davidsson, Angelos Angelopoulos, Ron Alterovitz, Marcello DeLuca, Alexander Tropsha

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出开源模块化智能体框架SABLE,结合LLM与专用工具实现合成约束下的多目标先导化合物优化,可高效富集符合计算目标的候选集,为早期药物发现提供决策支持。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08383 2026-08-11 cs.CL cs.LG 新提交 82%

Safety Cost of Steering Vectors Is Separable and Reducible

引导向量的安全代价是可分离且可降低的

Yuxiao Li, Gjergji Kasneci

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本研究针对引导向量破坏LLM安全机制的问题,通过识别并移除其安全退化分量,提出带约束的原始对偶优化方法,可在保留引导效果的同时大幅降低安全退化。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06750 2026-08-10 cs.CL cs.AI 新提交 82%

Progressive Content Refinement with Decaying Reward Joint LinUCB

结合衰减奖励的渐进式内容优化与联合LinUCB

Shion Ishikawa, Pablo Loyola, Young-joo Chung, Yun Ching Liu

机构 * Rakuten Group, Inc.(乐天集团)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有迭代优化方法忽略奖励衰减导致过度利用的问题,提出结合奖励衰减建模与EM算法的联合LinUCB算法,在Sentiment Reversal和GSM8K基准上显著优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27614 2026-07-31 cs.CL cs.AI 新提交 82%

DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation

DualAnchor:无注释手语翻译中保留语言先验并提升词汇保真度

Hongbin Zhang, Junhao Liu, Xuefeng Bai, Youcheng Pan, Yang Xiang, Kehai Chen

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有无注释手语翻译方法的语言先验退化与词汇保真度差距问题,提出结合TPA和OTA的DualAnchor框架,在两个基准数据集上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26383 2026-06-26 cs.LG cs.AI cs.AR cs.MA cs.PF 新提交 82%

SOLAR: AI-Powered Speed-of-Light Performance Analysis

SOLAR: AI驱动的光速性能分析

Qijing Huang, Sana Damani, Zhifan Ye, Athinagoras Skiadopoulos, Siva Kumar Sastry Hari, Jason Clemons, Sahil Modi, Jingquan Wang, Aditya Kane, Edward C Lin, Humphrey Shi, Christos Kozyrakis

机构 * NVIDIA(英伟达)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出SOLAR框架,自动从PyTorch和JAX代码推导理论最小执行时间(光速界限),通过LLM前端和确定性分析实现无违反界限的多保真度性能分析。

详情

展开后加载摘要…

URL PDF HTML 收藏