arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 762 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 762 篇

2608.05659 2026-08-07 cs.CR 新提交 80%

Breaking Customized LLMs for Coding: Automated Red Teaming for Instruction Backdoor Attacks

针对代码任务定制化大语言模型的突破:针对指令后门攻击的自动红队测试

Yuchen Chen, Wei Cheng, Yuan Xiao, Wising Sun, Chunrong Fang, Yang Liu, Zhenyu Chen, Baowen Xu

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 本文提出ARIA自动红队测试框架,可高效生成针对代码定制化LLM的隐蔽带后门指令,攻击成功率达0.945且规避检测能力强,性能优于现有基线攻击。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05008 2026-08-06 cs.CY 新提交 80%

The Beginning of ChatGPT Ads

ChatGPT 广告的开端

Emma Lurie, Ro Encarnación, Sorelle A. Friedler, Danaé Metaxa

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文首次实证研究 ChatGPT 广告,采用傀儡审计方法,发现低收入账号更易收到广告,发布了广告存档并提出未来研究建议。

Comments To be published in AAAI/ACM AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03676 2026-08-05 cs.DC 新提交 80%

TAOT: Topology-Aware Optimal Transport for Dynamic Expert Replica Placement in MoE Training

TAOT:MoE训练中面向动态专家副本放置的拓扑感知最优传输方法

Lingyun Zhang, Henghua Zhang, Shilei Gu, Kai Mo, Shuai Han, Shiyong Li, Yanpeng Wang, Dou Shen

专题命中 其他LLM :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对MoE训练中动态路由引发的负载不平衡问题,提出TAOT拓扑感知最优传输方法,可实现1.43倍训练加速,平衡质量优异且通信成本降幅最高达74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03485 2026-08-05 cs.CR 新提交 80%

SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills

SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界

Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27938 2026-07-31 cs.HC 新提交 80%

VizPilot: Automated Onboarding for SVG-based Composite Visualizations using Multimodal LLMs

VizPilot:基于多模态大语言模型的SVG复合可视化自动引导系统

Nishaanthini Gnanavel, Yong Wang

专题命中 其他LLM :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 VizPilot是基于多模态大语言模型的SVG复合可视化自动引导工具,通过双模块实现自动生成交互式引导,经评估可降低创作工作量并减轻用户认知负荷,提升复合可视化可用性。

Comments Accepted by IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15948 2026-07-20 cs.SE 新提交 80%

TARS: A Theory-of-Mind Agent for Personalized In-IDE Code Comprehension

TARS:用于个性化IDE内代码理解的心理理论智能体

Leopoldo Todisco, Antonio Della Porta, Stefano Lambiase, Fabio Palomba

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 研究针对代码理解中LLM助手的不足,提出TARS智能体,基于心理理论范式,剖析开发者特点并调整解释,通过检索增强生成联系项目文档。实验表明它能提升效率、降低认知负荷,解释更适配开发者。

Comments Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03229 2026-07-07 cs.DC 新提交 80%

HyperParallel-Mpipe: A Composable Algebra System for Optimizing MLLM Training over Supernode Clusters

HyperParallel-Mpipe:用于在超级节点集群上优化多模态大语言模型训练的可组合代数系统

Chong Li, Zhengdao Yu, Nelson Lossing, Thibaut Tachon, Pierre Leca, Etienne Filhol, Yujie Yuan, Chong Bao, Teng Su

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 分析多模态大语言模型(MLLM)训练痛点,引入Mpipe,用调度代数从紧凑调度规范推导运行时行为,得出多模态感知异构并行调度transpose,在Ascend 910C NPU集群上加速显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21993 2026-06-23 cs.SE cs.CV 新提交 80%

From Driving Videos to Simulatable Scenarios

从驾驶视频到可模拟场景

Alexandre Levy, Ernest Valveny Llobet, Antonio Manuel López

机构 * Dept. Computer Science, Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学计算机科学系) Computer Vision Center (CVC), UAB(UAB计算机视觉中心)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出D-V2S框架,通过视觉语言模型和大语言模型从驾驶视频自动生成可模拟场景,实现90%语义元素保留和75%偏好率。

Comments 8 pages, 11 figures and Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20835 2026-06-23 cs.CR cs.SE 新提交 80%

PromptMark: A Prompt-Guided Iterative-Feedback Framework for Source Code Watermarking

PromptMark: 一种提示引导的迭代反馈框架用于源代码水印

Istiaq Ahmed Fahad, Mridha Md. Nafis Fuad, Kazi Sakib

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出PromptMark,一种黑盒提示引导的水印框架,通过结构化输入指令在AI生成代码中嵌入可检测信号,并利用迭代反馈优化嵌入,在保持代码正确性的同时实现强水印可检测性。

Comments Accepted in 21st International Conference on Evaluation of Novel Approaches to Software Engineering (ENASE'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06747 2026-06-19 cs.SE 新提交 80%

Tensor Algebraic Property Skeletons: Amplifying Property-Based Testing for AI Compilers

张量代数性质骨架:增强AI编译器的基于性质的测试

Yuxin Qiu, Ben Limpanukorn, Seongmin Lee, Jiyuan Wang, Qian Zhang, Miryung Kim

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 提出Propilot框架,利用LLM将张量代数知识表示为可复用的性质骨架,自动生成可执行的基于性质的测试,以检测AI编译器中的语义漂移。

Comments v2 adds citations and fixes some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18065 2026-06-17 cs.MA 新提交 80%

Intelligence Entropy Principle and the ADE Stability Engineering Framework

智能熵原理与ADE稳定性工程框架

Dexing Liu

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 针对LLM驱动的多智能体系统从实验室到生产环境时出现的非线性退化,提出智能熵原理,构建ADE四层框架,通过Lyapunov分析给出稳定条件,实验验证将通道断裂率降至近0%,系统死亡概率低于0.02%。

Comments 32 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07539 2026-06-09 cs.CY 新提交 80%

Prompt Governance? On Governing Technologies Governed by Natural Language

提示治理?论受自然语言治理的技术

Anna Neumann, Holli Sargeant, Jatinder Singh

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨系统级指令作为生成式AI治理工具的可靠性,发现文献中对其目标存在矛盾主张,政策框架将其视为稳定控制机制,但两者错位需审慎对待。

Comments Accepted as a full paper to ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19227 2026-08-21 q-fin.CP cs.LG 新提交 79%

M3: A State-Event Generative Foundation Model for Market Microstructure Dynamics

M3:用于市场微观结构动态的状态-事件生成基础模型

Yanzhi Zhang, Yu Ma, Yilin Cheng, Jian Li, Yitong Duan

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 针对现有金融生成模型忽略订单流与流动性动态交互的问题,提出M3状态-事件生成基础模型,经大规模订单级股票数据训练后可生成订单流轨迹,复现市场程式化事实,支持预测等反事实市场模拟应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18409 2026-08-20 cs.AI 新提交 79%

Improving Natural-Language Combinatorial-Optimization Accuracy in Resource-Constrained Language Models via Formal Abstractions

通过形式化抽象提升资源受限语言模型的自然语言组合优化准确率

Shrenil Shaun Sharma, Avi Sharma

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 针对资源受限语言模型在自然语言组合调度中可行性不足的问题,提出神经符号框架SDDL,其在300实例调度子集上大幅提升小模型的可行调度准确率,逼近大模型性能

Comments 17 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18083 2026-08-20 cs.CL 新提交 79%

Entity tracking emerges in sub-billion parameter language models and exceeds human performance in naturalistic narratives

实体追踪在亚十亿参数规模的语言模型中出现,且在自然叙事中超越人类表现

Karolina Drożdż, Micha Heilbron

机构 * IDEAS Research Institute(IDEAS研究所) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) University of Amsterdam(阿姆斯特丹大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 本研究发现4.1亿参数的语言模型已具备人类水平的实体追踪能力,且随规模提升而改善,远超人类表现,该能力在远小于预期的模型规模时出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15772 2026-08-18 cs.AI 新提交 79%

Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration

大语言模型拒绝回答中的对称性破缺:答案释放比拒绝恢复更具局部性

Yiqi Liu, Yang Wang, Songxin Wang, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 其他LLM :LLM(title);language model(abstract);分类 cs.AI

AI总结 本研究通过受控保留设置揭示大语言模型拒绝回答存在对称性破缺:答案释放具高度局部性,拒绝恢复需更广干预,拒绝并非简单对称开关,对安全审计具启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12623 2026-08-14 cs.CL stat.ML 新提交 79%

When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers

当解释背叛后门:语言模型分类器的黑盒审计

Yang Liu, Ran Zou

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 本文针对仅拥有干净校准数据的黑盒场景,提出接地漂移方法,在5%干净FPR预算下,于7B主干等实验中实现了比现有检测器更优的后门检测性能。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09574 2026-08-11 cs.AI 新提交 79%

The Politician, the Liar, and the Obedient Worker: Emerging Behavior of LLM Agents in Hierarchical Games

政客、骗子与顺从的工人:层级博弈中大语言模型智能体的涌现行为

Fatemeh Seyedin, Adrian Weller, Jinhyuk Yun, Mahmoudreza Babaei

机构 * Soongsil University(崇实大学) GISMA University(GISMA大学)

专题命中 其他LLM :LLM(title,abstract_cn);分类 cs.AI

AI总结 该研究通过层级博弈实验测试6种大语言模型智能体,发现其在不同制度下会涌现出撒谎、私下交易等类似人类的治理失效行为,且模型家族会影响领导层更迭。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08082 2026-08-11 cs.CL 新提交 79%

Commitment Before Realization: When Classifier-Free Guidance Becomes Unnecessary in Masked Diffusion Language Models

实现前的承诺:无分类器引导何时在掩码扩散语言模型中变得不必要

Fan Zhou, Weitian Wang, Tim Van de Cruys

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 该研究探究掩码扩散语言模型解码中无分类器引导(CFG)的必要性,定义承诺 horizon τ*,发现固定提示的交叉验证 horizon 时,其表现不劣于全程CFG,还可优化并行度与失败轨迹恢复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04183 2026-08-06 cs.CL 新提交 79%

Test, then Route: How Language Models Execute In-Context Conditional Rules Across Models and Languages

测试再路由:语言模型如何跨模型和语言执行上下文条件规则

Luxshan Thavarasa, Sivasuthan Sukumar

机构 * University of Moratuwa(莫拉图瓦大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 该研究通过四捐赠者设计的激活修补实验,在三个开源模型、六种语言中揭示:中间层残差带承载谓词真值,路由模块无抽象性,测试具模块化而路由不具。

Comments 19 pages, 16 figures. Code and data: https://github.com/Luxshan2000/icl-conditional-circuits

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02971 2026-08-05 cs.CL 新提交 79%

Mapping the City Through the Lens of Language Models

通过语言模型的视角映射城市

Wanqi Liu, Rong Zhao, Zhizhou Sha, Qinyu Cui, Yecheng Zhang

机构 * University College London(伦敦大学学院) Centre for Advanced Spatial Analysis (CASA)(高级空间分析中心) Tsinghua University(清华大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) South China University of Technology(华南理工大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 该研究通过10个开放权重检查点结合多类技术,匿名测量语言模型对城市的隐含假设,勾勒出模型视角下的城市画像,揭示其对城市的偏好倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00929 2026-08-04 cs.AI 新提交 79%

Modeling Social Dynamics with an LLM-Enabled Agent Based Network-Dynamic (LAND) Model

基于大语言模型的智能体网络动态(LAND)模型对社会动力学的建模

Lynnette Hui Xian Ng, Kathleen M. Carley

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他LLM :LLM(title,abstract);分类 cs.AI

AI总结 本文采用GhostField架构的LAND模型构建AuraSight场景,通过31万余智能体与人类主体的模拟,揭示社会动力学源于网络拓扑与叙事交换的递归互动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29274 2026-08-03 cs.IR cs.CL cs.CY cs.HC 新提交 79%

Language Models Agree With Each Other, Not With Readers

语言模型彼此意见一致,但与读者不一致

Kazuki Nakayashiki, Keisuke Watanabe

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 该研究以非研究专用的读者标记为参考,发现不同语言模型间的一致性高于模型与读者间的一致性,且模型一致性与模型规模等因素相关,样本外测试也验证了该结论。

Comments 18 pages. Ancillary files include all three pre-registrations, every analysis script and every result artifact; the paper contains no numeric literal for a measured value and make-numbers.py regenerates all of them from the shipped artifacts alone

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28423 2026-07-31 cs.CV cs.LG 新提交 79%

Negative controls reveal volume-driven confounding in radiomics and imaging foundation model features

阴性对照揭示放射组学和影像基础模型特征中体积驱动的混杂效应

Katy L. Scott, Sejin Kim, Joshua Siraj, Caryn Geady, Matthew Boccalon, Mattea Welch, Mogtaba Alim, Andrew J. Hope, Benjamin Haibe-Kains

机构 * Princess Margaret Cancer Centre(玛格丽特公主癌症中心) University Health Network(大学网络医疗保健系统)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 该研究推出开源框架READII-2-ROQC,通过体积保持阴性对照分析放射组学和影像基础模型特征,揭示体积驱动的混杂效应,为可解释影像生物标志物开发提供质控策略。

Comments 22 pages (including supplementary), 6 figures, 2 supplementary tables, 5 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27281 2026-07-31 cs.LG 新提交 79%

The Kinetics of Training: A Driven-Nucleation Rate Law for Emergence, Plasticity Loss, and Circuit Control in Language Models

训练动力学:语言模型中涌现、可塑性丧失与回路控制的成核速率定律

Lei Dong

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 该研究提出语言模型能力形成的成核速率定律,揭示无部分 credit 的联合对齐是速率限制步骤,定位可塑性丧失的损伤并找到重新初始化 query-key 切片的解决方案,适用于14亿参数 transformer 的合取回路。

Comments 40 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26762 2026-07-30 cs.CL 新提交 79%

Relation Geometry in Semantic Space of Language Models

语言模型语义空间中的关系几何

Zhihan Cao, Hiroaki Yamada, Simone Teufel, Tatsuya Hiraoka, Kentaro Inui, Hitomi Yanaka, Takenobu Tokunaga

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 本文研究语言模型语义空间中关系几何的表征情况,通过三类语言模型在6种语义关系上的实验,发现非对称关系的表征更清晰,且不同模型依赖的信息来源存在差异。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24306 2026-07-28 cs.CL 新提交 79%

Rethinking the Generation Order of Block Diffusion Language Models

重新思考块扩散语言模型的生成顺序

Kai Syun Hou, James Kwok

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 研究块扩散语言模型的采样,基于其更适合从左到右解码的特点,提出并行自回归解码方法PARD,该方法无需训练,能保留结构并允许并行令牌承诺,实验证明其在生成质量和速度上优于现有方法。

Comments 20 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22691 2026-07-28 cs.AI 新提交 79%

HiLLTS: Zero-Shot Hierarchical LLM-Guided Traffic Signal Control for Sustainable Transportation

HiLLTS:用于可持续交通的零样本分层大语言模型引导的交通信号控制

Yue Ding, Tendai Mukande, Mingming Liu

机构 * School of Electronic Engineering, Dublin City University(都柏林城市大学电子工程学院)

专题命中 其他LLM :LLM(title,abstract);分类 cs.AI

AI总结 针对传统交通信号控制策略的问题,提出HiLLTS框架,它采用分层三层架构,由中央协调代理等组成。实验表明其能改善拥堵和环境性能,相比不同基线,在减少等待时间和二氧化碳排放上效果显著,消融研究验证了大语言模型引导协调的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21988 2026-07-27 cs.CL 新提交 79%

Analysing Self-Harm Representations in Language Models: a Cross-Architecture Study

分析语言模型中的自我伤害表征:跨架构研究

Luis Espinosa-Anke, Carla Perez-Almendros

机构 * Cardiff University(卡迪夫大学)

专题命中 其他LLM :language model(title);LLM(abstract);分类 cs.CL

AI总结 研究使用自然语言处理技术检测自我伤害内容的挑战,通过对两个数据集和四个模型进行两项实验,分析语言模型对自我伤害内容的表征,发现自我伤害信息在网络层特定深度结晶,且最准确探针不一定最线性可分,Gemma - 3 - 4B表征方式独特。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19659 2026-07-23 cs.LG 新提交 79%

Expert-Guided Forecast Editing for Time-Series Foundation Models

用于时间序列基础模型的专家指导预测编辑

Hung Le, Minh Hoang Nguyen, Manh Nguyen, Huu Hiep Nguyen, Dai Do

机构 * Deakin University(迪肯大学) Deakin Applied Artifical Intelligence Initiative(迪肯大学应用人工智能倡议)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 研究时间序列基础模型中专家指导预测编辑问题,提出DEFT框架,先利用基础模型预测样本,再逐分量细化探索,仅对完整轨迹查询专家并重用分数,在多数据集和模型等设置下,能有效提高专家指导的有效性。

Comments preprint 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏