arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 400 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 400 篇

2607.24343 2026-08-03 cs.LG cs.AI cs.CL 版本更新 82%

Beyond Aggregate Risk: Role-Stratified Conformal Risk Control for LLM Tool Calls

超越总体风险:用于大语言模型工具调用的角色分层共形风险控制

Md Ashikur Rahman, Md Arifur Rahman, Niamul Hassan Samin, Khandaker Rifah Tasnia, Md Hasibul Amin, Sifat Rahman Ahona, Juena Ahmed Noshin

专题命中 其他LLM :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型工具调用中参数的不同风险,提出角色分层共形风险控制方法,为语义参数角色设阈值和预算,实验表明该方法能有效实现特定角色预算合规,证明应在语义角色层面认证结构化工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17394 2026-07-28 cs.HC 版本更新 82%

TaskArtisan: Designing Composable Generative Widgets for LLM-Assisted Analysis

TaskArtisan:为大语言模型辅助分析设计可组合的生成式小部件

Meng Chen, Amy Pavel

专题命中 其他LLM :LLM(title,abstract);prompting(abstract)

AI总结 研究探索大语言模型辅助分析中生成式用户界面带来的新机会。通过采访、分析工具及比较研究,发现GUI利弊,总结权衡形成临时设计框架,为未来大语言模型辅助分析工作流程中的生成式用户界面设计提供参考。

Comments Accepted to the 2026 IEEE Symposium on Visual Languages and Human-Centric Computing (VL/HCC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07811 2026-07-20 cs.SE 版本更新 82%

CodeCoR: An LLM-Based Self-Reflective Multi-Agent Framework for Code Generation

CodeCoR:一种基于大语言模型的代码生成自反思多智能体框架

Ruwei Pan, Hongyu Zhang, Chao Liu

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究针对代码生成中语言模型无法确保代码正确性及多智能体框架工作流性能不稳健的问题,提出CodeCoR框架,通过在不同阶段修剪中间输出减少错误传播,实验证明其优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12535 2026-07-02 cs.CR 版本更新 82%

Ghost in the Context: Policy-Carriage Integrity in LLM Agents

上下文中的幽灵:在决策时间装配中的政策承载失败测量

Igor Santos-Grueiro

专题命中 其他LLM :LLM(title,abstract)

AI总结 本文研究了在决策时间装配过程中由于状态丢失、削弱或反弹导致的政策边界跨越问题,提出SafeContext控制层以缓解风险,并展示了其在不同模型上的效果。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11256 2026-08-21 cs.LG cs.CY 版本更新 81%

Why AI Detection Fails for Academic Integrity

为什么AI检测无法保障学术诚信

Jonathan A. Karr, Grigorii Khvatskii, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(圣母大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究发现商业AI检测器无法区分AI编辑与LLM完整生成稿,轻度AI辅助润色的论文标记率远高于未修改稿,且人性化处理可大幅规避检测,表明检测器分数不能单独作为学术不端证据。

Comments Accepted to ACM AI Leadership Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16934 2026-08-20 cs.AR cs.CL 版本更新 81%

SeqFeed: Improving Agentic RTL Code Generation with Sequential Behavior Feedback

SeqFeed:通过顺序行为反馈改进智能体RTL代码生成

Yuxin Du, Juxin Niu, Tao Hu, Xi Wang, Zhe Jiang, Nan Guan

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对智能体RTL代码生成的时序信息传递难题,本研究提出含SeQuery和SeGraph机制的SeqFeed,通过满足三项反馈要求提升LLM的RTL代码生成通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15546 2026-08-19 cs.AI cs.NE 版本更新 81%

ATLAS: Scaffold-Free Algorithm Synthesis by LLMs via Embedding-Guided Quality-Diversity Search

ATLAS:基于嵌入引导的质量多样性搜索的无支架大语言模型算法合成

Danial Yazdani, Mohammad Nabi Omidvar, Yuan Sun, Maksud Ibrahimov, Xiaodong Li

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 ATLAS是基于LLM的无支架全算法合成框架,通过嵌入引导质量多样性搜索解决全算法设计空间问题,在NP难问题上优于相关基线,可保留不同区域的多类算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10319 2026-08-18 cs.SE cs.AI 版本更新 81%

Do Personalized Skills Help Coding Agents? An Empirical Study of Developer Interaction Histories

个性化技能对编码智能体有帮助吗?开发者交互历史的实证研究

Shuyan Huang, Kai Du, Andrew Lan

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过对13位开发者的206个真实会话实验,发现从交互历史提炼的开发者个性化技能改进有限,而汇集自所有开发者的通用技能增益最大且最一致,为编码智能体的个性化策略提供了实证依据。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10267 2026-08-18 cs.LG 版本更新 81%

In-Context Source and Channel Coding

上下文源码与信道编码

Ziqiong Wang, Tianqi Ren, Rongpeng Li, Zhifeng Zhao, Honggang Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) Zhejiang Lab(浙江实验室) Macau University of Science and Technology, China(澳门科学理工学院,中国)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种接收端上下文解码框架,通过改进SSCC的鲁棒性,在不修改发射端的情况下提升低信噪比下的传输性能。

Comments Published in SCIENCE CHINA Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20077 2026-08-14 cs.CV cs.AI 版本更新 81%

The Hidden Evolution of Disguised Visual Context inside the VLM

VLM内部伪装视觉上下文的隐藏演化

Wish Suharitdamrong, Tony Alex, Xiatian Zhu, Muhammad Awais, Sara Atito

机构 * Surrey Institute for People-Centred AI, University of Surrey(萨里大学以人为本人工智能研究所) Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视觉语言模型中视觉令牌如何通过不同集成架构(上下文注入与逐层注入)转化为有意义表示,揭示其内部演化过程及对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03236 2026-08-13 cs.HC cs.CL 版本更新 81%

BLADE: Better Language Answers through Dialogue and Explanations

BLADE:通过对话和解释提升语言答案

Chathuri Jayaweera, Phoebe Huang, Bonnie J. Dorr

机构 * University of Florida(佛罗里达大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BLADE通过引导学习者接触相关教学资源而非直接提供答案,提升学生对课程资源的导航能力和概念理解。

Comments Contains 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24600 2026-08-04 cs.AI 版本更新 81%

Agent-as-Peer-Debriefer: A Multi-Agent Framework with Perspective-Based Refinement for Qualitative Analysis

Agent-as-Peer-Debriefer: 一种基于视角精炼的多智能体定性分析框架

Zhimin Lin, Kun Cheng, Zhiyao Shu, Junhua Fang, Juntao Li, Fan Bai, Jie Gao

机构 * Soochow University(苏州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种多智能体框架,通过模拟同行汇报(peer debriefing)并引入理论驱动、数据驱动和应用三种分析视角,提升大语言模型在定性数据分析中的编码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17394 2026-07-28 cs.NI cs.AI cs.SD 版本更新 81%

Voice-Driven Semantic Perception for UAV-Assisted Emergency Networks

基于语音的语义感知用于无人机辅助应急网络

Nuno Saavedra, Pedro Ribeiro, André Coelho, Rui Campos

机构 * FCT – Fundação para a Ciência e a Tecnologia, I.P.(葡萄牙科学与技术基金会)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SIREN框架,通过整合语音识别与语义提取技术,实现无人机辅助网络的语音驱动感知,提升应急通信的自动化水平和决策支持能力。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.04868 2026-07-17 cs.HC cs.CL cs.DB 版本更新 81%

Beyond Interestingness: Semantic and Context-Aware Natural Language Query Recommendations for Visual Data Analysis

超越趣味性:用于视觉数据分析的语义和上下文感知自然语言查询推荐

Xingbo Wang, Siyuan Li, Furui Cheng, Yong Wang, Jiang Long, Hong Lu, Huamin Qu, Ke Xu

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对分析师分解查询目标的挑战,研究用语义和上下文感知推荐增强自然语言接口,联合整合多种因素引导数据库探索,经多方式评估,QRec-NLI在代理比较和用户研究中表现优于基线。

Comments This is the preprint version of the paper accepted to Visual Informatics journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21369 2026-07-07 cs.CL 版本更新 81%

Findings of the Fifth Shared Task on Multilingual Coreference Resolution: Expanding Datasets for Long-Range Entities

第五届多语言指代消解共享任务成果:扩展长距离实体的数据集

Michal Novák, Miloslav Konopík, Anna Nedoluzhko, Martin Popel, Ondřej Pražák, Jakub Sido, Milan Straka, Zdeněk Žabokrtský, Daniel Zeman

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查理大学,数学与物理学院,形式与应用语言学研究所) University of West Bohemia, Faculty of Applied Sciences, Department of Computer Science and Engineering(西波赫大学,应用科学学院,计算机科学与工程系)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文总结了第五届多语言指代消解共享任务的成果,介绍了通过增加五个新数据集和两种新语言扩展数据集,以解决长距离实体的指代消解问题,并展示了传统系统与基于LLM的方法在任务中的表现。

Comments Accepted to CODI-CRAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01697 2026-06-18 cs.CL 版本更新 81%

RCEM: Robust Conversational Search EMbedder in Distributional Shift

RCEM:配备查询重写技能的嵌入器,用于分布偏移下的鲁棒对话搜索

Kilho Son, Paul Hsu, Cha Zhang, Dinei Florencio

机构 * Microsoft(微软)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出RCEM模型,通过将LLM的查询重写能力蒸馏到嵌入模型中,实现无需显式重写的上下文感知检索,在分布偏移下提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25929 2026-06-18 cs.MA cs.LG 版本更新 81%

Multi-Agent Systems are Mixtures of Experts: Who Becomes an Influencer?

多智能体系统是专家混合:谁成为影响者?

Franka Bause, Jonas Niederle, Martin Pawelczyk, Rebekka Burkholz

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文通过Friedkin-Johnsen意见动力学模型分析多智能体LLM协商机制,揭示输入依赖的FJ参数使系统成为专家混合,并探讨基于自信度、感知自信度和初始观点对齐的影响者形成机制。

Comments Accepted at the 2nd Workshop on Compositional Learning at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09222 2026-06-16 cs.CR cs.AI 版本更新 81%

MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks

MUZZLE: 针对间接提示注入攻击的自适应智能体红队测试框架

Georgios Syros, Evan Rose, Brian Grinstead, Christoph Kerschbaumer, William Robertson, Cristina Nita-Rotaru, Alina Oprea

机构 * Northeastern University(东北大学) Mozilla Corporation(Mozilla公司)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MUZZLE框架,利用智能体轨迹自动识别高显著性注入面,自适应生成上下文相关的恶意指令,评估网络智能体对间接提示注入攻击的安全性,发现44种新攻击和跨应用攻击策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11688 2026-06-11 cs.LG 版本更新 81%

Composing Linear Layers from Irreducibles

从不可约元组合线性层

Travis Pence, Daisuke Yamada, Vikas Singh

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出用Clifford代数将线性层分解为双向量(几何基元)的组合,仅需O(log^2 d)参数,在LLM注意力投影中匹配强基线性能。

Comments 35 Pages, 11 Tables, 6 Figures, Appearing in NeurIPS 2025

Journal ref Advances in Neural Information Processing Systems 38 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08622 2026-06-10 cs.CL cs.SE 版本更新 81%

Automated Alignment between Elicitation Interviews and Requirements

启发式访谈与需求之间的自动对齐

Francesco Dente, Fabiano Dalpiaz, Paolo Papotti

机构 * University of Bologna(博洛尼亚大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出将访谈转录与用户故事需求自动对齐的任务,定义忠实度和覆盖率两个度量,利用大语言模型和嵌入模型实现自动评估,在四个数据集上达到0.86 macro-F1。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02399 2026-06-08 cs.SE cs.AI 版本更新 81%

Towards Iterative End-to-End Software Development: A Feature-Driven Multi-Agent Framework

迈向迭代式端到端软件开发:一种特征驱动的多智能体框架

Junwei Liu, Chen Xu, Chong Wang, Tong Bai, Weitong Chen, Kaseng Wong, Yiling Lou, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EvoDev框架,通过特征分解、依赖建模和上下文传播,实现迭代式端到端软件开发,在Android任务上比Claude Code提升57.3%。

Comments Accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26045 2026-08-04 cs.CL cs.AI 版本更新 81%

Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

激活预言机的置信度与校准:用于语言模型内部的可信解释

Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Turin(都灵大学) University of Southern Denmark(南丹麦大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了6种激活预言机置信度估计方法,发现bootstrap模式频率在校准上优于其他方法(ECE 5.7% vs 25.5%),而log-prob基线可作为快速分诊信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24917 2026-08-03 cs.CL cs.LG 版本更新 81%

Estimating near-verbatim extraction risk in language models with decoding-constrained beam search

通过解码约束束搜索估计语言模型中的近原文提取风险

A. Feder Cooper, Mark A. Lemley, Christopher De Sa, Lea Duesterwald, Allison Casasola, Jamie Hayes, Katherine Lee, Daniel E. Ho, Percy Liang

机构 * AVERI Stanford(斯坦福大学) Cornell(康奈尔大学) Google DeepMind(谷歌DeepMind)

专题命中 其他LLM :language model(title);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出解码约束束搜索方法,以有效估计语言模型中的近原文提取风险,揭示更多可提取序列及模型规模对风险的影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05316 2026-06-08 cs.LG cs.AI 版本更新 81%

Standard vs. Modular Sampling: Best Practices for Reliable LLM Unlearning

标准采样与模块化采样:可靠的大语言模型遗忘的最佳实践

Praveen Bushipaka, Lucia Passaro, Tommaso Cucinotta

机构 * Scuola Superiore Sant’Anna(圣安纳高等学院) University of Pisa(比萨大学)

专题命中 其他LLM :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型遗忘中采样策略的不足,提出模块化实体级遗忘(MELU)策略,通过多样化邻居集和模块化采样平衡遗忘效果与模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05476 2026-07-24 cs.LG 版本更新 80%

Parameter-Free Encoders Remain Viable for RDB Foundation Models

无参数编码器对关系数据库基础模型仍然可行

Linjie Xu, David Wipf

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 研究如何利用关系数据库预测目标列缺失值,对比无参数和参数化编码器,分析标签输入时RDB编码器属性,通过实验验证简单无参数编码器在多基准任务中仍有强大性能。

Comments ICML 2026 Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13804 2026-08-11 cs.SE 版本更新 80%

An Empirical Study of Gemini 3 for Detecting Natural Language Test Smells in Manual Test Cases

Gemini 3 检测手动测试用例中自然语言测试异味的实证研究

Keila Lucas, Rohit Gheyi, Márcio Ribeiro, Fabio Palomba, Luana Martins, Elvys Soares

专题命中 其他LLM :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract_cn)

AI总结 研究使用 Gemini-3-Pro-Preview 通过整体测试用例分析策略检测手动测试用例中的七种测试异味,相比小型语言模型性能更优,并发现平均每步近一个异味。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06620 2026-08-05 eess.AS 版本更新 80%

Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection

预训练模型为何失效:多模态抑郁检测中的特征纠缠

Xiangyu Zhang, Beena Ahmed, Julien Epps

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对预训练模型在多模态抑郁检测中性能差的问题,提出信息分离框架解纠缠混合特征,显著提升了SSL模型和LLMs的检测性能,为相关系统开发提供了新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18673 2026-07-28 cs.MA cs.DC 版本更新 80%

When Coordination Is Avoidable: A Monotonicity Analysis of Organizational Tasks

当协调可避免时:组织任务的单调性分析

Harang Ju

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过单调性分析,证明协调并非所有组织任务必需,并基于分布式系统理论提出判定规则,应用于工作流和任务数据集,发现大量协调支出可避免。

Comments 27 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06452 2026-07-02 cs.HC 版本更新 80%

Code Semantic Zooming

代码语义缩放

Jinsheng Ba, Sverrir Thorgeirsson, Zhendong Su

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于伪代码的CodeZoom方法,通过多层语义抽象迭代探索、理解和优化代码,在用户研究中相比Claude Code显著提升代码理解与控制感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22027 2026-07-01 cs.CL cs.AI cs.LG 版本更新 80%

Shared Lexical Task Representations Explain Behavioral Variability In LLMs

共享的词汇任务表示解释了大语言模型中的行为变异

Zhuonan Yang, Jacob Xiaochen Li, Francisco Piedrahita Velez, Eric Todd, David Bau, Michael L. Littman, Stephen H. Bach, Ellie Pavlick

机构 * Brown University(布朗大学) MIT(麻省理工学院) Northeastern University(东北大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过比较指令式和示例式提示发现,大语言模型在不同提示下行为差异可由共享的词汇任务表示解释,揭示了任务特定注意力头在不同提示风格中的共同机制。

Comments Accepted to ICML 2026. Updated to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏