arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3048 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3048 篇

2607.13987 2026-07-16 cs.CR 新提交 75%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13035 2026-07-16 cs.CL cs.AI cs.LG cs.SE 新提交 75%

FixItFlow: Automated Troubleshooting Guide Generation from Cloud Incidents

FixItFlow:从云事件中自动生成故障排除指南

Srihari Unnikrishnan, Jaskaran Singh Walia, Drishti Goel, Supriyo Ghosh

机构 * Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Inception

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对云事件手动创建故障排除指南的问题,提出FixItFlow系统,利用大语言模型从历史事件数据生成指南,能提取诊断模式、合成结构化指南并严格验证,经评估可提升事件响应,减轻团队文档负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12290 2026-07-15 eess.AS cs.AI cs.CL cs.LG cs.SD 新提交 75%

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

缺失之音:音频-语言嵌入模型在处理否定时存在困难

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(国家台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(国家台湾大学人工智能卓越研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究音频-语言嵌入模型在处理否定时的问题,引入NegEval-Audio框架将数据集转换为否定感知任务,发现模型在否定情况下性能大幅下降,肯定偏差是缺陷,需明确否定感知训练目标。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11354 2026-07-14 cs.IR 新提交 75%

User Preference Induction with LLMs for Offline Top-N Recommendation Evaluation

基于大语言模型的用户偏好归纳用于离线 Top-N 推荐评估

David Otero, Javier Parapar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对离线 Top-N 推荐评估依赖不完整相关性信息的问题,提出基于大语言模型的框架,通过归纳用户偏好及判断候选项目相关性来扩展判断,提升评估稳健性并减轻流行度敏感失真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10738 2026-07-14 cs.LG cs.AI cs.CL 新提交 75%

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

回答还是弃权:通过弃权感知强化学习减轻搜索代理幻觉

Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型训练范式易加剧搜索代理幻觉的问题,提出弃权感知强化学习(AWA-RL),利用模型能力动态塑造弃权奖励,并引入RA-F1指标,实验表明该方法有效提升了搜索代理的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05742 2026-07-08 cs.HC 新提交 75%

PERSONAJUDGE: Simulating Individual Human Preference Judgments with Evaluator-Specific Demonstration Data

PERSONAJUDGE:使用特定评估者的示范数据模拟个体人类偏好判断

Zeyu He, Xuan Qi, Subramanian Chidambaram, Zhichao Xu, Vinayak Arannil, Lydia Chilton, Alex C. Williams

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型作评判时忽略个体评估者差异的问题,提出结合分类判断与特定评估者辅助数据的模拟方法,经实证研究发现该方法有改进,推理痕迹作用大,还明确了模拟难度及相关属性,为个性化评估提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04688 2026-07-07 cs.LG cs.AI cs.CE cs.CL 新提交 75%

URSA: Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment

URSA:用于功利性逆合成评估的化学感知基准测试

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Anton Morgunov, Arkadii Lin, Maksim Kuznetsov, Rim Shayakhmetov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(Insilico Medicine AI有限公司) Independent researcher(独立研究者) Insilico Medicine Canada Inc.(Insilico Medicine加拿大公司) Insilico Medicine Hong Kong Ltd.(Insilico Medicine香港有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对药物发现中合成规划任务,介绍URSA评估框架,能从形式和化学合理性角度评估合成路线,全面评估传统及基于大语言模型的逆合成解决方案,发现大语言模型在解决合成规划任务上不如专业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04623 2026-07-07 cs.SE cs.DC 新提交 75%

Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning

大语言模型真的能恢复微服务故障吗?对诊断到行动推理的恢复感知评估

Jiaxing Qi, Zhongzhi Luan, Hongyu Zhang, Shaohan Huang, Carol Fung, Yongxin Tong, Hailong Yang, Depei Qian

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型在云原生微服务系统中恢复故障的能力,提出R2Act框架,定义相关内容并实例化为基准数据集,评估多种方法,发现恢复失败多因难以将诊断证据转化为有效恢复行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03884 2026-07-07 cs.SE 新提交 75%

LogNLQ: Natural-Language Log Querying with Parser-Induced and Semantically Grounded Schemas

LogNLQ:基于解析器诱导和语义基础模式的自然语言日志查询

Juepeng Wang, Jinyang Liu, Zhuangbin Chen, Zibin Zheng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究自然语言日志查询难题,提出LogNLQ框架,通过解析日志成表、双粒度语义标注及语义搜索获取候选模式,结合大语言模型生成可执行SQL,还引入LogNLQ-Bench,实验证明其性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03440 2026-07-07 cs.IR 新提交 75%

Improving Access to Historical Archives with Real-time RAG-based Systems

利用基于实时检索增强生成(RAG)的系统改善对历史档案的访问

Stergios Konstantinidis, Hayman Lotfy, Alexis Erne, Faruk Zahiragic, Min-Yen Kan, Michalis Vlachos

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对数字化历史档案访问难题,提出集成大语言模型的端到端框架,含OCR优化模块和语义检索重排管道,实验表明能减少OCR错误并提升检索效果,使档案系统更具交互性和语义可搜索性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交 75%

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00345 2026-07-02 cs.SE 新提交 75%

Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore

注册表治理的智能体生命周期:通过评估驱动的注册、晋升和退役在 AWS AgentCore 上完善 EDDOps

Richard Kang, Vincent Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 提出 EDDOps 在 AWS Bedrock AgentCore 上的实践实例,通过成本-性能框架和注册表治理,将模型选择从基准排名转化为受治理的经济决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22000 2026-06-23 cs.AI cs.CL cs.LG cs.SE 新提交 75%

CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents

CFAgentBench:面向自主建筑金融智能体的可复现环境与基准测试

Rishi Srivastava

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CFAgentBench,一个可复现的建筑金融智能体基准,包含1014个任务、35个模拟应用,通过功能正确性评分,强调资金流动防护,实验表明单次准确率高估了部署能力。

Comments 28 pages, 2 figures, 13 tables. Benchmark, environment spec, and app contract released. First open-weight three-model sweep (k=5) on a 40-task oracle-validated executable suite; frontier-model leaderboard committed in the roadmap

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21810 2026-06-23 cs.SE 新提交 75%

GitReq: A Gold Standard Dataset for Software Quality Requirements

GitReq:软件质量需求的金标准数据集

Farha Kamal, Md Humaun Kabir, Md Rakibul Islam

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GitReq数据集,包含6302条专家验证的软件质量需求,覆盖8个ISO/IEC 25010:2011质量类别,通过三重信号挖掘和人工标注构建,零样本评估GPT-5.2达到最高宏平均F1为0.641。

Comments Accepted at The 24th IEEE/ACIS International Conference on Software Engineering Research, Management and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19814 2026-06-19 cs.SE 新提交 75%

CoRaCommit: A VS Code Extension for Commit Message Generation with Exemplar Retrieval

CoRaCommit: 一种基于范例检索的提交消息生成的 VS Code 扩展

Chaoran Cai, Bo Xiong, Chong Wang, Lulu He, Peng Liang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出 CoRaCommit VS Code 扩展,通过检索相似提交范例作为提示上下文、并行调用多个大语言模型生成候选消息并基于用户反馈动态推荐,在 ApacheCM 数据集上优于现有扩展。

Comments 17 pages, 6 images, 3 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18262 2026-06-18 cs.HC 新提交 75%

When Prompts Mislead: Textual Dominance and Diagnostic Bias in MLLMs

当提示误导:多模态大语言模型中的文本主导与诊断偏差

Inhyuk Park, Doohyun Park

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。

Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18134 2026-06-17 eess.AS 新提交 75%

Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning

通过说话人日志条件将口语大语言模型扩展到多说话人音频

Alexander Polok, Samuele Cornell, Sathvik Udupa, Jan Černocký, Shinji Watanabe, Lukáš Burget

专题命中 评测与基准 :SLM(abstract,abstract_cn);language model(abstract)

AI总结 提出基于说话人日志条件的口语语言模型,通过条件化声学编码器提取目标说话人表示,避免序列化输出训练导致的灾难性遗忘,在多个数据集上显著提升说话人属性转录性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17433 2026-06-17 cs.CV 新提交 75%

LADBench: A Benchmark for Logical Fault Detection in Images

LADBench: 图像中逻辑故障检测的基准

Sahasra Kondapalli, Lara Radovanovic, Aadi Palnitkar, Mingyang Mao, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);prompting(abstract)

AI总结 提出LAD-Bench基准,包含1000多张合成图像的四域逻辑异常,通过分层提示协议评估模型,揭示现有VLM在隐式逻辑故障检测上的不足。

Comments Accepted to the IEEE International Conference on Development and Learning (ICDL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13204 2026-06-12 cs.IR 新提交 75%

CoDeR: Local Constraint-Compatible Retrieval Beyond Semantic Similarity

CoDeR: 超越语义相似性的局部约束兼容检索

Xingkun Yin, Xuebin Tang, Hongyang Du

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对约束敏感查询中语义相似性作为相关性代理的失效问题,提出CoDeR方法,通过分离主题相关性与约束兼容性,利用对比学习训练兼容性评分器,在不调用外部大模型的情况下实现约束兼容检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07516 2026-06-12 math.PR 新提交 75%

Counterintuitive problems in discrete probability

离散概率中的反直觉问题

Luca Avena, Gianmarco Bet, Bernardo Busoni

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文收集了一系列离散概率中的反直觉问题及详细解答,旨在挑战启发式推理,评估大语言模型在概率推理中的认知偏差。

Comments Feedback on possible mistakes or typos and suggested additions to the list of problems are welcome at the email address of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11205 2026-06-11 cs.LG cs.AI cs.CL 新提交 75%

Dual-Stance Evaluation of Sycophancy: The Structure of Agreement and the Limits of Intervention

谄媚的双立场评估:同意的结构与干预的局限

Matthew James Buchan

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双立场评估方法,发现激活引导在减少谄媚时也会抑制对事实正确陈述的同意,揭示了表示可读但不可写的普遍差距。

Comments 18 pages, 9 figures, accepted to TAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11199 2026-06-11 cs.CL cs.AI cs.IR cs.LG 新提交 75%

NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track

NightFeats @ MMU-RAGent NeurIPS 2025: 面向文本到文本轨道的上下文优化多智能体RAG系统

Quentin Fever, Naziha Aslam

机构 * NightFeats

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种结构化多智能体RAG系统NightFeats,通过检索、策展和组合三阶段分解知识合成,引入时序语义重排序、矛盾协调和引用保留架构,在MMU-RAGent竞赛中超越商业基线。

Comments 5 pages, 1 figure, 1 table. NeurIPS 2025 Competition Track (MMU-RAGent). System developed October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09595 2026-06-09 cs.IR 新提交 75%

Popcorn: A Configurable Benchmark for Visual Evidence in Multimodal Movie Recommendation

Popcorn: 多模态电影推荐中视觉证据的可配置基准

Ali Tourani, Fatemeh Nazary, Yashar Deldjoo, Tommaso Di Noia

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出Popcorn基准,通过配置合同标准化多模态电影推荐中的视觉证据(全片、预告片、缩略图)的嵌入、融合与评估,实验表明视觉源不可互换且影响推荐性能。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09380 2026-06-09 cs.LG cs.AI cs.CL 新提交 75%

Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

推理竞技场:当可验证奖励不足时的轨迹锦标赛

Han Zhou, Adam X. Yang, Laurence Aitchison, Anna Korhonen, Albert Q. Jiang

机构 * University of Cambridge(剑桥大学) Mistral AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出推理竞技场框架,通过轨迹锦标赛将无梯度信号的非多样奖励组转化为相对奖励信号,结合Bradley-Terry模型高效整合强化学习,在数学和编码基准上平均提升7.6%,加速训练27%-41%。

Comments 9 pages, 6 figures, 2 tables (17 pages including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08426 2026-06-09 cs.HC 新提交 75%

CritLens: Visual Analytics for Criteria Discovery in Review-Based Decision Making

CritLens:基于评论决策中标准发现的视觉分析

Hongjia Wu, Shuai Zhou, Hongxin Zhang, Wei Chen

专题命中 评测与基准 :LLM(summary_cn,abstract_cn)

AI总结 提出CritLens系统,利用LLM将评论转化为AHP决策模型,通过嵌入空间覆盖缺口检测、交互式权重调整和多级记分卡,支持用户迭代发现和验证个性化决策标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23519 2026-07-28 cs.CY cs.AI cs.CL 新提交 74%

Auditing Alignment Controllability in LLMs via Political Axes

通过政治轴审计大语言模型中的对齐可控性

Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 研究通过对7个大语言模型进行基于提示可控性的压力测试,探讨其在政治轴上的对齐可控性,发现上下文框架起主要作用,模型移动方式有别,强调政治坐标审计需考虑分散性等可控性因素,并发布相关数据和代码。

Comments 17 pages, 6 figures, 4 tables. Accepted at AIES 2026 (AAAI/ACM Conference on AI, Ethics, and Society). This version includes the supplementary appendix. Code and data: https://github.com/mbrcic/llm-political-steerability (Zenodo DOI 10.5281/zenodo.21489805)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24334 2026-08-26 cs.CV cs.CL cs.GR 新提交 74%

SeMoCo: A Semantic-First Motion Codec for Motion Language Modeling

SeMoCo:面向运动语言建模的语义优先运动编解码器

Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng

机构 * Jilin University(吉林大学) Frontier Robotics(前沿机器人公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 SeMoCo是面向运动语言建模的语义优先运动编解码器,搭配双轴运动生成器,构建了Ω-MotionVerse数据集,在重构精度与文本到运动生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16246 2026-08-18 cs.CR cs.AI 新提交 74%

CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills

CompoSkill:通过可单独通过扫描器的大语言模型智能体技能实现的组合技能链攻击

Mingxiao Liu, Zhoumian Jiang, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 CompoSkill框架揭示现有单技能认证的自主AI智能体存在系统性缺口,其通过双攻击者系统构造组合技能链攻击,在白、黑盒设置下分别实现83.3%、80.6%的风险链形成率,现有扫描器拦截效果有限。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15092 2026-08-18 cs.CR cs.AI cs.SE 新提交 74%

WeSCE: A Benchmark for Measuring Security Drift in LLM-Driven Code Editing

WeSCE:用于测量大语言模型驱动的代码编辑中安全漂移的基准

Zhiyu Zhang, Tingyue Wen, Senke Sun, Dengxiang Liang, Enhao Huang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 该研究推出WeSCE基准,针对仅指定功能目标的弱安全约束下的代码编辑,提出连续风险表示与漂移度量,以量化代码编辑中的安全漂移,为安全评估提供多尺度视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15046 2026-08-18 cs.LG 新提交 74%

Certifying Compressed Language Models: An Audit and a Statistical Toolkit

压缩语言模型的验证:审计与统计工具包

Amogh Singh

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 本文针对压缩语言模型等价声明的证据不足问题,开展17项等价声明的预注册审计,提出配对等价测试的报告标准,发布相关输出与代码。

Comments 109 pages, 3 figures, 20 tables. Artifacts and per-item outputs: doi.org/10.5281/zenodo.21939143

详情

展开后加载摘要…

URL PDF HTML 收藏