arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11785 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2608.05223 2026-08-07 cs.SE cs.CR 新提交 67%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05222 2026-08-07 cs.SD eess.AS 新提交 67%

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

Diff-Symbo:基于自回归潜在扩散模型的文本控制长时长符号音乐生成

Zhiwei Lin, Jun Chen, Boshi Tang, Weihao Wu, Yang Jing, Yaolong Ju, Fan Fan, Zhiyong Wu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Diff-Symbo借助LDM与自回归方法,结合含19345个文本模板的数据集,实现了文本控制的长时长高质量符号音乐生成,在多项指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05215 2026-08-07 cs.RO cs.CV 新提交 67%

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型

Jihoon Oh, Kento Kawaharazuka, Kei Okada

机构 * University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。

Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05180 2026-08-07 cs.CY 新提交 67%

The Nuclear Decision-Making Benchmark: Evaluating Frontier LLMs on Nuclear Tendencies

核决策基准:评估前沿大语言模型的核倾向

Benjamin Jensen, Ian Reynolds, Yasir Atalan, Martin Pollack, Austin Woo, Robert Sincero

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究推出核决策基准(NDM Bench),评估7种前沿大语言模型在核相关场景的表现,发现模型间核倾向差异显著,不同模型的行动偏好、一致性及对国家和措辞的响应均存在差异。

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05175 2026-08-07 cs.CY 新提交 67%

Teaching Intro AI When the Tools Can Do the Homework: A Course Redesign and a Student Bill of Rights

当工具能完成作业时教授人工智能入门课程:课程重新设计与学生权利法案

Yusuf Pisan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大型语言模型可完成AI入门课程作业的问题,华盛顿大学博塞尔分校重新设计CSS 382课程,保留经典核心、新增大模型构建模块,重构评估体系,还通过学生参与制定教师AI使用规范。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04523 2026-08-06 cs.CR cs.SE 新提交 67%

Checked-In Secret Detection: Strings Are All You Need

签到式密钥检测:字符串即你所需

Zhengdong Huang, Kevin Li, Jinqiu Yang, Yepang Liu, Lili Wei

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对源代码硬编码密钥检测的现有方法局限,提出基于StringGroup的上下文提取算法及Secretron工具,在SecretBench数据集上F1值达98.74%,可高效检测未知密钥。

Journal ref The ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04482 2026-08-06 cs.IR 新提交 67%

Skills Know Their Neighbors: Cluster-Contrastive Capability Pages for Skill Retrieval

技能了解其邻居:用于技能检索的聚类对比能力页面

Zifei Wang, Wei Wen, Qiang Ji, Ruizhi Qiao

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型智能体技能检索中仅改进检索器无法消除的文档导致的误差,提出聚类对比的能力页面,在SRA-Bench等数据集上显著提升了召回率与任务成功率。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03734 2026-08-05 cs.SE 新提交 67%

We Must Have Missed This Comment: Detecting and Repairing Stale Function References in Linux Kernel Comments

我们一定漏掉了这条注释:检测和修复 Linux 内核注释中的过时函数引用

Kexin Sun, Yunbo Lyu, Xutong Ma, Hongyu Kuang, Ratnadira Widyasari, He Zhang, Xiaoxing Ma, Julia Lawall, David Lo

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对 Linux 内核注释中因函数变更导致的过时引用问题,提出三阶段方法 ReCite 检测并修复此类引用,在 v6.18-rc1 上检测到 869 个过时引用,其修复建议准确率高,提交的 75 个补丁中有 50 个被接受。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03337 2026-08-05 cs.SE 新提交 67%

Assessing Behavioral Validation in UI Component Test Suites Using Inferred Metamorphic Relations

利用推断的变形关系评估UI组件测试套件中的行为验证

Yu Pei, Cunming Zhang, Jeongju Sohn, Mike Papadakis

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00255 2026-08-04 eess.SP 新提交 67%

Artificial Intelligence for Spatially Reconfigurable Antennas: Movable, Fluid, and Pinching Antenna Systems

用于空间可重构天线的人工智能:可移动、流体及捏合天线系统

Nguyen Cong Luong, Zeping Sui, Thai-Hoc Vu, Jie Cao, Bo Ma, Thuan Van Le, Xunyang Zhan, Nguyen Duc Hai, Min Xu, Qiushi Zhao, Dong In Kim, Yonghong Zeng, Shaohan Feng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本综述针对可移动、流体、捏合三类空间可重构天线系统,梳理了深度学习等各类AI技术的应用,探讨了相关开放挑战与未来方向。

Comments 30 pages, 7 figures, submitted to IEEE COMST

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02059 2026-08-04 cs.CV cs.MM 新提交 67%

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

MIEScore:面向多源图像编辑的人类对齐评估方法

Zitong Xu, Huiyu Duan, Xinyun Zhang, Weifei Xiong, Tianyi Zheng, Xiongkuo Min, Qiang Hu, Zhengxue Cheng, Bo Li, Guangtao Zhai

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01848 2026-08-04 cs.CV 新提交 67%

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Technology University(深圳技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01258 2026-08-04 cs.CV 新提交 67%

A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2

多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2

Zirui Zhang, Yinbo Yu, Donghai Guan, Chunwei Tian, Daoqiang Zhang, Qi Zhu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01157 2026-08-04 cs.CV 新提交 67%

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

InteracVid:基于直播聊天视频构建真实交互式视听响应数据集

Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00839 2026-08-04 cs.CY cs.HC 新提交 67%

CodeStylist: Supporting Early Undergraduate Programmers with Course-Aware Code Style Feedback

CodeStylist:面向早期本科编程学习者的课程感知代码风格反馈支持工具

Ethan Dickey, Libra Vento, Peter Kurto, Andres Bejarano

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究开发了支持课程特定标准的CodeStylist工具,用于为早期本科编程学习者提供本地化代码风格反馈,专家评审显示其有应用前景但存在信任度不足等问题,需优化工具设计。

Comments 9 pages, 1 table, 1 figure, accepted for publication at Frontiers in Education 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00824 2026-08-04 cs.SE 新提交 67%

Structure-Aware Semantic Chunking with Title-Chain Prefixes: A 1600-Query Evaluation and the Measurement Trap in Text-Transform Ablations

结合标题链前缀的结构感知语义分块:1600次查询评估及文本变换消融实验中的测量陷阱

Yang Yang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出仅在分块侧的三阶段语义分块流水线,经1600次查询评估提升RAG的MRR@5,还发现分块研究中存在的测量陷阱并推荐检索时每个候选前缀评估的方向。

Comments 8 pages, 1 table. Replication package: DOI 10.5281/zenodo.21744653

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00624 2026-08-04 cs.SE 新提交 67%

Can Perplexity Serve as a Cognitive Signal for Code Understandability?

困惑度能否作为代码可理解性的认知信号?

Xiaokai Rong, Mohammadali Sefidi Esfahani, Aashish Yadavally, Rigby Peter, Tien N. Nguyen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究通过实证发现,词元级困惑度的简单片段级聚合与人类代码可理解性相关性不可靠,明确其仅适用于局部代码困惑,需经特定分析才能用于可靠的代码可理解性测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00134 2026-08-04 cs.CR 新提交 67%

Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks

有状态协作智能体防御大型语言模型抵御演进式多轮攻击

Siyuan Li, Zehao Liu, Haoyu Li, Xi Lin, Ning Liu, Jun Wu, Jianhua Li, Mohsen Guizani

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出一种主动防御框架,通过协作多智能体架构结合干扰、误导与自适应策略,在EMRA数据集上使LLMs对抗多轮攻击的ASR平均降低69%,同时提升DR与攻击者token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00068 2026-08-04 cs.CV 新提交 67%

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准

Yi Cui, Zilin Wang, Yijie Xu, Qianyi Cai, Huizai Yao, Shuai Jiang, Bingzhuo Zhong, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。

Comments Accepted by KDD 2026. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01546 2026-08-04 physics.ao-ph cs.SE physics.comp-ph physics.flu-dyn 新提交 67%

FESOM2-JAX v1.0: a differentiable shadow of the ocean-sea-ice model FESOM2, cast onto GPUs

FESOM2-JAX v1.0:适配GPU的海冰-海洋模型FESOM2的可微镜像版本

Nikolay V. Koldunov, Sergey Danilov, Suvarchal Cheedela, Dmitry Sidorenko, Sebastian Beyer, Patrick Scholz, Ivan Kuznetsov, Jan Streffing, Aleksei Koldunov, Dmitrii Pantiukhin, Svetlana N. Loza, Thomas Jung

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 FESOM2-JAX v1.0是FESOM2基于JAX的可微GPU版本,与原Fortran版本结果一致,具备端到端可微性,是首个CMIP级非结构化网格可微全球海冰-海洋模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29604 2026-08-03 cs.CR 新提交 67%

CWEEP: A Lexical Static Analysis Framework for CWE Early Prevention

CWEEP:用于CWE早期预防的词法静态分析框架

Bryan Kwan, Benjamin Tan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CWEEP是一种用于RTL安全弱点检测的静态分析框架,无需详细安全规范即可在RTL开发早期使用,能定位漏洞并提供修复建议,在3874个有漏洞模块数据集上的正确警告率达60.8%,远优于同类工具。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29222 2026-08-03 cs.CV 新提交 67%

Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?

Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao, Ronghao Xian, Yao Jiang, Zhao Gao, Keren Fu, Qijun Zhao, Jian Cheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。

Comments 10 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29192 2026-08-03 cs.CV 新提交 67%

Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification

用于小样本遥感场景分类的局部一致直推式信息最大化

Karim El Khoury, Benoît Gérin, Benoît Macq, Christophe De Vleeschouwer

机构 * ICTEAM, UCLouvain(天主教鲁汶大学 ICTEAM 研究所)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 针对小样本遥感场景分类问题,提出LC-TIM方法,融合多源遥感基础模型亲和图,建立首个直推式小样本遥感场景分类基准,实验表明其性能优于现有方法。

Comments Accepted at ECCVW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28825 2026-08-03 cs.SE 新提交 67%

Building a Process-Modeling Tool using Agentic AI: An Experience Report on PM4Py-UCM

使用智能体AI构建流程建模工具:PM4Py-UCM的经验报告

Daniel Amyot

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文通过AI辅助构建开源流程建模工具PM4Py-UCM的深入案例,提出相关工具包与分类法,总结了开发经验教训及验证策略。

Comments 17 pages, 9 figures, 4 tables, submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28133 2026-07-31 econ.GN q-fin.EC 新提交 67%

AI Sycophancy and Decisions

AI 奉承与决策

John Conlon, Peter Schwardmann

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究通过1500名参与者的30项决策实验,发现奉承式AI建议平均使选择去极化,虽奉承程度会削弱该效应,且市场力量不会引发更大极化效应,缓解了相关担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27893 2026-07-31 cs.SE 新提交 67%

A comparative analysis of automated techniques for security bug report identification

安全漏洞报告自动识别技术的对比分析

Muhammad Laiq

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文对比分析了逻辑回归、SetFit等多种安全漏洞报告自动识别技术,发现SetFit整体性能最优,GPT-5.2表现较差,迁移学习对不同数据量项目的性能影响存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27806 2026-07-31 cs.CV 新提交 67%

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

LoMeVQA:纵向医学视觉问答综合基准

Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。

Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27378 2026-07-31 cs.CV cs.MM 新提交 67%

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

PanDent:面向牙科放射学中全面的牙级结构-语言一致性

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) Imperial College London(帝国理工学院) University of Science and Technology of China(中国科学技术大学) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28210 2026-07-31 physics.ed-ph 新提交 67%

AI-based scoring systematically underestimates conceptual understanding of linguistically weak students' explanations in physics

基于人工智能的评分系统低估了语言薄弱学生在物理解释中的概念理解能力

Markus S. Feser, Paul L. Tschisgale

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究发现,所有AI评分方法均存在低估语言薄弱学生物理解释中概念理解的语言偏见,类似物理教师的相关偏见,多语言学习者受影响最大。

Comments Shared lead authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26843 2026-07-30 cs.SE 新提交 67%

When Knowledge Changes: Metamorphic Testing of RAG Systems with Mutations

当知识发生变化时:面向RAG系统的变异体态测试

Jinhan Kim, Samuele Pasini, Paolo Tonella

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对现有RAG系统评估方法无法检测语料库演变带来的故障问题,提出含11个变异算子的体态测试框架,实验显示其F1分数远优于RAGAS,可有效评估RAG系统在语料库变化下的一致性。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏