arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2608.10646 2026-08-12 cs.MA 新提交 67%

ASCon: A Direction-Aware Reciprocal Agent--Step Contextualization Model for Failure Attribution in Multi-Agent Systems

ASCon:面向多智能体系统故障归因的方向感知互惠智能体-步骤上下文模型

Shuyu Jiang, Yue Ran, Kaiyu Xu, Xingshu Chen, Yi Zhang, Hao Ren, Rui Tang, Tianwei Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对多智能体系统故障归因中不同目标间证据依赖关注不足的问题,提出ASCon模型,通过方向感知图注意力等技术聚合轨迹证据,提升了故障智能体、步骤、模式的检测性能及域外归因能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10396 2026-08-12 cs.CV 新提交 67%

FormStruct-Bench:A Hierarchical and Diagnostic Benchmark for Table-Form Document Structure Recognition

FormStruct-Bench:面向表格型文档结构识别的分层诊断基准

Lujie Ban, Jiangtao Zhu, Yuanheng Yu, Jiasheng Shi, Chenhao Ma

专题命中 评测与基准 :SFT(abstract,abstract_cn)

AI总结 该研究提出FormStruct-Bench基准,通过分层评估表格型文档结构识别,发现现有系统在细粒度结构恢复上远弱于内容读取,为相关任务提供诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10882 2026-08-12 cs.SE quant-ph 新提交 67%

From Pattern Detection to Composition Analysis in Quantum Software

从量子软件中的模式检测到组合分析

Neilson Carlos Leite Ramalho, Erico Augusto da Silva, Anthony Accioly, Higor Amario de Souza, Marcos Lordello Chaim

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究扩展了量子模式挖掘工具,经评估其在Qrisp上准确率提升,构建了模式组件调用组合图并发布相关流水线、知识库与数据集,支持量子模式采用与演化的可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09552 2026-08-11 cs.DL 新提交 67%

Does ChatGPT score research quality differently by gender?

ChatGPT是否会按性别对研究质量给出不同评分?

Kayvan Kousha, Mike Thelwall

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究利用REF2021的近9万篇论文,发现ChatGPT对男性第一作者论文的评分略高于女性,此差异在部分学科更明显,提示AI研究评估需谨慎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09294 2026-08-11 cs.HC 新提交 67%

Graphing the Everyday: A Neurosymbolic Approach to Eliciting Routines for Just-In-Time Adaptive Interventions

描绘日常:用于触发即时自适应干预的神经符号方法

Shakyani Jayasiriwardene, Blake Mountford, Meican Ma, Niels van Berkel, Nicholas Koemel, Matthew Ahmadi, Jorge Goncalves, Emmanuel Stamatakis, Zhanna Sarsenbayeva

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究结合LLMs与Neo4j知识图谱的神经符号管道,针对JITAIs面临的对话转日程难题,发现心智模型差距与生态不匹配问题,提出设计启发法以构建支持健康行为改变的主动智能体。

Comments Accepted at OzCHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09147 2026-08-11 cs.CV 新提交 67%

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

RefineAny3D:作为语义对齐的深度细化用于单目3D检测

Zhihao Zhang, Gengwei Zhang, Tianlong Chen, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 67%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07993 2026-08-11 cs.CV 新提交 67%

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

MRBench:用于人体动作-文本检索的综合基准

Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出综合动作-文本检索基准MRBench,针对现有基准缺陷构建,提出轻量级粒度感知模型,提升混合粒度检索效果,为动作-语言对齐评估提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07036 2026-08-10 cs.SE cs.CV 新提交 67%

CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams

CAS2UML:用于类图和活动图的手绘草图到PlantUML数据集

Simon Scholz, Mersedeh Sadeghi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CAS2UML是含557幅手绘类图与活动图及对应PlantUML代码的公开数据集,配套验证工具与脚本,可实现草图转UML方法的可复现基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06908 2026-08-10 cs.CL cs.AI cs.CY cs.LG 新提交 67%

Calibrating WEAT Against Anisotropy: ZCA Whitening as a Geometric Pre-Processing Step for Embedding Association Tests

针对各向异性校准WEAT:将ZCA白化作为嵌入关联测试的几何预处理步骤

Seitaro Ono, Senna Ross, Jun Saiki

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出将ZCA白化作为预处理步骤校准WEAT,可降低嵌入空间各向异性,超30%WEAT结果显著性改变,提升语义相似度,为相关偏差测量提供更可靠基础。

Comments Extended version (with appendices) of a paper accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06620 2026-08-10 cs.SE 新提交 67%

Understanding the Energy Impact of Software Refactoring: A Workload-Aware Study of Controlled Examples and Real-World Commits

理解软件重构的能源影响:一项针对受控示例与真实提交的工作负载感知研究

Haibo Wang, Heng Li, Shin Hwei Tan

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究通过微基准与真实世界基准的大规模实证分析,发现重构的能源影响受工作负载显著影响,现有方法无法可靠识别重构引发的能源回归,需开发更准确的预测技术。

Comments This manuscript is currently under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05507 2026-08-07 eess.AS 新提交 67%

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

AffectDF:针对情感表达型攻击的最全面语音深度伪造检测基准

Aurosweta Mahapatra, Xiutian Zhao, Shreeram Suresh Chandra, Zihan Zhang, Zongyang Du, Ismail Rasim Ulgen, Kong Aik Lee, Nicholas Andrews, Carlos Busso, Berrak Sisman

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 该研究提出涵盖多类情感表达型语音伪造攻击的AffectDF基准,实验发现常规训练的SDD系统在该基准上鲁棒性严重下降,为开发更鲁棒的检测模型提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05495 2026-08-07 cs.CR cs.HC 新提交 67%

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案

He Zhang, Feilong Li, Dingning Long, Yilin Cui, Peijun Zhang, Yuewen Zhang, Qianyao Xu, Xinyi Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。

Comments This work has been accepted as a poster to UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 67%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05222 2026-08-07 cs.SD eess.AS 新提交 67%

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

Diff-Symbo:基于自回归潜在扩散模型的文本控制长时长符号音乐生成

Zhiwei Lin, Jun Chen, Boshi Tang, Weihao Wu, Yang Jing, Yaolong Ju, Fan Fan, Zhiyong Wu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Diff-Symbo借助LDM与自回归方法,结合含19345个文本模板的数据集,实现了文本控制的长时长高质量符号音乐生成,在多项指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05215 2026-08-07 cs.RO cs.CV 新提交 67%

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型

Jihoon Oh, Kento Kawaharazuka, Kei Okada

机构 * University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。

Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05180 2026-08-07 cs.CY 新提交 67%

The Nuclear Decision-Making Benchmark: Evaluating Frontier LLMs on Nuclear Tendencies

核决策基准:评估前沿大语言模型的核倾向

Benjamin Jensen, Ian Reynolds, Yasir Atalan, Martin Pollack, Austin Woo, Robert Sincero

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究推出核决策基准(NDM Bench),评估7种前沿大语言模型在核相关场景的表现,发现模型间核倾向差异显著,不同模型的行动偏好、一致性及对国家和措辞的响应均存在差异。

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05175 2026-08-07 cs.CY 新提交 67%

Teaching Intro AI When the Tools Can Do the Homework: A Course Redesign and a Student Bill of Rights

当工具能完成作业时教授人工智能入门课程:课程重新设计与学生权利法案

Yusuf Pisan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大型语言模型可完成AI入门课程作业的问题,华盛顿大学博塞尔分校重新设计CSS 382课程,保留经典核心、新增大模型构建模块,重构评估体系,还通过学生参与制定教师AI使用规范。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04523 2026-08-06 cs.CR cs.SE 新提交 67%

Checked-In Secret Detection: Strings Are All You Need

签到式密钥检测:字符串即你所需

Zhengdong Huang, Kevin Li, Jinqiu Yang, Yepang Liu, Lili Wei

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对源代码硬编码密钥检测的现有方法局限,提出基于StringGroup的上下文提取算法及Secretron工具,在SecretBench数据集上F1值达98.74%,可高效检测未知密钥。

Journal ref The ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04482 2026-08-06 cs.IR 新提交 67%

Skills Know Their Neighbors: Cluster-Contrastive Capability Pages for Skill Retrieval

技能了解其邻居:用于技能检索的聚类对比能力页面

Zifei Wang, Wei Wen, Qiang Ji, Ruizhi Qiao

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型智能体技能检索中仅改进检索器无法消除的文档导致的误差,提出聚类对比的能力页面,在SRA-Bench等数据集上显著提升了召回率与任务成功率。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03734 2026-08-05 cs.SE 新提交 67%

We Must Have Missed This Comment: Detecting and Repairing Stale Function References in Linux Kernel Comments

我们一定漏掉了这条注释:检测和修复 Linux 内核注释中的过时函数引用

Kexin Sun, Yunbo Lyu, Xutong Ma, Hongyu Kuang, Ratnadira Widyasari, He Zhang, Xiaoxing Ma, Julia Lawall, David Lo

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对 Linux 内核注释中因函数变更导致的过时引用问题,提出三阶段方法 ReCite 检测并修复此类引用,在 v6.18-rc1 上检测到 869 个过时引用,其修复建议准确率高,提交的 75 个补丁中有 50 个被接受。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03337 2026-08-05 cs.SE 新提交 67%

Assessing Behavioral Validation in UI Component Test Suites Using Inferred Metamorphic Relations

利用推断的变形关系评估UI组件测试套件中的行为验证

Yu Pei, Cunming Zhang, Jeongju Sohn, Mike Papadakis

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00255 2026-08-04 eess.SP 新提交 67%

Artificial Intelligence for Spatially Reconfigurable Antennas: Movable, Fluid, and Pinching Antenna Systems

用于空间可重构天线的人工智能:可移动、流体及捏合天线系统

Nguyen Cong Luong, Zeping Sui, Thai-Hoc Vu, Jie Cao, Bo Ma, Thuan Van Le, Xunyang Zhan, Nguyen Duc Hai, Min Xu, Qiushi Zhao, Dong In Kim, Yonghong Zeng, Shaohan Feng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本综述针对可移动、流体、捏合三类空间可重构天线系统,梳理了深度学习等各类AI技术的应用,探讨了相关开放挑战与未来方向。

Comments 30 pages, 7 figures, submitted to IEEE COMST

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02059 2026-08-04 cs.CV cs.MM 新提交 67%

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

MIEScore:面向多源图像编辑的人类对齐评估方法

Zitong Xu, Huiyu Duan, Xinyun Zhang, Weifei Xiong, Tianyi Zheng, Xiongkuo Min, Qiang Hu, Zhengxue Cheng, Bo Li, Guangtao Zhai

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01848 2026-08-04 cs.CV 新提交 67%

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Technology University(深圳技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01258 2026-08-04 cs.CV 新提交 67%

A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2

多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2

Zirui Zhang, Yinbo Yu, Donghai Guan, Chunwei Tian, Daoqiang Zhang, Qi Zhu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01157 2026-08-04 cs.CV 新提交 67%

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

InteracVid:基于直播聊天视频构建真实交互式视听响应数据集

Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00839 2026-08-04 cs.CY cs.HC 新提交 67%

CodeStylist: Supporting Early Undergraduate Programmers with Course-Aware Code Style Feedback

CodeStylist:面向早期本科编程学习者的课程感知代码风格反馈支持工具

Ethan Dickey, Libra Vento, Peter Kurto, Andres Bejarano

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究开发了支持课程特定标准的CodeStylist工具,用于为早期本科编程学习者提供本地化代码风格反馈,专家评审显示其有应用前景但存在信任度不足等问题,需优化工具设计。

Comments 9 pages, 1 table, 1 figure, accepted for publication at Frontiers in Education 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00824 2026-08-04 cs.SE 新提交 67%

Structure-Aware Semantic Chunking with Title-Chain Prefixes: A 1600-Query Evaluation and the Measurement Trap in Text-Transform Ablations

结合标题链前缀的结构感知语义分块:1600次查询评估及文本变换消融实验中的测量陷阱

Yang Yang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出仅在分块侧的三阶段语义分块流水线,经1600次查询评估提升RAG的MRR@5,还发现分块研究中存在的测量陷阱并推荐检索时每个候选前缀评估的方向。

Comments 8 pages, 1 table. Replication package: DOI 10.5281/zenodo.21744653

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00624 2026-08-04 cs.SE 新提交 67%

Can Perplexity Serve as a Cognitive Signal for Code Understandability?

困惑度能否作为代码可理解性的认知信号?

Xiaokai Rong, Mohammadali Sefidi Esfahani, Aashish Yadavally, Rigby Peter, Tien N. Nguyen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究通过实证发现,词元级困惑度的简单片段级聚合与人类代码可理解性相关性不可靠,明确其仅适用于局部代码困惑,需经特定分析才能用于可靠的代码可理解性测量。

详情

展开后加载摘要…

URL PDF HTML 收藏