arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11785 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2608.15595 2026-08-18 cs.SE 新提交 67%

AutoSQL: Extracting SQL Templates from Imperative ORM Code in Large-Scale Repositories

AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板

Junsong Pu, Yichen Li, Zhuangbin Chen, Zhihan Jiang, Zibin Zheng

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。

Comments Accepted to ASE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 67%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15058 2026-08-18 cs.CV 新提交 67%

MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring

MEDR:基于多信号事件建模与动态重评分的查询无关帧选择

Xinlei Pu, Weijie Shi, Wen Yang, Yi Cao, Hao Chen, Yuanjun Liu, Wenwei Ding, Jia Zhu, Jiajie Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14418 2026-08-17 cs.CR 新提交 67%

STINER: Automated Extraction of Strategic Cyber Threat Intelligence from X

STINER:从X平台自动提取战略网络威胁情报

Yasir Ech-Chammakhy, Oussama Azrara, Jaafar Chbili, Anas Motii

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对社交媒体CTI提取难题,提出STINER分类体系与语料库,经测试DarkBERT等领域适配编码器表现最优,还利用STINER-DarkBERT完成了2025年上半年欧洲威胁态势分析。

Comments Accepted at RAID 2026 (29th International Symposium on Research in Attacks, Intrusions and Defenses)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14315 2026-08-17 cs.SE 新提交 67%

Breaking Models to Test the Judge: A Mutation Testing Approach for Semantic Evaluators of Domain Class Diagrams

破坏模型以测试评判器:面向领域类图语义评估器的变异测试方法

Kevin Delcourt, Meriem Ben Chaaben, Abdelhamid Rouatbi, Luciano Marchezan, Houari Sahraoui

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对领域类图语义评估器,提出一种变异测试方法,通过注入语义缺陷生成变体并评估评判器检测缺陷的能力,其结果与人工评估基本一致,可作为语义评判器分析的可扩展替代方案。

Comments Paper accepted at the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14131 2026-08-17 cs.SE 新提交 67%

LegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy Workflows

LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估

Thilo Reintjes, Sivajeet Chand, Derui Zhu, Sushant Kumar Pandey, Alexander Pretschner

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。

Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13783 2026-08-17 cs.CV 新提交 67%

Doomed to Re-Annotate, Forever: The ImageNet Story

注定要反复标注:ImageNet的故事

Illia Volkov, Nikita Kisel, Tetiana Mishkina, Klara Janouskova, Jiri Matas

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文针对ImageNet-1k数据集的标签噪声问题,构建ReImageNet数据集,采用人机协作反复优化的标注流程,使模型准确率显著提升,相关资源已公开。

Comments 25 pages, 16 figures, 8 tables. Project page: https://vrg.fel.cvut.cz/reimagenet

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13583 2026-08-17 cs.HC cs.MA 新提交 67%

Beyond Simplification: DFT-GEN for Fidelity-Preserving Visual Accessibility in Dyslexia-Friendly Educational Texts

超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN

Jiaqian Yu, Chen Jason Zhang, Haoyang Li, Guoqiong Ivanka Huang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。

Comments Preprint. Code available at https://github.com/MorrisYUJQ/DFT-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13441 2026-08-14 cs.CV 新提交 67%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13267 2026-08-14 cs.CL cs.AI cs.CV cs.LG 新提交 67%

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) University of Technology Nuremberg(纽伦堡工业大学) University of Southern California(南加利福尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。

Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12635 2026-08-14 cs.AR 新提交 67%

GateTruth: Auditing the Rigor of RTL Design Benchmarks via Mutation Testing

GateTruth:通过变异测试审计RTL设计基准的严谨性

Meet Bhadra

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12569 2026-08-14 cs.IR 新提交 67%

Test-Time Optimization of Query Embeddings with Ranking Aware Reward Maximization

基于排名感知奖励最大化的查询嵌入测试时优化

Tianyu Chen, Jiaxing Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究提出TTT-Embed框架,将排名奖励提炼为轻量学习向量,无需访问模型权重即可优化,在多嵌入模型和MTEB任务上显著提升测试时检索效果,且具备良好泛化性,解决了灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12549 2026-08-14 cs.CV 新提交 67%

StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos

StrAD:面向长视频音频描述生成的流式方法与基准

Julian Spravil, Sebastian Houben, Sven Behnke

机构 * Fraunhofer IAIS(弗劳恩霍夫智能分析与信息系统研究所) University of Bonn(波恩大学) University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用科学大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Robotics, University of Bonn(波恩大学机器人中心)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 针对长视频音频描述生成的需求,研究提出首个流式方法StrAD,构建了涵盖多类型全长视频的基准,其微调模型在相关任务上达到先进性能,为扩大无障碍覆盖提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12216 2026-08-13 cs.HC 新提交 67%

"Pharos Night: Crown Pursuit": An AI-Native Deck-Building and Tactical Arena Game Design Based on Multi-Agent Systems

《Pharos Night:皇冠追逐》:一款基于多智能体系统的原生AI卡组构建与战术竞技场游戏设计

Ting-Chen Hsu, Jueyao Liu, Yanzi Zhou, Jiangxu Lin, Haoyu Xu, Yuwen Liu, Yanjia Liu, Bangjing Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究设计了基于多智能体系统的原生AI卡组构建与战术竞技场游戏《Pharos Night:皇冠追逐》,利用大语言模型实现核心功能,小规模试玩显示其能提供有策略性的游戏体验,也暴露出相关挑战,展现了多智能体生成式AI在游戏设计中的潜力。

Comments Accepted to 2026 Annual Symposium on Computer-Human Interaction in Play (CHI Play)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12051 2026-08-13 cs.CV 新提交 67%

Do Not Forget the Obvious - RISC: A Risk-Informed Slice-Coverage Protocol for Safe Autonomous Driving

勿忽视显而易见的内容——RISC:一种用于安全自动驾驶的风险感知切片覆盖协议

Fabian Hüger

机构 * CARIAD SE

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究提出RISC协议,将安全问题转化为风险切片,通过风险引导选择提升自动驾驶关键故障发现率,可应用于多类自动驾驶子系统,补充现有测试验证流程。

Comments 14 pages, 3 figures, 5 tables. Accepted at the ECCV 2026 Workshop on Safe and Defensive Autonomous Driving (SDAD). Non-archival workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11200 2026-08-12 cs.CL cs.AI cs.LG 新提交 67%

ConVAWG: A Retrieval-Grounded Framework for Controlled Synthetic Dialogue Generation in Violence Against Women and Girls

ConVAWG:面向针对妇女和女孩的暴力场景下可控合成对话生成的检索驱动框架

Chen Lyu, Xingwei Tan, Simon Cullen, Shelley Wilson, Lois Arthurs, Arshad Jhumka, Gabriele Pergola

机构 * University of Sheffield(谢菲尔德大学) Forensic Capability Network(法医能力网络) University of Leeds(利兹大学) University of Warwick(华威大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对VAWG场景建模的空白,提出检索驱动框架ConVAWG,生成符合CPS标准的合成VAWG多轮对话,发布6000余个对话事件,经多类评估验证其质量与领域保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 67%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10646 2026-08-12 cs.MA 新提交 67%

ASCon: A Direction-Aware Reciprocal Agent--Step Contextualization Model for Failure Attribution in Multi-Agent Systems

ASCon:面向多智能体系统故障归因的方向感知互惠智能体-步骤上下文模型

Shuyu Jiang, Yue Ran, Kaiyu Xu, Xingshu Chen, Yi Zhang, Hao Ren, Rui Tang, Tianwei Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对多智能体系统故障归因中不同目标间证据依赖关注不足的问题,提出ASCon模型,通过方向感知图注意力等技术聚合轨迹证据,提升了故障智能体、步骤、模式的检测性能及域外归因能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10396 2026-08-12 cs.CV 新提交 67%

FormStruct-Bench:A Hierarchical and Diagnostic Benchmark for Table-Form Document Structure Recognition

FormStruct-Bench:面向表格型文档结构识别的分层诊断基准

Lujie Ban, Jiangtao Zhu, Yuanheng Yu, Jiasheng Shi, Chenhao Ma

专题命中 评测与基准 :SFT(abstract,abstract_cn)

AI总结 该研究提出FormStruct-Bench基准,通过分层评估表格型文档结构识别,发现现有系统在细粒度结构恢复上远弱于内容读取,为相关任务提供诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10882 2026-08-12 cs.SE quant-ph 新提交 67%

From Pattern Detection to Composition Analysis in Quantum Software

从量子软件中的模式检测到组合分析

Neilson Carlos Leite Ramalho, Erico Augusto da Silva, Anthony Accioly, Higor Amario de Souza, Marcos Lordello Chaim

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究扩展了量子模式挖掘工具,经评估其在Qrisp上准确率提升,构建了模式组件调用组合图并发布相关流水线、知识库与数据集,支持量子模式采用与演化的可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09552 2026-08-11 cs.DL 新提交 67%

Does ChatGPT score research quality differently by gender?

ChatGPT是否会按性别对研究质量给出不同评分?

Kayvan Kousha, Mike Thelwall

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究利用REF2021的近9万篇论文,发现ChatGPT对男性第一作者论文的评分略高于女性,此差异在部分学科更明显,提示AI研究评估需谨慎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09294 2026-08-11 cs.HC 新提交 67%

Graphing the Everyday: A Neurosymbolic Approach to Eliciting Routines for Just-In-Time Adaptive Interventions

描绘日常:用于触发即时自适应干预的神经符号方法

Shakyani Jayasiriwardene, Blake Mountford, Meican Ma, Niels van Berkel, Nicholas Koemel, Matthew Ahmadi, Jorge Goncalves, Emmanuel Stamatakis, Zhanna Sarsenbayeva

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究结合LLMs与Neo4j知识图谱的神经符号管道,针对JITAIs面临的对话转日程难题,发现心智模型差距与生态不匹配问题,提出设计启发法以构建支持健康行为改变的主动智能体。

Comments Accepted at OzCHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09147 2026-08-11 cs.CV 新提交 67%

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

RefineAny3D:作为语义对齐的深度细化用于单目3D检测

Zhihao Zhang, Gengwei Zhang, Tianlong Chen, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 67%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07993 2026-08-11 cs.CV 新提交 67%

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

MRBench:用于人体动作-文本检索的综合基准

Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出综合动作-文本检索基准MRBench,针对现有基准缺陷构建,提出轻量级粒度感知模型,提升混合粒度检索效果,为动作-语言对齐评估提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07036 2026-08-10 cs.SE cs.CV 新提交 67%

CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams

CAS2UML:用于类图和活动图的手绘草图到PlantUML数据集

Simon Scholz, Mersedeh Sadeghi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CAS2UML是含557幅手绘类图与活动图及对应PlantUML代码的公开数据集,配套验证工具与脚本,可实现草图转UML方法的可复现基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06908 2026-08-10 cs.CL cs.AI cs.CY cs.LG 新提交 67%

Calibrating WEAT Against Anisotropy: ZCA Whitening as a Geometric Pre-Processing Step for Embedding Association Tests

针对各向异性校准WEAT:将ZCA白化作为嵌入关联测试的几何预处理步骤

Seitaro Ono, Senna Ross, Jun Saiki

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出将ZCA白化作为预处理步骤校准WEAT,可降低嵌入空间各向异性,超30%WEAT结果显著性改变,提升语义相似度,为相关偏差测量提供更可靠基础。

Comments Extended version (with appendices) of a paper accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06620 2026-08-10 cs.SE 新提交 67%

Understanding the Energy Impact of Software Refactoring: A Workload-Aware Study of Controlled Examples and Real-World Commits

理解软件重构的能源影响:一项针对受控示例与真实提交的工作负载感知研究

Haibo Wang, Heng Li, Shin Hwei Tan

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究通过微基准与真实世界基准的大规模实证分析,发现重构的能源影响受工作负载显著影响,现有方法无法可靠识别重构引发的能源回归,需开发更准确的预测技术。

Comments This manuscript is currently under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05507 2026-08-07 eess.AS 新提交 67%

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

AffectDF:针对情感表达型攻击的最全面语音深度伪造检测基准

Aurosweta Mahapatra, Xiutian Zhao, Shreeram Suresh Chandra, Zihan Zhang, Zongyang Du, Ismail Rasim Ulgen, Kong Aik Lee, Nicholas Andrews, Carlos Busso, Berrak Sisman

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 该研究提出涵盖多类情感表达型语音伪造攻击的AffectDF基准,实验发现常规训练的SDD系统在该基准上鲁棒性严重下降,为开发更鲁棒的检测模型提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05495 2026-08-07 cs.CR cs.HC 新提交 67%

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案

He Zhang, Feilong Li, Dingning Long, Yilin Cui, Peijun Zhang, Yuewen Zhang, Qianyao Xu, Xinyi Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。

Comments This work has been accepted as a poster to UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏