arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1498 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1498 篇

2508.02091 2026-08-07 cs.LG cs.AI cs.CL cs.DB 版本更新 67%

CRINN: Contrastive Reinforcement Learning for Approximate Nearest Neighbor Search

CRINN:用于近似最近邻搜索的对比强化学习

Xiaoya Li, Albert Wang, Guoyin Wang, Chris Shum, Jiwei Li

机构 * DeepReinforce Team(深强化团队)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对近似最近邻搜索算法,提出CRINN新范式,将其优化视为强化学习问题,以执行速度为奖励信号,实验证明该方法在多个基准数据集上有效,且其成功验证了强化学习增强语言模型用于算法优化的有效性。

Comments Preprint Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29025 2026-08-06 cs.CV 版本更新 67%

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

用于一致多参考图像编辑的评估-验证奖励

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba(高德,阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04469 2026-08-06 cs.CR cs.MA 版本更新 67%

Cross-Layer Semantic Flow Reconstruction for Attack Detection in Agentic Systems

超越输入防护:为执行感知攻击检测重建跨代理语义流

Qizhi Cai, Yangyang Wei, Zhipeng Chen, Shouling Ji, Zhenyuan Li

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 SysName通过重建跨代理语义流,实现执行感知的攻击检测,有效识别多种复合攻击向量,提升多代理系统安全性。

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18528 2026-08-06 cs.SE 版本更新 67%

AutoLogger: A Multi-Agent Framework for the End-to-End Automated Logging

通过多智能体框架实现端到端自动日志记录

Renyi Zhong, Yintong Huo, Wenwei Gu, Yichen Li, Michael R. Lyu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出Autologger框架,通过多智能体系统实现端到端自动日志记录,提升日志生成质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20318 2026-08-04 cs.CV cs.MM 版本更新 67%

UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval

UniCVR:从对齐到重排序的统一零样本复合视觉检索

Haokun Wen, Xuemeng Song, Haoyu Zhang, Weili Guan, Xiangyu Zhao, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Southern University of Science and Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 UniCVR提出首个统一零样本复合视觉检索框架,结合多模态大语言模型与视觉语言预训练模型,通过两阶段方法实现多任务联合优化,实验表明其在五个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12147 2026-08-04 cs.CV 版本更新 67%

EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next

EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准

Ye Pan, Chi Kit Wong, Yuanhuiyi Lyu, Hanqian Li, Chenfei Liao, Jiahao Huo, Lutao Jiang, Zixin Zhang, Jiacheng Chen, Yuqian Fu, Xu Zheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18130 2026-08-04 cs.SE 版本更新 67%

Doc2Feat-Bench: Evaluating Documentation-Driven Feature Addition

Doc2Feat-Bench:评估文档驱动的功能添加

Zhonghao Jiang, Le Deng, Jialun Cao, Michael Pradel, Zhongxin Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究构建了Doc2Feat-bench基准及经人工验证的子集,用于评估软件工程智能体基于文档变更实现功能的能力,发现当前最先进智能体在该任务上的最佳成功率仅为37.72%,且面临跨文件编辑等关键挑战。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07774 2026-08-03 cs.CR 版本更新 67%

ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents

ScopeJudge:用于进攻性安全代理的成本感知预执行门控

Shane Caldwell, Max Harley, Ads Dawson, Michael Kouremetis, Vincent Abruzzo, Will Pearce

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究进攻性安全代理中预执行门控,引入ScopeJudge数据集,含4897个工具调用。评估八个法官模型在五种转录策略下表现,发现静态策略不足,推荐成本敏感和召回优先操作点,以支持自主安全代理的实时监控和可扩展监督。

Comments 22 pages, 4 figures, 4 tables, 1 link to code, 1 link to dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01499 2026-08-03 cs.CV 版本更新 67%

Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation

Anti-Prompt: 针对文本引导的图像到视频生成的图像保护

Yeonghwan Song, Chanhui Lee, Jinsoo Park, Jeany Son

机构 * GIST(光州科学技术院) POSTECH(浦项科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出Anti-Prompt方法,通过向图像注入不可察觉的扰动,在文本引导的图像到视频生成中引发视觉不一致和结构失败,从而保护版权和隐私。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23531 2026-08-03 cs.CV 版本更新 67%

PixIE: Prompted Pixel-Space Low-Light Image Enhancement

PixIE: 提示驱动的像素空间低光照图像增强

Ruirui Lin, Guoxi Huang, David Bull, Nantheera Anantrasirichai

机构 * Visual Information Laboratory, University of Bristol, United Kingdom(布里斯托大学视觉信息实验室,英国)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

AI总结 提出PixIE框架,利用视觉基础模型的语义提示,通过跨尺度去噪和DINO提示像素块进行像素空间低光照图像增强,在多个基准上提升PSNR和LPIPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09223 2026-08-03 cs.CV 版本更新 67%

CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding

CREST: 曲率调节的事件中心采样用于高效长视频理解

Mehrajul Abadin Miraj, Abdul Mohaimen Al Radi, Shariful Islam Rayhan, Md. Tanvir Alam, Ismat Rahman, Yu Tian, Md Mosaddek Khan

机构 * Dept. of CSE, University of Dhaka(达卡大学计算机科学与工程系) Dept. of CSE, University of Central Florida(中央佛罗里达大学计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出一种无训练帧选择方法CREST,利用查询-帧相关性的时间几何(局部曲率)来指导采样,在固定预算下实现高效长视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09306 2026-07-31 cs.CL cs.AI cs.HC cs.LG 版本更新 67%

Exposure is not manifestation: measurement target and output resolution jointly determine which behavioural-faithfulness evaluator wins

创造力、诚实和设计遗忘在小型双曲语言模型中出现

Kwan Soo Shin

机构 * PolymathMinds Lab(多智思维实验室) POSTECH(浦项科技大学) aSSIST University(aSSIST大学) Korean Educational Development Institute(韩国教育开发院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨小型双曲语言模型如何成为可信陪伴式AI,通过行为审计器检测合规差距,用线性读出检测相关问题,创意框架播种器更优,记忆操作系统实现设计遗忘,为可信陪伴式AI提供了小模型路径。

Comments Substantially revised and narrowed version with a new title and estimand-centred analysis. Comparisons are now reported at three output resolutions, and the reproducibility package has been rebuilt. The author list was changed with the approval of all authors listed on v1-v2; previous versions remain publicly available. 17 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13431 2026-07-30 cs.SD 版本更新 67%

Text2Score: Generating Sheet Music From Textual Prompts

Text2Score:从文本提示生成乐谱

Keshav Bhandari, Sungkyun Chang, Abhinaba Roy, Francesca Ronchini, Emmanouil Benetos, Dorien Herremans, Simon Colton

机构 * Queen Mary University of London(伦敦女王学院) Singapore University of Technology and Design(新加坡科技设计大学) Politecnico di Milano(米兰理工大学) EmotionWave(情绪波)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出Text2Score框架,通过规划和执行阶段生成乐谱,利用符号XML数据直接生成监督信号,优于其他方法。

Comments 9 pages including references, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08906 2026-07-30 cs.SE 版本更新 67%

Understanding Bugs in Modern Agentic Frameworks: A Study of Symptoms, Root Causes, and Triggering Conditions

理解现代代理框架中的缺陷:对症状、根本原因和触发条件的研究

Xiaowen Zhang, Hannuo Zhang, Shin Hwei Tan

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文研究现代代理框架中的缺陷,通过分析409个修复的bug,提出五层抽象模型,揭示独特的症状和根本原因,并识别可转移的bug触发模式,提升代理系统的可靠性。

Comments 12 pages, 2 figures. Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19817 2026-07-30 eess.AS 版本更新 67%

MMedFD: A Real-world Healthcare Benchmark for Multi-turn Full-Duplex Automatic Speech Recognition

MMedFD:面向多轮全双工自动语音识别的真实世界医疗基准

Hongzhao Chen, XiaoYang Wang, Jing Lan, Hexiao Ding, Yufeng Jiang, MingHui Yang, DanHui Xu, Jun Luo, Nga-Chun Ng, Gerald W. Y. Cheng, Yunlin Mao, Jung Sun Yoo

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出首个真实世界中文医疗ASR基准MMedFD,构建含5805个会话的数据集,引入相关技术方案并建立评估框架,为医疗领域流式ASR及双工智能体研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26563 2026-07-29 cs.SE 版本更新 67%

TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems

TrajAudit:智能体编码系统的自动化故障诊断

Minxing Wang, Xiaofei Xie, Yintong Huo

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对仓库级编码轨迹中噪声多、上下文长的问题,提出TrajAudit框架,通过模式匹配过滤和测试报告先验知识辅助,实现高效故障诊断,在RootSE基准上定位准确率提升24.4个百分点,令牌消耗降低18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31767 2026-07-28 cs.SE 版本更新 67%

JETO-Bench: A Reproducible Benchmark for Execution Time Improvement Patches in Java

JETO-Bench: Java执行时间改进补丁的可复现基准测试

Khashayar Etemadi, Zhendong Su

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出JETO-Mine工具,通过静态分析、动态分析和评估框架自动构建可复现的Java执行时间改进补丁基准,并构建包含660个补丁的JETO-Bench,验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00575 2026-07-28 cs.RO 版本更新 67%

Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction

代理奖励建模:通过在线主动交互验证GUI代理

Chaoqun Cui, Jing Huang, Shijing Wang, Liming Zheng, Qingchao Kong, Zhixiong Zeng

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences School of Artificial Intelligence, University of Chinese Academy of Sciences School of Computer Science \& Technology, Beijing Jiaotong University

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 VAGEN通过引入代理交互验证范式,解决GUI代理评估中的视觉限制问题,提升评估准确性与性能。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09624 2026-07-28 cs.LG cs.AI cs.CL cs.CV 版本更新 67%

A Mechanistic Perspective and Circuit-Guided Difficulty Metric for Unlearning

迈向理解遗忘难度:一种机制视角和电路引导的难度度量

Jiali Cheng, Ziheng Chen, Chirag Agarwal, Hadi Amiri

机构 * University of Massachusetts Lowell(马萨诸塞大学洛约拉分校) Walmart Global Tech(沃尔玛全球技术) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CUD度量,通过分析模型电路揭示遗忘难度的机制特征,为设计基于模型机制的遗忘方法提供理论基础。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20803 2026-07-27 cs.CL cs.AI cs.LG 版本更新 67%

The Geometry of Personality: Activation Steering with Jungian Cognitive Functions

人格的几何学:用荣格认知功能进行激活引导

Liu Zai, Yumeng Wang, Junchen Fu, Joemon M. Jose

机构 * University of Glasgow(格拉斯哥大学) Leiden University(莱顿大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究能否用荣格认知功能将人格表示为认知过程并控制,引入含评估协议和数据集的框架,通过实验表明可有效控制,还揭示人格信息所在层、引导向量关系等,为大语言模型人格表示提供新见解并建立研究框架。

Comments There is an error uploading files causing a private work unindended for publication being submitted. The title, abstract, fig 2, 3, 5 and a few other places contain errors misinterpreting the data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06642 2026-07-24 cs.LG cs.AI cs.CL 版本更新 67%

SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training

SR-TTT: 基于惊奇度的残差测试时间训练

Swamynathan V P

机构 * Swamynathan V P Department of Computer Science and Engineering Amrita School of Computing Amrita Vishwa Vidyapeetham Chennai, Tamil Nadu, India(斯瓦米纳坦·V·P 计算机科学与工程系 阿米塔学校 阿米塔大学 芬治, 印度泰米尔纳德邦)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SR-TTT通过引入损失门控稀疏记忆机制,解决纯TTT在精确回忆任务中的失败问题,利用精确注意力处理关键信息,同时保持低内存占用。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16742 2026-07-24 cs.SE 版本更新 67%

Can Automated Feedback Turn Students into Happy Prologians?

自动反馈能让学生成为快乐的Prolog程序员吗?

Ricardo Brancas, Pedro Orvalho, Carolina Carreira, Vasco Manquinho, Ruben Martins

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究在大规模课程中及时提供个性化反馈的挑战,核心方法是构建Prolog自动评估平台ProHelp并调查学生。主要贡献为得出多种反馈的有用性排名及学生对未来反馈功能的偏好,且发现学生兴趣等因素对反馈有用性感知无显著影响。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 179-195

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25449 2026-07-22 cs.CL cs.AI cs.LG 版本更新 67%

Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One

回收评估:有损记忆比空记忆更糟糕

Alex Kwon

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,语言模型保留错误结论而丢弃推导过程的记忆会导致更差表现,提出“源优先”策略通过保留可重算源来恢复可纠正性,并在多种记忆系统和真实对话中验证。

Comments 36 pages, 5 figures, 23 tables. v5: table/float layout fixes and a corrected stray typo in Table 21 (n/a cells); no changes to results or text

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10201 2026-07-21 cs.GR 版本更新 67%

B-repLer: Language-guided Editing of CAD Models

B-repLer:CAD模型的语言引导编辑

Yilin Liu, Niladri Shekhar Dutt, Changjian Li, Niloy J. Mitra

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究语言引导的CAD编辑问题,提出B-repLer框架直接连接自然语言与CAD模型编辑,绕过构建历史,还引入数据集,展示其自动生成等方法,能对复杂CAD形状准确执行复杂编辑。

Comments Accepted by SIGGRAPH 2026; Project page at https://yilinliu77.github.io/brepler.github.io Code at https://github.com/yilinliu77/Brepler

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19834 2026-07-20 cs.CV 版本更新 67%

KD-Judge: A Knowledge-Driven Automated Judge Framework for Functional Fitness Movements on Edge Devices

KD-Judge:一种基于知识的自动化评判框架,用于边缘设备上的功能性健身动作

Shaibal Saha, Fan Li, Yunge Li, Arun Iyengar, Lucas Alves, Lanyu Xu

机构 * Department of Computer Science and Engineering, Oakland University, Rochester Hills, USA(计算机科学与工程系,奥克兰大学,罗切斯特希尔,美国)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出KD-Judge,一种基于知识的自动化评判框架,用于在边缘设备上对功能性健身动作进行重复标准的自动评判,通过规则结构化和确定性规则系统提高效率和准确性。

Comments Accepted at IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20032 2026-07-17 cs.DC cs.PF 版本更新 67%

LEO: Tracing GPU Stall Root Causes via Cross-Vendor Backward Slicing

LEO:通过跨厂商反向切片追溯GPU停滞的根本原因

Yuning Xia, John Mellor-Crummey

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出LEO,一种跨NVIDIA、AMD和Intel GPU的根因分析工具,通过反向切片追踪停滞指令,揭示性能瓶颈,实验表明其优化可提升1.73至1.82倍,展示不同GPU架构需不同优化策略。

Comments Manuscript accepted at SC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12477 2026-07-16 cs.CV 版本更新 67%

Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence

自我在空间中:无人机具身智能中的自我意识与空间认知基准测试

Zhishan Zou, Guoyan Sun, Zhiwei Wei, Jiancheng Pan, Yujie Li, Mugen Peng, Wenjia Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hunan Normal University(湖南师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究针对无人机具身智能中自我意识与空间认知问题,引入SIS - Bench基准,通过多维度层次评估,揭示现有模型局限,探索运动感知表征提升性能,强调自我意识重要性,提供新基准和实证依据。

Comments Website:https://choucisan.github.io/publications/self-in-space ; Code:https://github.com/IntelliSensing/Self-in-Space

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02235 2026-07-15 cs.SE 版本更新 67%

Agent-Based Software Artifact Evaluation

基于代理的软件工件评估

Zhaonan Wu, Yanjie Zhao, Zhenpeng Chen, Zheng Wang, Haoyu Wang

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17434 2026-07-15 cs.HC 版本更新 67%

Co-Designing Digital Humans for Online Learning: A Framework for Human-AI Pedagogical Integration

为在线学习共同设计数字人:人机教学整合框架

Xiaokang Lei, Ching Christie Pang, Yuyang Jiang, Xin Tong, Pan Hui

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究为在线学习共同设计数字人框架,结合对多领域作品分析、学习者调查及专家研讨,为教育工作者等提供指导,助力构建更优质在线学习环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02772 2026-07-14 cs.SE 版本更新 67%

From Codebases to LLMs: Non-Inclusive Naming in Linux Foundation Repositories

从代码库到语言模型:Linux 基金会存储库中的非包容性命名

Honghao Tan, Md Nafiu Rahman, Shin Hwei Tan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究利用 NISCAN 框架检测 Linux 基金会存储库中代码及相关工件的非包容性术语,对 461 个存储库进行生态系统规模研究,分析术语变化及影响因素,还通过案例研究评估大语言模型处理情况。

详情

展开后加载摘要…

URL PDF HTML 收藏