arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3102 篇

2608.08542 2026-08-11 cs.LG 新提交 57%

When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征

Yu Ma, Hongli Shi, Jing Li, Xinran Xu, Weiwei Hou

机构 * Google(谷歌公司) University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) Australian National University(澳大利亚国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本研究针对技能合并大语言模型,构建SkillSafe-Bench基准,发现静态安全无法预测其自适应越狱鲁棒性,提出SubSafe-Merge方法可在保留能力的同时消除安全侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08468 2026-08-11 cs.CR cs.AI 新提交 57%

SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills

SkillsMetric:映射恶意智能体技能静态分析的检测边界

Xinze Chen, Chi Zhang, Ping Ji, Yimin Liu

机构 * The Graduate Center, City University of New York(纽约城市大学研究生中心) Hunter College, City University of New York(纽约城市大学亨特学院) The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08210 2026-08-11 cs.AI 新提交 57%

Illusion of Alignment: Detecting Hidden Disagreement in Collaborative Dialogue

对齐的错觉:检测协同对话中的隐藏分歧

Kaiming Liu, Fuwen Luo, Ziyue Wang, Jinrui Ju, Yuxuan Liu, Xuanyu Lei, Yunghwei Lai, Peng Li, Yang Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute for AI, Tsinghua University(清华大学人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本研究针对协同对话中存在的对齐的错觉(IoA)问题,构建IoA-Suite数据集,训练IoA-Prober-8B模型检测隐藏分歧,该模型可揭示真人会议中未表达的分歧,还能提升多智能体协作的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08119 2026-08-11 cs.LG 新提交 57%

TSDS-Toolbox: A Toolbox for Measuring Time-Series Dataset Similarity

TSDS-Toolbox:用于测量时间序列数据集相似度的工具箱

Yen-Ku Liu, Hongjie Chen, Ryan A. Rossi, Franck Dernoncourt

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Dolby Laboratories(杜比实验室) Adobe Research(奥多比研究院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究针对现有时间序列数据集相似度基准实现零散难扩展的问题,提出TSDS-Toolbox工具箱,支持系统比较、灵活扩展与一致评估,经实验验证有效且公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08045 2026-08-11 cs.AI 新提交 57%

Lingjing: A Simulation Testbed for Multi-Agent Embodied Tasks in Open-Ended Cities

Lingjing:面向开放城市多智能体具身任务的仿真测试平台

Xiaohe Li, Yiru Wang, Junhao Fan, Mingyuan Liu, Jie Huang, Kaixin Zhang, Jiahao Li, Chen Qian, Zide Fan

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 Lingjing 是一款面向开放城市异构多智能体具身任务的仿真测试平台,支持城市多智能体协同的可复现评估与故障诊断,通过评估视觉语言模型等揭示了环境感知等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07899 2026-08-11 cs.AI 新提交 57%

TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?

TelemetrySuffBench:智能体遥测是否足以用于故障起源诊断?

Yuxuan Zhu, Peng Pu

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究推出TelemetrySuffBench基准,评估五个前沿语言模型的故障起源诊断能力,发现检测与定位存在差距,安全弃权(不执行)具强模型依赖性,需决策-来源链接与弃权保障。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07763 2026-08-11 cs.CL cs.CV 新提交 57%

Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation

Jako Tako 还是 Fluent?推出 PoVisLE:波兰语视觉-语言评估基准

Anna Kołos, Grzegorz Statkiewicz, Karolina Seweryn, Katarzyna Kowol, Karolina Piosek, Wojciech Kusa

机构 * NASK National Research Institute(NASK国家研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现有英语中心视觉-语言模型在文化理解上的不足,推出波兰语单文化视觉-语言基准 PoVisLE,含1117张图像与2366对标注VQA样本,可评估深层文化多模态理解。

Comments 28 pages. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07463 2026-08-10 cs.CV cs.LG 新提交 57%

MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation

MirrorWorld:利用视频扩散模型生成镜像反射

Youjun Zhao, Alex Warren, Gary K. L. Tam, Rynson W. H. Lau

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 MirrorWorld是一种反射感知视频修复框架,通过语义关系蒸馏和几何变换对齐建模场景与镜像的关系,在视频镜像反射重建任务上优于现有方法。

Comments Project Page: https://youjunzhao.github.io/MirrorWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06571 2026-08-10 cs.CR cs.CL 新提交 57%

Model Confidence Under Answer-Preserving Attacks: An Informativeness-Manipulability Frontier

答案保留型攻击下的模型置信度:信息性-可操纵性前沿

Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对答案保留型攻击,发现视觉-语言系统的置信度信号不具备固有鲁棒性,四类防御均无效,协调攻击可大幅降低置信度门控下的接受准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04939 2026-08-06 cs.CL 新提交 57%

Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

帧间解读:社交媒体视频中隐含与非字面意义的理解

Yang Wang, Yanan Ma, Yiqi Liu, Zi Yan Chang, Chi-Li Chen, Chia-Yi Hsiao, Tyler Loakman, Aline Villavicencio, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Durham University(杜伦大学) University of Sheffield(谢菲尔德大学) University of Exeter(埃克塞特大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出DrivelHub+基准,评估视频-语言模型推断社交媒体视频隐含意义的能力,从解释和表征两方面开展实验,衡量模型多模态感知与语用理解的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04830 2026-08-06 cs.AI 新提交 57%

ContextWeave: A Real-World Workflow Benchmark

ContextWeave:一个真实世界工作流基准测试

Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI

AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04804 2026-08-06 cs.SE cs.AI 新提交 57%

Scrouting: Cost-Aware Routing of Coding Agents by Scouting the Repository First

Scrouting:通过先探查仓库实现编码智能体的成本感知路由

Ishaan Bhola, Adithyan Krishnan, Mukunda NS

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出SuperScout,先探查仓库生成经沙箱验证的结构化交接内容,再路由任务至四个修复器,在SWE-bench Pro上以约五分之一成本达到最优单模型的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04776 2026-08-06 cs.AI 新提交 57%

NSF-HRPT: Neural Semantic Field meets Hierarchical Risk Perception Tree for Safety-Critical Scenario Assessment

NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法

Yu Zhao, Jiangyu Pan, Tao Hu, Ming Yin, Fan Yang, Jiangfan Liu, Xiubo Liang

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04426 2026-08-06 cs.CV cs.CL 新提交 57%

Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

预测再检索:从视频前缀中进行跨实例未来状态检索

Quynh Vo, Thong Nguyen, Vinh-Hien Do, Cong-Duy Nguyen, Anh-Tuan Luu

机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究提出PSR任务,构建含多数据集的基准,提出LFTR模型,发现预测而非感知是核心挑战,LFTR缩小差距且成本低,相关资源已公开。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04043 2026-08-06 cs.LG cs.RO 新提交 57%

Tactus: Open-Vocabulary Object Recognition from Low-Cost Pressure Arrays

Tactus:基于低成本压力阵列的开放词汇对象识别

Abdul Basit Tonmoy

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本文提出Tactus模型,仅用低成本压力阵列数据实现开放词汇对象识别,在STAG基准上表现优于或匹配闭集CNN,小数据方案及传感器校准是其关键,相关资源已公开。

Comments 6 pages, 4 figures. Weights: https://huggingface.co/EximiusLabs/fusion-embedding-2-tactus

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03990 2026-08-05 cs.LG 新提交 57%

Assessment of Conditional Diffusion Model for Synthetic Histopathology Image Generation

用于合成组织病理学图像生成的条件扩散模型评估

Seyed Kahaki, Shijie Li, Weijie Chen, Nicholas Petrick

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究针对合成组织病理学图像生成的评估问题,提出基于数字病理学预训练基础模型改进的FID、IS及精确率-召回率指标,实验发现改进后的IS与下游细胞核分割性能相关性更高,且生成数据多样性对分割性能的提升作用强于单张图像视觉保真度。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03099 2026-08-05 cs.CL 新提交 57%

What Language Does and What the Evidence Supports: A Functional Role Taxonomy and Evidence Audit of Language Grounding in Embodied Agents

语言的作用与证据支持:具身智能体中语言接地的功能角色分类与证据审查

Yifan Guo, Chenghao Li, Zhu Wang, Wei Xu, Yu Li, Yulong Zhu, Zhuo Sun, Bin Guo, Zhiwen Yu

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 本研究提出具身智能体中语言的五种功能角色,构建框架审查现有文献,发现语言功能使用与证据支持存在差距,以角色主张为单位可合理比较不同具身智能体。

Comments 19 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02845 2026-08-05 cs.LG 新提交 57%

NOMADD: Numerical Optimization of Models Adapting to Data Drift

NOMADD:适配数据漂移的模型数值优化方法

Swapn Shah, Keith Burghardt

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出适用于多种模型的事后概念漂移缓解方法NOMADD,通过参数外推提升模型在18个数据集基准上的性能,训练耗时远低于同类最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02786 2026-08-05 cs.LG 新提交 57%

Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment

评估盲区:无声的测量故障如何从训练到部署破坏AI系统

Priyanka Bajaj

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出评估盲区概念,指出测量故障会从AI训练到部署阶段无声传播,通过案例与50起真实事件验证,发现53%公开失效为无声,强调测量基础设施需覆盖全生命周期。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 57%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Yale University(耶鲁大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00722 2026-08-04 eess.AS cs.LG eess.SP 新提交 57%

Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech

用于缓解基于语言模型的文本转语音中幻觉的经验校准对比解码

Chenlin Liu, Minghui Fang, Zhonghao Bi, Zekai Su, Rong Wang, Jiqing Han

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 该研究针对基于语言模型的文本转语音的语音幻觉问题,提出无训练的经验校准对比解码方法,在多数据集上显著降低错误率并提升听辨质量,为解码时缓解语音幻觉提供新方向。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02470 2026-08-04 cs.CV cs.AI 新提交 57%

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment

基于专用分割模型实现具身智能视觉语言模型(Agentic VLMs)的细粒度车辆损伤评估

Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对VLMs空间定位不可靠问题,本文提出TinyDamage架构,将空间定位委托给专用多任务分割模型,集成至7节点LangGraph智能体流程,在车辆损伤评估中大幅降低报告虚构率。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02358 2026-08-04 cs.CL 新提交 57%

ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01704 2026-08-04 cs.IR cs.CL cs.HC 新提交 57%

Floor, Ceiling, and the Fusion Gap: How Much of Crowd Reading Attention Can Machines Predict?

下限、上限与融合差距:机器能预测多少群体阅读注意力?

Kazuki Nakayashiki, Keisuke Watanabe

机构 * Glasp Inc.(Glasp公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究构建了群体阅读注意力预测任务的上下限与融合差距,发现前沿模型仅能捕捉部分差距,多模型融合可提升性能,蒸馏后的8B学生模型能保留融合的大部分优势,证实人群信号存在于文档级结构中。

Comments 8 pages. Ancillary files include the pre-registrations, hostile-audit records, verification scripts, and the aggregate artifacts every reported number is generated from

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29124 2026-08-03 cs.CV cs.LG 新提交 57%

SciFigPlag-Bench: A Benchmark for Provenance-Aware Scientific Figure Plagiarism Detection

SciFigPlag-Bench:面向来源感知的科学图片抄袭检测基准

Zhiying Cui, Minghao Yang, Linlin Gao, Jie Liu, Pengyuan Li

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出SciFigPlag-Bench基准,用于科学图片的来源感知抄袭检测,含四类任务,实验发现视觉语言模型在细粒度来源推理等方面仍有挑战。

Comments 30 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28802 2026-08-03 cs.AI 新提交 57%

Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

模型还是控制?一种以交互为中心的智能体故障定位分类法

Harsh Raj, Vipul Gupta, Anas Mahmoud, Razvan-Gabriel Dumitru, Darvin Yi, Aakash Sabharwal, Yunzhong He

机构 * Scale

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 该研究提出以交互为中心的智能体故障分类法,将故障定位到交互及责任组件,适用于多类智能体架构,经评估具有良好可重复性与结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27217 2026-07-31 stat.AP cs.LG 新提交 57%

Foundation-Model Earth Representations Enable Regional-Scale Forest Aboveground Biomass Monitoring Across the Northeastern United States

基于基础模型的地球表征实现美国东北部区域尺度森林地上生物量监测

Shashika Lamahewage, Chandi Witharana

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究利用AlphaEarth基础模型生成的Google卫星嵌入,结合LiDAR数据与森林清查数据构建模型,实现美国东北部区域森林地上生物量的高精度监测,为规模化碳评估提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28496 2026-07-31 cs.CL 新提交 57%

Beyond Sentiment: Structured Information Extraction from Financial News

超越情感:从金融新闻中进行结构化信息提取

Daohan Zhu, Sitong Ge, Ruofei Wang, Honggu Chen, Yubo Hou, Tao Wan, Zengchang Qin

机构 * School of ASEE, Beihang University(北京航空航天大学ASEE学院) School of BME, Beihang University(北京航空航天大学生物医学工程学院) CAIR and CECS, VinUniversity(VinUniversity CAIR与CECS机构)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 该研究针对金融情感分析仅压缩新闻为单一极性评分的局限,提出用LLaMA-3.1-70B提取金融新闻的结构化语义特征,结合情感与结构化特征可提升股票预测性能,为多维金融NLP开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28187 2026-07-31 cs.AI cs.CR cs.SE 新提交 57%

Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

旧技巧,新模型:简单图像变换如何破解基于现代AI的内容审核

Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 该研究通过黑盒评估发现,商用多模态图像审核API可被简单图像变换绕过,且不同服务稳健性差异大,表明这类API无法单独作为可靠安全过滤器,需结合分层审核管道部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27826 2026-07-31 cs.AI cs.CV 新提交 57%

Sign Language Question Answering: A New Task, Benchmark, and Baseline for Sign Language Understanding

手语问答:手语理解的新任务、基准与基线模型

Shiwei Gan, Lichen Wang, Xiao Liu, Yafeng Yin, Kuizhuang Liu, Sanglu Lu, Lei Xie

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出手语问答新任务,构建基于PHOENIX14T与CSL-Daily的SignQA基准,设计带特定模块的基线模型,实验显示其在各问题类别上优于代表性视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏