arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 766 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 164 篇

2606.23676 2026-06-23 cs.LG cs.AI math.OC stat.ML 新提交 85%

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?

开放问题:AdamW 在重尾噪声下是否有效?

Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出开放问题:AdamW 在重尾噪声下能否收敛?通过加权度量基准和走廊下界机制,揭示分母记忆可能隐藏大梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08787 2026-06-23 cs.CV 版本更新 85%

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解

Mashrafi Monon, Umaima Rahman, Asif Hanif, Numan Saeed, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22676 2026-06-23 cs.AI 新提交 84%

Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations

Skin-Deep: 大型语言模型表示中对齐脆弱性的几何诊断方法

Dongyub Jude Lee, Jungseob Lee, Seungyoon Lee, Seongtae Hong, Suhyune Son, Sugyeong Eo, Jaehyung Seo, Heuiseok Lim

机构 * Zoom Communications Korea University(高丽大学) Yonsei University(延世大学) Konkuk University(建国大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 提出Skin-Deep几何诊断方法,通过计算几何脆弱性分数(GFS)在对齐模型微调前检测其拒绝有害请求行为的脆弱性,无需运行攻击。

Comments 16 pages, 3 figures, 12 tables. The first two authors contributed equally. Code (pre-attack GFS diagnostic): https://github.com/js-lee-AI/skin-deep

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20588 2026-06-23 cs.HC cs.AI 新提交 84%

AInterviewer: A Platform for Designing and Conducting AI-led Qualitative Interviews

AInterviewer:一个用于设计和进行AI主导的定性访谈的平台

Tobias Priesholm Gardhus, Nikolas Vitsakis, Fie Lejre Frederiksen, Anna Rogers, Hjalmar Bang Carlsen

机构 * University of Copenhagen(哥本哈根大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AInterviewer平台,通过多智能体管道结合调查软件的标准化与LLM的灵活性,实现可复现、安全、透明的AI主导定性访谈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22826 2026-06-23 cs.AI 新提交 83%

MINCE: Shrinking LLM Evaluation Datasets via Few-Model Monte Carlo Calibration

MINCE:通过少模型蒙特卡洛校准缩小LLM评估数据集

Devleena Das, Rajeev Patwari, Vikram Kumar Bukka, Nithin Kumar Guggilla, Elliott Delaye, Ashish Sirasao

机构 * Advanced Micro Devices (AMD)(超威半导体(AMD))

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出MINCE方法,利用少量校准模型的蒙特卡洛模拟确定最小子集大小,无需预测层,显著减少评估数据集规模,在保持精度漂移极小的同时实现数倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09416 2026-06-23 cs.CL cs.CY 版本更新 83%

Are Language Models Sensitive to Morally Irrelevant Distractors?

语言模型对道德无关干扰因素敏感吗?

Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究借鉴道德心理学中的“情境主义”观点,通过构建包含60种道德无关干扰因素的多模态数据集,发现这些干扰因素能使大语言模型的道德判断偏移超过30%,揭示了其道德判断的不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22841 2026-06-23 cs.CL cs.LG 新提交 82%

IndicGuard: A Multilingual Safety Guard Model and Dataset for Indic Languages

IndicGuard:面向印度语言的多语言安全防护模型与数据集

Parth Bramhecha, Smit Deshmukh, Sairaj Bodhale, Adwait Borate, Raviraj Joshi

机构 * L3Cube-Labs, Pune(L3Cube实验室,浦那)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出IndicGuard,一个针对10种印度主要语言的多语言安全数据集和基于Gemma-3-4B-IT微调的4B参数安全防护模型,在内容审核和跨语言泛化上优于现有基线CultureGuard。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21627 2026-06-23 cs.AI cs.LG 新提交 82%

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Counsel: 面向智能体任务的元评估数据集

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

机构 * Atla AI Cohere AI Mistral AI Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21013 2026-06-23 cs.AI cs.LG 新提交 82%

Agentic Time Machine as an Infrastructure for Future-Event Forecasting

Agentic Time Machine:未来事件预测的基础设施

Jingyi Chai, Bingyang Zheng, Xiangrui Liu, Hao Lu, Zihang Zhou, Tianchen Wang, Kemeng Zhang, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Agentic Time Machine(TM)基础设施,通过过滤截止后内容重建历史网络状态,并基于此设计规划-求解-聚合多智能体框架,实现高效且可靠的事件预测,在FutureX排行榜上取得最佳平均排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16364 2026-06-23 cs.SD cs.AI cs.CL 版本更新 82%

WASIL: In-the-Wild Arabic Spoken Interactions with LLMs

WASIL:真实场景下阿拉伯语口语交互与LLMs

Zien Sheikh Ali, Hamdy Mubarak, Soon-Gyo Jung, Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, Qatar(卡塔尔计算研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WASIL数据集,包含真实阿拉伯语口语交互数据,包含音频、ASR假说、助手回复及显式喜欢/不喜欢反馈,用于评估LLMs在真实场景下的表现。

Comments Spoken Prompts, Multilingual LLMs, Speech-based Evaluation, Dialectal Speech, Low-resource Languages, Conversational AI, Speech-to-Text QA, Real-world Interaction, Spoken Language Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21478 2026-06-23 cs.CL cs.LG eess.AS 版本更新 82%

TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild

TaigiSpeech: 一个低资源真实世界语音意图数据集及基于可扩展野外数据挖掘的初步结果

Kai-Wei Chang, Yi-Cheng Lin, Huang-Cheng Chou, Wenze Ren, Yu-Han Huang, Yun-Shao Tsai, Chien-Cheng Chen, Yu Tsao, Yuan-Fu Liao, Shrikanth Narayanan, James Glass, Hung-yi Lee

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) National Taiwan University, Taipei, Taiwan(国立台湾大学) National Taiwan University Artificial Intelligence Center of Research Excellence, Taipei, Taiwan(国立台湾大学人工智能研究中心) Academia Sinica, Taiwan(台湾“中央”研究院) National Yang Ming Chiao Tung University, Taiwan(阳明交通大学) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, USA(信号分析与解释实验室(SAIL),南加州大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对低资源台语,构建包含21位老年人3000条话语的语音意图数据集,并探索关键词匹配与LLM伪标注、音视频框架两种数据挖掘策略,以解决标注数据稀缺问题。

Comments Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23629 2026-06-23 cs.HC 新提交 82%

Why Machines Misread Pedagogical Quality: Human-Machine Alignment in LLM-Based Pretest Question Evaluation

为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐

Pei-Yu Tseng, Mahir Akgun, Peng Liu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21852 2026-06-23 cs.DC 新提交 82%

Rethinking Burst Buffer Optimization: Enabling Layout Heterogeneity via Hybrid Analysis and LLM Guidance

重新思考突发缓冲区优化:通过混合分析和LLM指导实现布局异构性

Yuhan Cai, Huijun Wu, Zhuo Tang, Kehua Guo, Wenzhe Zhang, Zhenwei Wu, Zhouyang Jia, Ruibo Wang, Yong Dong

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出Proteus系统,通过结合静态代码结构和轻量级运行时信号重建I/O意图,在无需训练或详尽分析的情况下优化突发缓冲区的数据布局,实现高达3.24倍和2.9倍的写密集和元数据密集工作负载加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17710 2026-06-23 cs.CV cs.AI cs.CL cs.LG 新提交 82%

Vision-language models for chest radiography do not always need the image

胸部X光片的视觉-语言模型并不总是需要图像

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学模式识别实验室) Department of Diagnostic and Interventional Radiology, TUM University Clinic, School of Medicine and Health, Klinikum rechts der Isar, Technical University of Munich(慕尼黑工业大学医学院与健康学院伊萨尔河右岸医院诊断与介入放射学系) Lab for AI in Medicine, RWTH Aachen University(亚琛工业大学医学人工智能实验室) Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(亚琛工业大学医院诊断与介入放射学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过因果审计方法,发现许多医学视觉-语言模型在胸部X光片任务中依赖文本先验而非图像,纯文本模型与多模态模型性能接近,并提出了基于图像依赖性的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21050 2026-06-23 cs.SD 版本更新 82%

ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition

ERM-MinMaxGAP:多语言多模态语音-LLM情感识别中的性别偏见基准测试与缓解

Zi Haur Pang, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen

机构 * Kyoto University, Japan(京都大学,日本) Agency for Science, Technology, and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对多语言语音大模型在情感识别中的性别偏见问题,提出基于MELD-ST的多语言多模态基准,并设计ERM-MinMaxGAP训练目标,通过自适应公平权重和MinMaxGAP正则化器,在英日德三种语言上提升性能并缩小性别差距。

Comments This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22657 2026-06-23 cs.LG cs.AI 新提交 82%

Foundation Models for Epileptogenic Zone Identification in Drug-Resistant Epilepsy

药物难治性癫痫中致痫区识别的基础模型

Thi Kieu Khanh Ho, Thomas Lai, Petr Klimes, Jan Cimbalnik, Martin Pail, Milan Brazdil, Birgit Frauscher, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(米拉-魁北克人工智能研究所) Montreal Neurological Institute and Hospital, McGill University(蒙特利尔神经学研究所与医院,麦吉尔大学) Institute of Scientific Instruments, The Czech Academy of Sciences(捷克科学院科学仪器研究所) Brno Epilepsy Center, Department of Neurology, St Anne’s University Hospital(布尔诺癫痫中心,圣安妮大学医院神经内科) Faculty of Medicine, Masaryk University(马萨里克大学医学院) Duke University Medical Center(杜克大学医学中心) Duke Pratt School of Engineering(杜克普拉特工程学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出EpiiSLM双基础模型系统,通过信号基础模型和语言基础模型整合sEEG与临床信息,在接触级PPV上超越传统方法15.1%,仅需一夜发作间期睡眠数据。

Comments Keywords: drug-resistant epilepsy, epileptogenic zone, stereo-electroencephalography, signal foundation models, language foundation models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23416 2026-06-23 cs.CR cs.AI 新提交 81%

Detecting Malicious Agent Skills in the Wild using Attention

利用注意力机制检测野外恶意智能体技能

Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM技能市场中的恶意技能注入攻击,提出Locate-and-Judge两阶段检测器,通过注意力定位和审查实现高效全市场扫描,大幅降低成本并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22613 2026-06-23 cs.AI 新提交 81%

SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment

SkillAudit:从固定套件基准测试到以技能为中心的评估

Dexu Yu, Youhua Li, Zhaoyang Guan, Xianhao Lin, Jining Luan, Zihao Rao, Xuanqi Lan, Yang Ran, Bo Lan, Nai-Xin Zhai, Hanwen Du, Junchen Fu, Wenhao Deng, Yongxin Ni, Chunxiao Li

机构 * Northeastern University(东北大学) City University of Hong Kong(香港城市大学) Northwestern University(西北大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Santa Clara University(圣克拉拉大学) Fenz AI Ohio State University(俄亥俄州立大学) University of Glasgow(格拉斯哥大学) National University of Singapore(新加坡国立大学) DeciLix Lab(DeciLix实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,自动生成技能的多维度评估报告,涵盖效用、效率/成本和安全性,通过基线比较和两阶段检测解决固定套件评估的不足。

Comments Preprint. Project page: https://skillaudit.github.io/. Code and evaluation artifacts: https://github.com/SkillAudit/skillaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22610 2026-06-23 cs.AI 新提交 81%

PaperClaw: Harnessing Agents for Autonomous Research and Human-in-the-Loop Refinement

PaperClaw:利用智能体实现自主研究与人在回路精炼

Weiwei Ye, Hangchen Liu, Dongyuan Li, Renhe Jiang

机构 * Open scholarly indexes(开放学术索引) Priem et al.(Priem 等) Lo et al.(Lo 等) Si et al.(Si 等) Baek et al.(Baek 等) Wang et al.(Wang 等) Yang et al.(Yang 等) Wei et al.(Wei 等) Yao et al.(Yao 等) Shinn et al.(Shinn 等) Madaan et al.(Madaan 等) Packer et al.(Packer 等) Park et al.(Park 等) Zhong et al.(Zhong 等) Huang et al.(Huang 等) Ji et al.(Ji 等) Min et al.(Min 等)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PAPERCLAW多智能体系统,从研究领域到论文完成全自主,支持人在回路精炼,通过迭代假设验证生成可检验论文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22470 2026-06-23 cs.AI 新提交 81%

PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs

PRIME: 评估大语言模型在不兼容指令下的提示解决能力

Tehreem Javed, Shumaim Fatimah, Masooma Bakhtiari, Gibrail Islam, Mehwish Fatima

机构 * School of Electrical Engineering Computer Science (SEECS), National University of Sciences

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PRIME框架,通过生成校准冲突(响应长度、输出格式、推理)并采用确定性行为分类法,分析大语言模型处理冲突指令的行为,发现冲突类型比模型规模对行为影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21559 2026-06-23 cs.CL 新提交 81%

Rubric-as-Experts: Case-Specific MQM Rubrics for Translation Quality Evaluation

Rubric-as-Experts: 面向翻译质量评估的案例特定MQM评分标准

Weilu Xu, Yunzhi Shen, Xinye Wang, Ranfei Dang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出案例特定动态评分标准框架,根据翻译实例自适应选择MQM子类型空间和评估粒度,在WMT跨度级QE基准上提升MCC并减少误报。

Comments 18 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15549 2026-06-23 cs.CR cs.AI 新提交 81%

One Goal, Many Commands: Characterizing Denylist Fragility in AI Agents

CmdNeedle: 衡量AI智能体命令黑名单的不完备性

Chuyang Chen, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对终端AI智能体命令黑名单的脆弱性问题,提出LLM驱动的检测流水线CmdNeedle,发现69.0-98.6%的黑名单存在可绕过漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22043 2026-06-23 cs.AI cs.CV cs.LG 新提交 81%

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制

Zekun Xu

机构 * Zekun Xu(徐泽坤)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10466 2026-06-23 cs.LG cs.AI 新提交 81%

UPLOTS: A Unified Pretrained Language Model for Constrained Time-series Generation

UPLOTS: 一种用于约束时间序列生成的统一预训练语言模型

Du Yin, Hao Xue, Jinliang Deng, Yang Yang, Shuang Ao, Arian Prabowo, Flora Salim

机构 * University of New South Wales(新南威尔士大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出UPLOTS,一种基于统一预训练语言模型和提示引导的框架,通过动态多数据集损失重加权和提示到模式映射,实现跨领域约束时间序列生成,在四个基准上验证了其泛化性和数据增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23339 2026-06-23 cs.RO 新提交 80%

When Robots Rate Their Own Interactions: Engagement Validity and the Strangeness Failure

当机器人评价自身交互:参与度有效性及陌生感失败

Victor Lockwood, Hasan Mahmud, Mohammad Javad Khojasteh, Prabu David, Jamison Heard

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出LLM驱动的机器人从自身视角完成标准化问卷的逆向评价方法,发现机器人在参与度维度与人类一致,但系统性地反转了舒适/陌生感维度,表明当前机器人缺乏评估陌生感所需的内在情感状态。

Journal ref IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22918 2026-06-23 cs.CV cs.GT 新提交 80%

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

各有所尺:发现用于物理视频评估的每VLM分类体系

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Darwin Research Center(华为达尔文研究中心) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract)

AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22399 2026-06-23 cs.SD 新提交 80%

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

ATCCaps: 一个面向空中交通管制识别的呼号感知语音数据集

Dongdong Li, Jianwei Song, Jianwei Wang, Zhe Wang

机构 * East China University of Science and Technology(华东理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出ATCCaps,一个基于真实无线电通话构建的呼号感知语音数据集,包含202.94小时音频和17万条话语,通过结合置信度感知的转录解析、ADS-B呼号元数据、规则过滤和LLM辅助字幕生成,支持ASR评估、呼号匹配和音频-文本检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21926 2026-06-23 cs.SE 新提交 80%

A11YRepair: Bridging Web Accessibility Barriers via Knowledge-Enhanced Divide-and-Conquer Repair

A11YRepair: 通过知识增强的分治修复弥合网络无障碍障碍

Kai Huang, Ling Zhu, Jian Zhang, Xiaofei Xie, Chunyang Chen

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对网络无障碍违规修复问题,提出基于LLM的分治框架A11YRepair,通过聚类关联违规并引入WCAG领域知识,实现多文件协调修复,在60个真实项目中优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21377 2026-06-23 cs.CR 新提交 80%

ARENA: An Architecture for Measuring the Transferability of Autonomous Cyber Defense

ARENA: 一种衡量自主网络防御可迁移性的架构

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Gioliano de Oliveira Braga, Henrique Curi de Miranda, Lourenço Alves Pereira Júnior

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对生产环境安全运营中心数据难以公开的问题,提出一种从私有生产数据中提取、匿名化、结构化并验证SIEM数据的方法,在保护隐私的同时保留任务相关结构,并通过两个应用案例验证了隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14837 2026-06-23 cs.CV 版本更新 80%

DamageArbiter: A Multimodal Arbitration Framework for Disaster Damage Assessment from Street-View Imagery

DamageArbiter:一种基于街景图像进行灾害损伤评估的多模态仲裁框架

Yifan Yang, Lei Zou, Wenjing Gong, Kani Fu, Zongrong Li, Siqin Wang, Bing Zhou, Heng Cai, Hao Tian

机构 * organization= Department of Geography, Texas A\&M University , city= College Station , country= USA organization= Department of Landscape Architecture \& Urban Planning, Texas A\&M University , city= College Station , country= USA organization= Department of Industrial Systems Engineering, University of Florida , city= Gainesville , country= USA organization= Spatial Sciences Institute, University of Southern California , city= Los Angeles , country= USA organization= Department of Geography Sustainability, University of Tennessee , city= Knoxville , country= USA

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DamageArbiter多模态仲裁框架,通过轻量级逻辑回归元分类器仲裁单模态与多模态模型预测分歧,在2556张街景图像上将准确率提升至75.85%,MCC达0.6188,并将过度自信误差从70.58%降至16.45%。

详情

展开后加载摘要…

URL PDF HTML 收藏