arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2607.02569 2026-07-07 cs.CV cs.LG 新提交 57%

Uncertainty-Aware Last-Layer Adaptation of RETFound for Referable Diabetic Retinopathy Screening Under Dataset Shift

数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应

Karim Mardhani

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。

Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 57%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01751 2026-07-03 cs.CV cs.AI 新提交 57%

MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准

Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01517 2026-07-03 cs.CL 新提交 57%

Parameter Golf: What Really Works?

参数高尔夫:什么真正有效?

Prashanna Mani Paudel, Shivanand Venkanna Sheshappanavar

机构 * Geometric Intelligence Research Lab., Department of Electrical Engineering and Computer Science University of Wyoming(几何智能研究实验室,电气与计算机科学系,怀俄明大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 通过分析社区竞赛中的2037个拉取请求和1430个评分提交,构建84种优化技术分类,测量每种技术对bits-per-byte的贡献,发现大多数技术收益在竞争提交中缩小,仅少数方法能持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 57%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00159 2026-07-02 cs.CL cs.CV cs.IR cs.MM 新提交 57%

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

识别和解决基于知识的VQA基准测试中的陷阱:审计、修复与增强

Qian Ma, S M Rayeed, Charles V. Stewart, Qiong Wu, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文审计现有KB-VQA基准测试,发现答案缺失/矛盾、问题不明确和视觉场景简单等系统性问题,导致准确率指标误导模型排名;提出审计-修复协议和多重实体增强协议,重新评估后性能趋势显著变化。

Comments Accepted to ECCV 2026. The datasets and code are available in https://github.com/VAN-QIAN/ECCV26-ARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30902 2026-07-01 q-bio.BM cs.CE cs.LG 新提交 57%

Structure-Regularized Interpretable TCR-Epitope Prediction

结构正则化的可解释TCR-表位预测

Jiarui Li, Zixiang Yin, Yunbei Zhang, Janet Wang, Samuel J. Landry, Zhengming Ding, Ramgopal R. Mettu

机构 * Department of Computer Science, Tulane University(杜兰大学计算机科学系) Department of Biochemistry and Molecular Biology, Tulane University School of Medicine(杜兰大学医学院生物化学与分子生物学系)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出TCR-SRIM模型,结合蛋白质语言模型嵌入与可解释接触原型,在TCR-XAI基准上实现最优预测性能和解释质量,并揭示生成结构对模型学习的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30686 2026-07-01 cs.RO cs.AI 新提交 57%

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning

立场:视觉-语言-动作模型无法被验证执行物理推理

Taozhao Chen, Ian Manchester, Huaming Chen

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文指出基于预训练视觉-语言模型的VLA系统在机器人操作基准上的性能提升无法区分语义匹配与物理泛化,现有评估指标不能验证物理推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27876 2026-07-01 cs.CV cs.AI 新提交 57%

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion

SpatialUAV:低空无人机感知、协作与运动的空间智能基准

Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie

机构 * IEEE

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出SpatialUAV基准,包含4331个实例和14种任务类型,评估低空无人机在语义判别、空间关系、多视角协作及运动理解等方面的空间智能,发现现有模型在跨视角关联、结构化定位、几何推理和时间理解上远逊于人类。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22678 2026-07-01 cs.SE cs.AI 新提交 57%

RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents

RigorBench: 自主AI编码代理中工程过程纪律的基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。

Comments 9 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27474 2026-06-29 cs.SE cs.AI 新提交 57%

Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks

推测性精炼:一种混合自回归扩散解码策略及其跨基准测试的行为

Aditi Gupta, Neel Mishra, Kushagra Trivedi, Pawan Kumar

机构 * IIIT Hyderabad

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出推测性精炼(SpecRef),一种无需训练的混合解码方法,通过熵引导选择性掩码从自回归草稿启动掩码扩散模型,并在六个基准上揭示代码基准的结构性混淆、精炼张力现象、似然与生成评估排名差异及后处理问题。

Comments 7 pages + 2 pages References

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27438 2026-06-29 cs.LG 新提交 57%

Unified Zero-Shot Time Series Forecasting: A Darts Foundation

统一零样本时间序列预测:Darts 基础模型

Zhihao Dai, Dennis Bader, Alain Gysi

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对基础模型接口碎片化问题,Darts 开发了统一 FoundationModel 类集合,提供标准化全周期预测接口,实现零样本或微调预测、不确定性估计和回测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24320 2026-06-29 cs.SD cs.AI 新提交 57%

ZONOS2 Technical Report

ZONOS2 技术报告

Gabriel Clark, Sofian Mejjoute, Mohamed Osman, George Close, Beren Millidge

机构 * Zyphra

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出ZONOS2 8B TTS模型,通过MoE架构、6M小时训练数据和简化后训练配方,在自然度、韵律和声音克隆保真度上达到最先进水平。

Comments 15 pages, 7 figures, 7 tables. Technical report. Model weights, inference code, and the ZTTS1-Eval benchmark released under Apache 2.0. Code: https://github.com/Zyphra/ZONOS2 ; weights: https://huggingface.co/Zyphra/ZONOS2 ; benchmark: https://github.com/Zyphra/ZTTS1-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27282 2026-06-26 cs.LG 新提交 57%

How Good Can Linear Models Be for Time-Series Forecasting?

线性模型在时间序列预测中能有多好?

Lang Huang, Jinglue Xu, Luke Darlow

机构 * Sakana AI, Tokyo, Japan(Sakana AI,日本东京) National Institute of Informatics, Japan(日本国立信息学研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 通过调整预处理(上下文长度、归一化、正则化、数据增强)而非扩大模型规模,Ridge回归在8个基准上超越Transformer、MLP和CNN,挑战了“更大容量带来更高精度”的假设。

Comments Project page: https://sakanaai.github.io/SearchCast/ 17 pages, 10 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27215 2026-06-26 cs.AI 新提交 57%

Vulnerability of Natural Language Classifiers to Evolutionary Generated Adversarial Text

自然语言分类器对进化生成的对抗文本的脆弱性

Manjinder Singh, Alexander E. I. Brownlee, Mohamed Elawady

机构 * University of Stirling(斯特灵大学) University of Strathclyde(斯特拉斯克莱德大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出GAversary混合遗传算法,仅利用模型logit输出作为黑盒,通过GloVe嵌入改进词替换的语义相似性,在多个基准数据集上显著降低目标模型准确率(最佳从76.8%降至5.8%),但扰动词数约为对比方法的两倍。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27187 2026-06-26 cs.CV cs.CL 新提交 57%

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

HarmVideoBench:大型多模态模型中有害视频理解的基准测试

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

机构 * Central South University(中南大学) Tsinghua University(清华大学) South China Normal University(华南师范大学) ByteDance Inc(字节跳动公司) University of Zaragoza(阿拉维达大学) CosmosMind Wuhan University(武汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Southeast University(东南大学) Tencent(腾讯公司) Nankai University(南开大学) Supermicro Computer Inc(Supermicro计算机公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26923 2026-06-26 cs.CL 新提交 57%

GAVEL: Grounded Caption Error Verification and Localization

GAVEL:基于视觉定位的标题错误验证与定位

Zixian Gao, Atsushi Hashimoto, Kuniaki Saito

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出GAVEL任务,联合解决图像-文本对的验证、解释和定位问题,构建数据集和基准,监督基线在定位和解释指标上持续改进。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交 57%

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 57%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25871 2026-06-25 cs.IR cs.AI 新提交 57%

AutoRelAnnotator: Calibrated Model Cascades for Cost-Efficient Relevance Evaluation in Sponsored Search

AutoRelAnnotator: 用于赞助搜索中成本高效的相关性评估的校准模型级联

Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出校准模型级联方法,通过路由查询至逐步增大的微调分类器,在保持高准确率的同时降低计算成本,实现大规模离线相关性标注。

Comments Accepted at E-commerce workshop, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25306 2026-06-25 cs.CV cs.AI 新提交 57%

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) AI2(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。

Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25246 2026-06-25 cs.CV cs.CL 新提交 57%

Multilingual Hematology Visual Question Answering Dataset

多语言血液学视觉问答数据集

Hajra Malik, Hafiza Tooba Aftab, Abdul Rehman, Mohsen Ali, Waqas Sultani

机构 * Information Technology University, Lahore(拉合尔信息技术大学) King Edward Medical University, Lahore(拉合尔爱德华国王医科大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对医疗领域多语言视觉问答资源匮乏的问题,构建了双语(英语-乌尔都语)血液学VQA基准WBCMor VQA,包含11万问答对和2万细胞图像,并评估了多个开源视觉语言模型。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25761 2026-06-25 cs.LG math.OC 新提交 57%

Bridging Spherical Black-Box Optimizers

桥接球形黑箱优化器

Johannes Ackermann, Stefano Peluchetti

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 将进化策略、共识优化和积分优化统一为理论框架,通过引入混合优化器控制平坦偏好和模态,在连续控制和语言模型合并任务中提升性能与鲁棒性。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24648 2026-06-24 cs.SD cs.CL eess.AS 新提交 57%

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

ParaPairAudioBench: 面向LALM-as-a-Judge的副语言成对音频基准

Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung, Hwiyeol Jo, Jeonghoon Kim, Jonghyun Choi, Soyoon Kim

机构 * Hongik University(弘益大学) Seoul National University(首尔大学) NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出ParaPairAudioBench,包含5,175对音频,覆盖风格、语速、重音、年龄和性别五个副语言维度,用于评估大型音频语言模型作为评判者的可靠性,发现其与人类判断差距大且校准失败严重。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24515 2026-06-24 cs.AI cs.HC 新提交 57%

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

基于自主评估的计算机使用智能体强化学习

Marta Sumyk, Oleksandr Kosovan

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出利用视觉语言模型自主评估任务完成度作为奖励信号,并引入噪声校正方法,在多个桌面环境上提升计算机使用智能体的成功率。

Comments Accepted to the 4th International Workshop on Generalizing from Limited Resources in the Open World (GLOW @ IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24115 2026-06-24 cs.CV cs.AI 新提交 57%

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

胃肠内窥镜中视觉语言模型幻觉检测的基准测试

Aminu Lawal, Niyoj Oli, Sachin Acharya, Prashnna Gyawali, Maria Carmen Romano, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息学研究所) West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对胃肠内窥镜领域,在Gut-VLM数据集上基准测试九种幻觉检测方法,发现白盒方法ReXTrust在所有五个视觉语言模型上AUC最高,平均领先19.5点。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA) 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19910 2026-06-24 cs.CL cs.SD eess.AS 新提交 57%

Light-weight Pronunciation Assessment via Discrete Speech Token Surprisal

轻量级发音评估:基于离散语音标记的意外度

Syeda Faiza Ahmed Sara, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, Doha, Qatar(卡塔尔计算研究所,多哈,卡塔尔)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出仅使用母语语音资源训练的轻量级发音评估框架,通过离散化语音标记和语言模型计算意外度,结合文本引导对齐特征,在无监督或少量校准下达到接近监督方法的性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22925 2026-06-23 cs.LG cs.NE 新提交 57%

EEG Benchmarking Needs a Task Specification Layer: NeuroDoc for Rulebook-Guided, Executable Benchmark Construction

EEG基准测试需要一个任务规范层:NeuroDoc用于基于规则手册的可执行基准构建

Chengxuan Qin, Zhige Chen, Shu Peng, Rui Yang, Jiping Cui, Yikai Dong, Jun Li, Liu Peng, Zhida Shang, Mingze Tang, Kay Chen Tan, Jibin Wu

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) School of Electrical Engineering, Electronics and Computer Science, University of Liverpool(利物浦大学电气工程、电子与计算机科学学院) School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出NeuroDoc框架,通过结构化任务规范语言和共享规则手册,将异构EEG数据集标准化为可重用基准单元,并发布包含53个条目、245个任务定义的社区审查基准语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22864 2026-06-23 cs.LG 新提交 57%

When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。

Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21954 2026-06-23 cs.CL 新提交 57%

Are Multilingual Models Actually Improving? Isolating True Cross-Lingual Transfer

多语言模型真的在改进吗?隔离真正的跨语言迁移

Prasoon Bajpai, Eleftheria Briakou, Colin Cherry, Preethi Jyothi, Vihari Piratla

机构 * Google DeepMind(谷歌DeepMind) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出硬度调整迁移(HAT)分数以准确衡量跨语言迁移强度,发现小模型迁移未失效、随模型大小迁移进步慢于预期、但随时间推移有明显进步。

详情

展开后加载摘要…

URL PDF HTML 收藏