arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2940 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2608.00011 2026-08-04 cs.CL cs.AI 新提交 81%

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

DLLM-TTS:用于文本到语音合成的块离散扩散语言模型

Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 DLLM-TTS 框架,将 TTS 建模为基于 X-Codec2 的条件块离散扩散,通过块内掩码扩散与并行预测实现高效语音生成,在 Seed-TTS-eval 基准上取得良好性能,兼具实用性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28641 2026-08-03 cs.CL cs.AI 新提交 81%

The Formalism Trap: Are LLM-as-a-Judge Evaluators Blinded by Consensus Mimicry under Social Load?

形式主义陷阱:社会负荷下作为评判者的大语言模型是否会被共识模仿蒙蔽?

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Agentic形式主义陷阱与评估失调指数,通过多领域轨迹分析揭示作为评判者的大语言模型易受句法触发影响,且该漏洞与领域无关,需架构特定的警戒过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27389 2026-07-31 cs.LG cs.AI 新提交 81%

FunL2O: LLM-Guided Feature Function Design for Learning to Optimize

FunL2O:面向学习优化的大语言模型引导特征函数设计

Bingheng Li, Junyang Cai, Yupeng Zhang, Bistra Dilkina, Jayant Kalagnanam, Dzung T. Phan

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出首个大语言模型驱动特征自动化设计的L2O统一框架FunL2O,经多类优化任务及四种大语言模型验证,其演化特征性能优于人工设计特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27275 2026-07-31 cs.LG cs.AI 新提交 81%

Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

Flat Score, Amplified Failures:误差预算如何掩盖量化大语言模型智能体中的损害

Jiwon Jang, Kisu Yang, Heuiseok Lim, Hyunwoo Park

专题命中 评测与基准 :LLM(title);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文以τ²-bench为基准,发现量化大语言模型智能体的分数看似平稳,但会放大原有工具调用失败,其损害被基准的10个错误预算掩盖,缩小预算可暴露该问题,相关诊断方法可与任务奖励一同报告。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26000 2026-07-29 cs.LG cs.AI 新提交 81%

Empirical Evaluation of Out-Of-Distribution Performance of Tabular Foundation Models

表格基础模型的分布外性能实证评估

Malena Loza, David Chushig-Muzo, Eva Milara, Luis Bote-Curiel, Luis Estrada-Petrocelli, Felipe Grijalva

机构 * Colegio de Ciencias e Ingenierías, Universidad San Francisco de Quito (USFQ)(基多圣弗朗西斯科大学科学与工程学院) Rey Juan Carlos University(胡安·卡洛斯国王大学) Facultad de Ingeniería, Universidad Latina de Panamá(巴拿马拉丁大学工程学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究对九种表格基础模型进行分布外性能实证评估,涵盖多种策略与架构,用三个真实世界数据集测试。结果显示模型在分布变化下会退化,还存在可扩展性差距,扩展了表格数据分布外的基准,为高风险领域应用提供证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24507 2026-07-28 cs.LG cs.AI 新提交 81%

UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective

统一融合:在统一反向速率目标下将自回归语言模型适配到离散扩散

Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) Wuhan University(武汉大学) MathonAI(未知(暂未找到合适中文翻译))

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究旨在将预训练的自回归语言模型适配到均匀噪声扩散。通过建立不同模型间联系并推导转换,提出UNIFUSION方法。经实验评估,该方法能改善生成困惑度与单字熵权衡,在相同规模模型中多项指标表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20494 2026-07-24 cs.AI cs.CR cs.LG 新提交 81%

Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation

从正则表达式中分离大语言模型对齐:对抗性变异下的零覆盖率和度量相关散度

Alexandre Cristovão Maiorano

机构 * Vertex AI(顶点人工智能)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在语料库被设计绕过正则表达式时大语言模型对齐情况,引入$L_5$-无正则表达式并评估,发现对齐贡献度量相关,自然语言探针中无额外覆盖率提升,对抗性变体中能检测到子串分类器错过的拒绝。

Comments 15 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20092 2026-07-23 cs.CV cs.AI cs.CL 新提交 81%

ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

ENTRAP-VL:视觉语言模型中双上下文夹带的分类探测器

Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

机构 * IIIT Delhi(德里信息技术学院) Dr. Ambedkar Institute of Technology(阿姆贝德卡尔技术学院) Heritage Institute of Technology(遗产技术学院) PwC(普华永道)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究视觉语言模型中上下文夹带现象,提出需构建分类结构化双模态工具。引入ENTRAP-VL数据集,含1500个项目,跨八类,分文本和视觉夹带流,提供工具、分类法及评估协议,助力社区严格研究该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19449 2026-07-23 cs.LG cs.AI cs.CR 新提交 81%

Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents

作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为

Aarushi Singh

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。

Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18454 2026-07-22 cs.LG cs.AI 新提交 81%

Estimating Rare Events in Language Models with Proper Evaluation

用适当评估估计语言模型中的罕见事件

Nikita Y. Parulekar, Anqi Liu

机构 * Johns Hopkins University(约翰·霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中罕见事件概率估计难题,提出梯度激活自适应多级分裂方法及移位幂布雷格曼损失,通过实验揭示偏差 - 方差权衡,强调估计器与部署上下文匹配,确立激活空间为易处理域。

Comments 37 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18305 2026-07-22 cs.LG cs.AI 新提交 81%

The Information Shadow: Measuring Structural Limits on What Language Models Can Learn

信息阴影:衡量语言模型学习的结构限制

Priyansh Srivastava, Romit Chatterjee

机构 * Sirena Ai(Sirena人工智能公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型学习的结构限制,引入信息阴影概念,包含语言无法表达的结构等三类。通过语言压缩残差等探针测试,揭示不同类型限制,发布探针套件并探讨其对基准设计等方面的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 81%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16031 2026-07-20 cs.LG cs.AI 新提交 81%

Revisiting data-driven dynamic security assessment with a tabular foundation model

使用表格基础模型重新审视数据驱动的动态安全评估

Olayiwola Arowolo, Maosheng Yang, Jochen Cremer

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对数据驱动的电力系统动态安全评估方法的局限,提出用表格基础模型,通过上下文学习评估稳定性,无需重新训练或调参。单个模型可评估多故障,经案例研究表明该模型用少量标记样本就能达到高分数,为电力系统基础模型开发部署奠基。

Comments Paper is in the review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13618 2026-07-16 cs.AI cs.LG 新提交 81%

STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle

库存盘点:使用公平预言机测量大语言模型智能体中感知与行动之间的差距

Sagar Deb, Ashwanth Krishnan

机构 * QpiAI

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体在多周决策任务中的知行差距,提出库存盘点基准,通过公平参考策略区分感知与行动失败,测量知行差距两方向,为评估大语言模型智能体提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13568 2026-07-16 cs.CL cs.LG 新提交 81%

Graded Entity-Familiarity Readouts in Language Models: Polish Adaptation, Cross-Language Robustness, and Refusal Steering

语言模型中的分级实体熟悉度读数:波兰语适配、跨语言鲁棒性和拒绝引导

Grzegorz Brzezinka

机构 * Prosit AS(Prosit公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型能否在生成答案前估计对实体的熟悉度,通过新数据集及实验发现熟悉度探测分数可区分实体,在波兰语适配家族中追踪实体受欢迎程度,跨语言鲁棒,在特定模型中可调节拒绝率,校准后的熟悉度探测有竞争力。

Comments 16 pages, 8 figures, 5 tables. Code and data: https://github.com/agentGreg/bielik-entity-familiarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11276 2026-07-14 cs.CL cs.AI cs.CY cs.MA 新提交 81%

Automated Textbook Auditing with Multi-Agent LLM Systems

使用多智能体大语言模型系统进行自动化教科书审核

Ciprian Cristescu, Adrian-Marius Dumitran, Angela-Liliana Dumitran, Gabriel Stefan

机构 * University of Bucharest(布加勒斯特大学) Dimitrie Cantemir Christian University(迪米特里·坎泰米尔基督教大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究旨在确保教材质量,提出人工智能教科书审核器这一多智能体管道,通过事实技术与语法双轨道分析生成报告,经判断智能体过滤误报,支持两种摄取模式且可领域适配,在两本教科书上验证可减少人工查找问题工作量。

Comments Presented @ iTextbooks 2026: 7th Workshop on Intelligent Textbooks at AIED'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10694 2026-07-14 cs.LG cs.AI 新提交 81%

Learning to Fine-tune Foundation Models under Resource Limitations

在资源受限情况下学习微调基础模型

Thomas Tsouparopoulos, Iordanis Koutsopoulos

机构 * Athens University of Economics and Business(雅典经济与商业大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究资源受限设备上基础模型的最优持续微调问题,将其建模为约束马尔可夫决策过程,提出基于强化学习的演员评论家算法,实验表明该方法在准确率上优于同预算微调方法,且大幅减少微调步骤。

Comments 6 pages, 2 figures, 1 table, accepted and presented at ICMLCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09739 2026-07-14 cs.AI cs.CL 新提交 81%

Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks

分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择

Jihan Yao, Gantavya Bhatt, Arnav Das, Peter Jin, Ke Bao, Qiaolin Yu, Khushi Bhardwaj, Chang Su, Jialei Wang, Yikai Zhu, Sugam Devare, Damon Mosk-Aoyama, Zhen Dong, Venkat Krishna Srinivasan, Yineng Zhang, Oleksii Kuchaiev, Jiantao Jiao, Banghua Zhu, Jeff Bilmes

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Oracle(甲骨文公司) Together AI(Together AI公司) LMSYS NVIDIA(英伟达公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型基准测试的核心集选择,采用评估无监督方法,利用次模子集选择,开发多种次模函数。在新大规模套件上实验发现设施选址函数效果好,该目标不限于特定模式,在相关排行榜上表现优且计算成本低,证明次模性对基准压缩有用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07720 2026-07-13 cs.LG cs.AI 新提交 81%

Omni-Sleep: A Sleep Foundation Model via Hierarchical Contrastive Learning of CNS-ANS Dynamics

全睡眠:一种通过中枢神经系统-自主神经系统动态分层对比学习的睡眠基础模型

Zhoujie Hou, Song Wang, Kexin Lou, Mo Wang, Chen Wei, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) Omni-Intelligence(全知智能) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 介绍全睡眠模型,利用CNS/ANS划分,通过分层对比学习的三个目标进行拓扑约束表示学习,在多中心多模态PSG数据预训练后用于睡眠分期和多疾病分类,性能优于基线,凸显生理层次对睡眠表示学习的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07047 2026-07-13 cs.CL cs.AI 新提交 81%

Riemannian Geometry for Pre-trained Language Model Embeddings

预训练语言模型嵌入的黎曼几何

Szczepan Konior, Alexandre Quemy, Przemysław Klocek, Bartłomiej Sobieski, Grégoire Cattan

机构 * IBM Automation and AI(IBM自动化与人工智能) Hother(霍瑟) University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究预训练语言模型嵌入的几何结构,提出黎曼均值池化方法,通过提取回拉度量并聚合,在三个数据集上RMP优于欧几里得均值池化,消融实验定位增益来源,训练好的编码器在特定数据集贡献额外信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08535 2026-07-10 cs.CL cs.AI 新提交 81%

When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

当评判者改变时,测量结果也会改变:评估大语言模型作为评判者的可靠性

Zongyou Yang, Yinghan Hou, Xiaokun Yang

机构 * Dyson School of Design Engineering, Imperial College London(伦敦帝国理工学院戴森设计工程学院) Department of Electrical and Electronic Engineering, Imperial College London(伦敦帝国理工学院电气与电子工程系) School of Electronic Information, Nanchang Institute of Technology(南昌工程学院电子信息学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型作为评判者时分数因评估者变化而改变的问题,通过在四个数据集上比较两种升级路径,发现评判者升级不可互换,强评判者可减偏差,重复采样陪审团作用有限,结构化辩论能改决策,提出报告应含多方面内容。

Comments 6 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07729 2026-07-10 cs.MA cs.AI cs.CL 新提交 81%

Collective Intelligence with Foundation Models

基于基础模型的集体智能

J. de Curtò, I. de Zarzà

机构 * Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, 08034 Barcelona, Spain Escuela Técnica Superior de Ingeniería (ICAI), Universidad Pontificia Comillas, 28015 Madrid, Spain Human Centered AI, Data \& Software, LUXEMBOURG Institute of Science

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究如何将多个基础模型协调成合作推理系统,提出多智能体框架,含求解器、批评和聚合智能体及评分模块。通过消融研究比较四种配置,发现模型异质性是性能提升关键,能提高逐步准确率、降低方差,还讨论了相关原则、方法及对应用人工智能的影响。

Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05679 2026-07-08 cs.CL cs.AI 新提交 81%

RPAM: A Principled Metric for Evaluating Associations in Language Models with High Predictive Validity in Downstream Outputs

RPAM:一种用于评估语言模型中关联的原则性度量,在下游输出中具有高预测有效性

Damian Hodel, Jevin West, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对语言模型偏差评估难题,引入相对概率关联度量(RPAM),通过对不同语言模型及评估数据集的实验,发现RPAM测量与人类观察到的关联及下游偏差紧密相关,优于先前记录值,有效填补了上游度量与现实世界关联关系研究的空白。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05365 2026-07-07 cs.CL cs.AI eess.AS 新提交 81%

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

SPEARBench:面向流式语音转语音语言模型的自然度评估基准

Thomas Thebaud, Yuzhe Wang, Hao Zhang, Sathvik Manikantan Napa Ugandhar, Ashish Hallur, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez

机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) Amazon Inc.(亚马逊公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有基准无法评估流式语音转语音模型对话自然度的问题,构建多维度评估基准SPEARBench,可从多维度评测模型,发现当前模型在多类对话行为维度仍与人类存在差距。

Comments Corresponding Website: https://thomasthebaud.github.io/SPEAR-benchmark-website/#welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04429 2026-07-07 cs.CL cs.AI 新提交 81%

evalci: A Python Library for Statistically Rigorous Comparison of Language Model Evaluations

Evalci:用于语言模型评估统计严格比较的Python库

Shreyas K Chandrahas

机构 * Shreyaskc(Shreyas K Chandrahas)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型评估中仅依单一准确率数字判断优劣的问题,用evalci库通过统计方法处理结果表,给出严谨结论,如置信区间等,还通过案例分析发现部分排行榜差距无统计学意义。

Comments 7 pages, 1 figure. Software: https://pypi.org/project/evalci/ (source: https://github.com/Shreyaskc/evalci, Zenodo DOI: 10.5281/zenodo.21201815)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03298 2026-07-07 cs.LG cs.AI econ.GN physics.ao-ph q-fin.EC 新提交 81%

A harmonised dataset for Earth system foundation models

用于地球系统基础模型的统一数据集

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano, Department of Management, Economics and Industrial Engineering(米兰理工大学管理、经济与工业工程系) RFF-CMCC European Institute on Economics and the Environment(资源未来研究所-欧洲经济与环境CMCC研究所) CMCC Foundation - Euro-Mediterranean Center on Climate Change(CMCC基金会-欧洲地中海气候变化中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对地球系统基础模型训练数据缺乏统一资源的问题,构建WorldTensor数据集,整合多类数据到标准网格,为训练和评估模型提供资源,推动多模态地球系统基础模型发展。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31407 2026-07-01 cs.CV cs.AI cs.CL 新提交 81%

Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?

视觉语义熵:视觉语言模型能否识别视觉模糊性?

Ta Duc Huy, Trang Nguyen, Townim Chowdhury, Ankit Yadav, Minh-Son To, Zhibin Liao, Johan W. Verjans, Vu Minh Hieu Phan

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Flinders University(弗林德斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在模糊输入下产生自信错误预测的问题,提出视觉语义熵(VSE),通过仅扰动图像并聚类生成答案的语义原型来量化不确定性,在五个模型和五个基准上达到最优。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24995 2026-06-25 cs.LG cs.AI q-bio.QM 新提交 81%

Are Tabular Foundation Models Robust to Realistic Query Distribution Shifts in Microbiome Data?

表格基础模型对微生物组数据中真实查询分布偏移的鲁棒性如何?

Giulia Perciballi, Ahmad Fall, Federica Granese, Edi Prifti, Jean-Daniel Zucker

机构 * IRD, Sorbonne Université, Unité de Modélisation Mathématique et Informatique des Systèmes Complexes (UMMISCO)(法国发展研究所、索邦大学、复杂系统数学建模与信息学单元) Inria, CNRS, I3S, Université Côte d’Azur(法国国家信息与自动化研究所、法国国家科学研究中心、信息系统与软件工程实验室、蔚蓝海岸大学) INSERM, Nutrition et Obésités(法国国家健康与医学研究院、营养与肥胖症) Approches Systémiques, NutriOmique, AP-HP, Hôpital Pitié-Salpêtrière(系统方法、营养组学、巴黎公立医院集团、皮提耶-萨勒佩特里医院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入基准测试,评估表格基础模型在六个人类肠道微生物组数据集上对三种生物启发式扰动(去除高丰度类群、稀疏化、零值注入)的鲁棒性,发现即使保留判别性特征,模型性能仍下降,零值注入破坏性最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24388 2026-06-24 cs.AI cs.LG 新提交 81%

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

PHANTOM:面向视觉-语言模型的多模态对抗攻击大规模数据集

Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

机构 * The Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所(AI4I)) HikmaAI S.r.l.(HikmaAI有限责任公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一个大规模开源对抗攻击数据集PHANTOM,涵盖10个高级类别和55个子类别的有害意图,包含47,524个对抗样本,旨在降低对抗研究门槛,促进VLM鲁棒性和安全性的系统评估。

Comments The dataset has been released at: https://huggingface.co/datasets/it4lia/PHANTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22043 2026-06-23 cs.AI cs.CV cs.LG 新提交 81%

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制

Zekun Xu

机构 * Zekun Xu(徐泽坤)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏