arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 766 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 164 篇

2606.20512 2026-06-23 cs.SE cs.LG 新提交 70%

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

代码代理的仓库指导的探测与精炼调优

Asa Shepard, Jeannie Albrecht

机构 * Williams College(威廉姆斯学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出探测与精炼调优方法,通过合成bug修复探测迭代诊断和修补仓库指导文件,在SWE-bench Verified上以Qwen3.5-35B-A3B模型达到33.0%解决率,优于静态知识库的28.3%和无指导基线的25.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20177 2026-06-23 cs.CV cs.AI 新提交 70%

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

评估与增强遥感多模态大语言模型的否定理解能力

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学) Central South University(中南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13312 2026-06-23 cs.MM cs.LG 版本更新 70%

Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架

Yuxuan Yang, Xiaotong Mao, Jingyao Wang

机构 * National Jiangsu University of Finance(江苏财经大学) University of Lorraine(洛林大学) Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Design-MLLM框架,通过双分支美学导向奖励的强化对齐,解决室内设计中空间可行性硬约束与美学偏好软约束的矛盾,生成既可行又美观的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01152 2026-06-23 cs.AI 版本更新 70%

DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent

DeepResearch-9K:一个具有挑战性的深度研究智能体基准数据集

Tongzhou Wu, Yuhao Wang, Xinyu Ma, Xiuqiang He, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 为解决深度研究智能体缺乏大规模挑战性数据集和开源训练框架的问题,构建了DeepResearch-9K数据集,包含9000个多难度问题、搜索轨迹和可验证答案,并开发了开源训练框架DeepResearch-R1,实验表明训练后的智能体在基准测试上达到最优。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21735 2026-06-23 eess.AS cs.SD 新提交 67%

Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake

弥合年龄差距:面向检测神经音频编解码器合成的老年语音深度伪造

Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar, Chi-Chun Lee

机构 * BIIC Lab, NTHU, Taiwan(国立台湾大学BIIC实验室) UPES, India(印度UPES大学) VBSPU, India(印度VBSPU大学)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 提出老年语音编解码伪造检测(ECFD)任务,发布中英文ECF数据集,发现现有检测器泛化差,利用多模态基础模型融合(BONSAI框架)实现1.66%平均等错误率,建立新基准。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23081 2026-06-23 cs.DB 新提交 67%

SemCEB: A Cardinality Estimation Benchmark for Semantic Operators

SemCEB:面向语义操作符的基数估计基准

Andreas Zimmerer, Claudius Kühn, Yang Li, Mihail Stoian, Renata Borovica-Gajic, Andreas Kipf

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SemCEB基准,用于评估语义过滤和连接操作符的基数估计方法,基于真实多模态数据,评估采样和语义直方图方法的准确性、成本、延迟和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22699 2026-06-23 cs.CV cs.MM 新提交 67%

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

无需发送视频即可识谎:隐私保护的多模态欺骗检测

Nikita Sharma, Pranav Sara, Karan Singla

机构 * University of California, San Diego(加州大学圣迭戈分校) Case Western Reserve University, Ohio(凯斯西储大学) WhissleAI, USA(WhissleAI(美国))

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出Whissle方法,通过设备端提取文本、情感、行为等紧凑摘要,在无需传输原始视频的情况下实现与云端模型相当的欺骗检测性能(AUC 0.741),并揭示先前75%准确率存在说话者泄露问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22274 2026-06-23 cs.CL cs.AI cs.LG 新提交 67%

From Speech to Text Corpora: Evaluating ASR-Based Data Acquisition for Low-Resource Fongbe and Hausa

从语音到文本语料库:评估基于ASR的低资源Fongbe和豪萨语数据采集

Mahounan Pericles Adjovi, Victor Olufemi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) North-West University(北开普大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究利用ASR管道为低资源非洲语言Fongbe(声调语言)和豪萨语(非声调语言)扩展文本语料,通过微调MMS-300M和Whisper-Small模型,在Fongbe上实现9.48%的词错误率(相对降低78%),并评估转录质量,发现豪萨语接近可用而Fongbe需后处理。

Comments 10 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21309 2026-06-23 cs.CV 新提交 67%

WildBox: A Dataset and Benchmark for Aerial Monocular 3D Detection of African Savanna Wildlife

WildBox: 非洲稀树草原野生动物航拍单目3D检测数据集与基准

Vandita Shukla, Kilian Meier, Lucie Laporte-Devylder, Camille Rondeau Saint-Jean, Jenna M. Kline, Blair R. Costelloe, Devis Tuia, Fabio Remondino, Benjamin Risse

机构 * D Optical Metrology Unit, Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会3D光学计量部) Computer Vision and Machine Learning Systems group, Institute for Geoinformatics, University of Muenster(明斯特大学地理信息学研究所计算机视觉与机器学习系统组) School of Civil, Aerospace and Design Engineering, University of Bristol(布里斯托大学土木、航空航天与设计工程学院) Department of Biology, University of Southern Denmark(南丹麦大学生物学系) The Ohio State University(俄亥俄州立大学) Department of Collective Behavior, Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所集体行为系) University of Konstanz(康斯坦茨大学) Centre for the Advanced Study of Collective Behaviour, University of Konstanz(康斯坦茨大学集体行为高级研究中心) Department of Biology, University of Konstanz(康斯坦茨大学生物学系) Environmental Computational Science and Earth Observation Laboratory, EPFL(瑞士联邦理工学院环境计算科学与地球观测实验室)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 提出WildBox数据集,含23.7万3D框标注,评估两种开放词汇单目3D架构,发现零样本3D检测失败,微调后恢复性能,深度估计是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20770 2026-06-23 cs.CL cs.AI cs.LG 新提交 67%

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。

Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 67%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21877 2026-06-23 cs.CV 67%

How to Take a Memorable Picture? Empowering Users with Actionable Feedback

如何拍摄令人难忘的照片?通过可操作反馈赋能用户

Francesco Laiti, Davide Talon, Jacopo Staiano, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Travelbrain srl(Travelbrain公司) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MemFeed任务,通过MemCoach利用多模态大语言模型提供自然语言建议,提升图像回忆性,展示其在多个模型上的有效性。

Comments Accepted @ CVPR 2026. Project page: https://laitifranz.github.io/MemCoach/

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 29738-29749

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23293 2026-06-23 cs.GT cs.CY 67%

Impacts of Aggregation on Model Diversity and Consumer Utility

聚合对模型多样性与消费者效用的影响

Kate Donahue, Manish Raghavan

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究探讨了聚合对模型多样性和消费者效用的影响,提出加权胜率机制以提升生产者专业化和消费者福利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21843 2026-06-23 cs.AI cs.CL 新提交 62%

Measuring What Persists: Conditioning Mechanisms and a Geometric Framework for AI Agent Identity

测量持续存在的内容:AI智能体身份的调节机制与几何框架

Andrew Tanner

机构 * Anisotrope AI

专题命中 评测与基准 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出基于√JSD度量空间和丰富范畴理论中幅度同调的几何框架,用于测量AI智能体身份结构,发现双机制调节结构:身份真空簇和安全盆地簇,并通过等边探针基线验证身份规范创造可测量的行为丰富性。

Comments 29 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 62%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10580 2026-06-23 cs.CL cs.AI cs.CY cs.HC 62%

An Offline Mobile Conversational Agent for Mental Health Support: Learning from Emotional Dialogues and Psychological Texts with Student-Centered Evaluation

面向心理健康支持的离线移动对话代理:通过情感对话和心理文本学习并以学生为中心评估

Vimaleswar A, Prabhu Nandan Sahu, Nilesh Kumar Sahu, Haroon R. Lone

机构 * Department of Electrical Engineering and Computer Science, Indian Institute of Science Education and Research Bhopal(电子工程与计算机科学系,比哈尔印度科学教育与研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EmoSApp,一个离线智能手机应用,利用定制知识数据集训练的语言模型,提供心理健康支持,并通过学生和专业人员的定性评估及多项基准测试验证其在低资源环境下的有效性。

Journal ref https://aclanthology.org/2025.ijcnlp-long.191/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22925 2026-06-23 cs.LG cs.NE 新提交 57%

EEG Benchmarking Needs a Task Specification Layer: NeuroDoc for Rulebook-Guided, Executable Benchmark Construction

EEG基准测试需要一个任务规范层:NeuroDoc用于基于规则手册的可执行基准构建

Chengxuan Qin, Zhige Chen, Shu Peng, Rui Yang, Jiping Cui, Yikai Dong, Jun Li, Liu Peng, Zhida Shang, Mingze Tang, Kay Chen Tan, Jibin Wu

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) School of Electrical Engineering, Electronics and Computer Science, University of Liverpool(利物浦大学电气工程、电子与计算机科学学院) School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出NeuroDoc框架,通过结构化任务规范语言和共享规则手册,将异构EEG数据集标准化为可重用基准单元,并发布包含53个条目、245个任务定义的社区审查基准语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22864 2026-06-23 cs.LG 新提交 57%

When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。

Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21954 2026-06-23 cs.CL 新提交 57%

Are Multilingual Models Actually Improving? Isolating True Cross-Lingual Transfer

多语言模型真的在改进吗?隔离真正的跨语言迁移

Prasoon Bajpai, Eleftheria Briakou, Colin Cherry, Preethi Jyothi, Vihari Piratla

机构 * Google DeepMind(谷歌DeepMind) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出硬度调整迁移(HAT)分数以准确衡量跨语言迁移强度,发现小模型迁移未失效、随模型大小迁移进步慢于预期、但随时间推移有明显进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21419 2026-06-23 cs.CV cs.AI 新提交 57%

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning

MIRCaps: 一个大规模混合域数据集,包含图像级和区域级描述,用于细粒度视觉-语言学习

Arlindo Luciano Tulumba Roberto, Hyungjoon Kim

机构 * Changwon National University(昌原国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 为解决通用与监控视频领域的混合域图像-描述数据集匮乏问题,构建了包含14万图像、98万图像级描述、174万区域级描述和139万边界框的大规模数据集,通过互补描述类型帮助视觉语言模型学习细粒度视觉属性,并在图像描述和目标检测任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21315 2026-06-23 cs.AI 新提交 57%

Social World Model for Lifelong Social Intelligence

社会世界模型:面向终身社会智能

Yu Luo

机构 * Central South University(中南大学)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI

AI总结 提出社会世界模型,将社交互动分解为五个维度构建闭环学习框架,并配套数据合成机制与终身学习基准,使小模型可持续获取社会协调能力。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21116 2026-06-23 cs.CV cs.AI 新提交 57%

ConnectomeBench2: A Unified Benchmark for Automated Connectomic Proofreading

ConnectomeBench2:用于自动连接组校对的标准基准

Jeff Brown, Tim Farkas, Gleb Razgar, Edward S. Boyden

机构 * MIT(麻省理工学院) The Open University(开放大学) Mindspan Institute(Mindspan研究所) Yang Tan Collective(杨谭集团) McGovern Institute(麦戈文研究所) MIT Departments of Brain and Cognitive Sciences and Biological Engineering(麻省理工学院脑与认知科学系和生物工程系)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 提出ConnectomeBench2基准,包含超过716,485个专家标注的校对决策,训练单一Vision Transformer模型,在跨物种的分割错误校正和合并错误识别上达到人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21020 2026-06-23 cs.CV cs.AI 新提交 57%

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

CheXpercept: 评估胸部X光片中专家级病变感知的基准

Geon Choi, Hangyul Yoon, Nalee Kim, Jeong Yun Jang, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医疗中心) Konkuk University Medical Center(建国大学医疗中心)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出CheXpercept基准,通过粗粒度检测、细粒度轮廓评估与修正、语义级属性提取三个层次评估视觉语言模型在胸部X光片上的专家级病变感知能力,发现当前模型仅在粗粒度任务上表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20999 2026-06-23 cs.RO cs.LG 新提交 57%

Inductive Generalization for Robotic Manipulation

机器人操作的归纳泛化

Annabella Macaluso, Haochen Zhang, Ishaan Masilamony, Yingshan Chang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20889 2026-06-23 cs.LG stat.ML 新提交 57%

Temporal Causal Prior-Data Fitted Networks for Panel Data with Learned Reliability Signals

面向面板数据的时间因果先验数据拟合网络及其学习到的可靠性信号

Shravan Talupula, Saurabh Sharma

机构 * ProfitOps Inc.(ProfitOps公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出TCPFN,一种零样本时间因果发现基础模型,通过因果判断头联合预测多种因果属性,结合混合训练先验和离散令牌面板数据架构,实现工业规模推理,在多个基准上达到竞争性性能。

Comments 42 pages, 6 figures, 9 tables. Code and pretrained checkpoint to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05469 2026-06-23 cs.LG cs.IT math.IT 版本更新 57%

Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes

逐步测量信息:超越情绪的AI评估

Zachary Robertson, Sanmi Koyejo

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 本文提出基于AI的评估方法,通过战略游戏与信息损失的联系,分析对抗操纵下鲁棒的机制,证明总变差距离在对抗攻击下保持多项式保证,提升信息关系提示的鲁棒性。

Comments Accepted to TMLR (2026). Updated appendix to restore the proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16494 2026-06-23 cs.LG eess.SP 57%

Manifold Learning for Personalized and Label-Free Detection of Cardiac Arrhythmias

基于流形学习的个性化和无标签心律失常检测

Amir Reza Vazifeh, Jason W. Fleischer

机构 * Department of Electrical and Computer Engineering, Princeton University, Princeton, 08544, New Jersey, USA(电气与计算机工程系,普林斯顿大学) Princeton Precision Health, Princeton University, Princeton, 08544, New Jersey, USA(普林斯顿精准健康,普林斯顿大学) Omenn-Darling Bioengineering Institute, Princeton University, 35 Ivy Lane, Princeton, 08540, New Jersey, USA(Omenn-Darling生物工程研究所,普林斯顿大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本文提出利用非线性降维方法在无监督条件下检测心律失常,通过MIT-BIH数据库验证,NLDR能有效区分正常与异常心跳,实现高准确率分类。

Journal ref Informatics in Medicine Unlocked 64 (2026) 101770

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12911 2026-06-23 cs.CL 版本更新 57%

ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark

ViMedCSS:越南语医学术语代码转换语音数据集与基准

Tung X. Nguyen, Nhu Vo, Giang-Son Nguyen, Duy Mai Hoang, Chien Dinh Huynh, Inigo Jauregi Unanue, Massimo Piccardi, Wray Buntine, Dung D. Le

机构 * College of Engineering and Computer Science(工程与计算机科学学院) Center for AI Research(人工智能研究中心) College of Health Sciences(健康科学学院) University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 针对越南语医学术语代码转换问题,构建了34小时语音数据集ViMedCSS,评估多种ASR模型并探索微调策略,发现越南语优化模型与多语言预训练结合效果最佳。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11454 2026-06-23 cs.CV cs.AI 57%

HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation

HumaniBench: 一种以人为中心的大型多模态模型评估框架

Shaina Raza, Aravind Narayanan, Vahid Reza Khazaie, Ashmal Vayani, Ahmed Y. Radwan, Mukund S. Chettiar, Amandeep Singh, Mubarak Shah, Deval Pandya

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究院) University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文提出HumaniBench框架,通过32000个专家验证的图像-问题对评估大型多模态模型在公平性、伦理、包容性等人类中心原则上的对齐情况,揭示了不同模型在伦理、推理和共情方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22868 2026-06-23 eess.AS 新提交 50%

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

MSU-Bench:面向对话多说话人场景中以说话人为中心的理解

Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao, Yuang Cao, Chunjiang He, Pan Zhou, Lei Xie

专题命中 评测与基准 :language model(abstract)

AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。

Comments 4 pages, accepted by interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏