arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2607.01973 2026-07-03 cs.CV cs.AI cs.LG 新提交 62%

Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias

评估视觉语言模型在图像退化与偏差下进行医学图像质量评估的可靠性

Sofiane Ouaari, Kevin Vorwalder, Nico Pfeifer

机构 * University of Tuebingen(图宾根大学) Institute for Bioinformatics and Medical Informatics (IBMI), University of Tuebingen(图宾根大学生物信息学与医学信息学研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型在医学图像质量评估中,面对图像退化(如像素化)和文本属性偏差时的可靠性,发现像素化显著降低性能,而文本属性(如机构声望)引入偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01709 2026-07-03 cs.AI cs.LG 新提交 62%

COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows

COMFYCLAW:面向图像生成工作流的自进化技能工具包

Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

机构 * University of Maryland(马里兰大学) University of Pennsylvania(宾夕法尼亚大学) Nvidia(英伟达) Lehigh University(里海大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00325 2026-07-02 cs.LG cs.CL 新提交 62%

Watermarking for Proprietary Dataset Protection

专有数据集保护的水印技术

John Kirchenbauer, Brian R. Bartoldson, Bhavya Kailkhura, Tom Goldstein

机构 * University of Maryland(马里兰大学) Lawrence Livermore National Labs(劳伦斯利弗莫尔国家实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 针对生成模型训练数据成员推断难题,提出基于水印的数据集推断方法,在子集暴露充分时达到与传统损失法相当的检测性能。

Comments 8 pages and 6 figures in the main body; presented at the ICML 2026 Workshop on Trustworthy AI for Good

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32002 2026-07-01 cs.AI cs.LG 新提交 62%

Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA

自我学习再思考:从自生成问答中学习的隐藏脆弱性

Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin, Alexey Kadeishvili, Aleksandr Beznosikov

机构 * BRAIn Lab(BRAIn实验室) Yandex Research(Yandex研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文揭示语言模型从自生成问答对学习中存在的脆弱性:生成阶段会偏向选择显著内容并服从文本中的指令式段落,导致覆盖不均和注入偏差。通过固定目标问题和过滤指令式跨度可显著降低偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31179 2026-07-01 cs.AI cs.CL cs.CV 新提交 62%

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

机构 * Microsoft(微软)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30702 2026-07-01 cs.LG cs.AI stat.ML 新提交 62%

Accelerometry-Derived Digital Biomarkers for Cardiometabolic Risk: A Population-Representative Tabular Benchmark with Uncertainty Quantification

基于加速度计的心血管代谢风险数字生物标志物:一个具有不确定性量化的群体代表性表格基准

Federico Felizzi

机构 * SIIAM, Rome, Italy(意大利罗马SIIAM)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 基于NHANES 2003-2006数据构建加速度计心血管代谢基准,评估三种表格学习方法预测HbA1c、甘油三酯和CRP的性能,并应用分裂共形预测进行不确定性量化与公平性分析。

Comments Accepted at the SD4H Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23375 2026-07-01 cs.CL cs.AI 新提交 62%

Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

测量与缓解多语言刑事法庭中大语言模型的过度对齐

Arthur Wuhrmann, Gaetan Stein, Daniel Brunner, Andrei Kucharavy

机构 * Swiss Federal Supreme Court(瑞士联邦最高法院) HES-SO Valais-Wallis(HES-SO瓦莱州-瓦利斯高等专业学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对刑事法律场景中大语言模型因安全护栏导致拒绝响应(过度对齐)的问题,提出TF-RefusalBench基准,并评估提示工程与拒绝方向消融(abliteration)等缓解方法。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27539 2026-06-29 cs.SI cs.AI cs.LG 新提交 62%

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

基于多模态图的社交媒体流行度预测基准测试

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) University of Georgia(佐治亚大学) Adobe Research(Adobe研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 提出统一的多模态图基准MMG-Pop和模型MMG-PopNet,联合建模文本、视觉、时间与社交交互信号,在Bluesky和Reddit数据集上验证了跨平台泛化与多模态贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16682 2026-06-29 cs.LG cs.CL 新提交 62%

Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

多模态评估者偏好坍缩:自进化智能体中的跨模态传染

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究多模态自评估中偏好坍缩的加剧现象,发现跨模态传染导致策略选择扭曲,并引入传染矩阵量化风险。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11585 2026-06-29 cs.LG cs.CL nlin.AO 新提交 62%

Kuramoto Attention: Synchronizing Self-Attention on the Torus

Kuramoto注意力:在环面上同步自注意力

Joshua Nunley

机构 * Department of Informatics, Luddy School of Informatics, Computing, and Engineering, Cognitive Science Program, Indiana University Bloomington(印第安纳大学伯明顿分校信息学系,卢迪信息学、计算与工程学院,认知科学项目)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出Kuramoto注意力层,将隐藏坐标视为角度,通过门控余弦相似度和环形均值更新实现自注意力,等价于Kuramoto耦合项,在字符级语言建模中达到与强基线相近的性能。

Comments 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交 62%

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21843 2026-06-23 cs.AI cs.CL 新提交 62%

Measuring What Persists: Conditioning Mechanisms and a Geometric Framework for AI Agent Identity

测量持续存在的内容:AI智能体身份的调节机制与几何框架

Andrew Tanner

机构 * Anisotrope AI

专题命中 评测与基准 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出基于√JSD度量空间和丰富范畴理论中幅度同调的几何框架,用于测量AI智能体身份结构,发现双机制调节结构:身份真空簇和安全盆地簇,并通过等边探针基线验证身份规范创造可测量的行为丰富性。

Comments 29 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 62%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08810 2026-06-17 cs.CL cs.LG 新提交 62%

Continuous Language Diffusion as a Decoder-Interface Problem

连续语言扩散作为解码器-接口问题

Zhicheng Du, Lan Ma

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院, 清华大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究连续扩散语言模型如何从高斯噪声生成流畅文本,提出解码器-盆地机制,并设计诊断协议揭示标量指标隐藏的失败,通过接口相图解释令牌恢复行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17006 2026-06-16 cs.SD cs.AI cs.LG cs.MM eess.AS 新提交 62%

TuneJury: An Open Metric for Improving Music Generation Preference Alignment

TuneJury: 一种改进音乐生成偏好对齐的开放指标

Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Junghyun Koo, Koichi Saito, Yuki Mitsufuji, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼AI) Georgia Tech(佐治亚理工学院) KAIST(韩国科学技术院) Peking University(北京大学) QMUL(伦敦玛丽女王大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出TuneJury,一个开放、实例级别的成对奖励模型,用于文本到音乐生成,通过预测偏好分数支持数据筛选、后处理校准,并在推理、优化和训练中提升对齐效果。

Comments 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14604 2026-06-15 cs.LG cs.AI 新提交 62%

A Comparative Study of Deep Learning Architectures for Multi-Horizon Behavioural Forecasting for Mobile Health

移动健康多时间范围行为预测的深度学习架构比较研究

Pavlos Nicolaou, Kleanthis Malialis, Artemis Kontou, Panayiotis Kolios

机构 * KIOS Research and Innovation Center of Excellence, University of Cyprus(塞浦路斯大学KIOS研究与创新卓越中心) Department of Electrical and Computer Engineering, University of Cyprus(塞浦路斯大学电气与计算机工程系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究在三个公开数据集上系统比较了六种深度学习架构、两种零样本基础模型和统计基线在1-8天时间范围内的行为预测性能,发现PatchTST表现最佳,基础模型TimesFM在低数据场景下可与训练模型匹敌,且参与者级微调可将RMSE降低16-60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13870 2026-06-15 cs.CV cs.AI cs.LG 新提交 62%

Mirage Probes: How Vision Models Fake Visual Understanding

幻象探针:视觉模型如何伪造视觉理解

Daniel Ben-Levi, Judah Goldfeder, Weiliang Zhao, Raz Lapid, Amit LeVi, Allen G. Roush, Ravid Shwartz-Ziv, Hod Lipson

机构 * Columbia University(哥伦比亚大学) Intuit Technion(以色列理工学院) Thoughtworks New York University(纽约大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出幻象探针框架,通过对比探针揭示视觉语言模型在无图像时也能回答问题的两种幻象行为:文本偏见和虚假图像,并证明后者需要表征级干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13815 2026-06-15 cs.AI cs.CL 新提交 62%

Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs

Poker Arena: 大型语言模型中策略推理与记忆的多轴剖析

Pratham Singla, Shivank Garg, Vihan Singh

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Raeth AI

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Poker Arena平台,通过三层记忆架构和九轴认知剖面分解策略推理,揭示标量排行榜系统性误排模型能力结构。

Comments 33 pages, ICML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12608 2026-06-12 cs.CL cs.LG 新提交 62%

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

购物推理基准:面向多轮对话购物助手的专家编写基准

Shuxian Fan, Seonwoo Min, Youna Hu, Botao Xia, Jayakrishnan Unnikrishnan, Rowan Musselmann, Yifan Gao, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11247 2026-06-11 cs.LG cs.AI cs.AR 新提交 62%

Physics-informed generative AI for semiconductor manufacturing: Enforcing hard physical constraints in generative models by construction

物理信息驱动的生成式AI在半导体制造中的应用:通过构造强制生成模型中的硬物理约束

Yaser Mike Banad, Sarah Sharif

机构 * School of Electrical and Computer Engineering, University of Oklahoma(俄克拉荷马大学电气与计算机工程学院) Center for Quantum Research and Technology, University of Oklahoma(俄克拉荷马大学量子研究与技术中心) Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Laboratory(创新研究与工程智能神经形态与量子理解实验室) Material Science and Engineering Program, University of Oklahoma, Norman, OK 73019 USA(俄克拉荷马大学材料科学与工程项目,Norman, OK 73019 USA)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对半导体制造中生成模型必须满足硬物理约束的问题,本文提出通过构造集成物理信息(如物理信息扩散、PDE约束变分模型等)来强制约束,而非事后过滤,并给出四种集成模式和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11063 2026-06-10 cs.AI cs.LG 新提交 62%

CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs

CIAware-Bench: 评估前沿大语言模型的控制干预感知能力

Joachim Schaeffer, Thomas Jiralerspong, Alexander Panfilov, Guillaume Lajoie, Jonas Geiping, Yoshua Bengio, Roland S. Zimmermann

机构 * MATS Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Astra Fellowship ELLIS Institute Tübingen, MPI for Intelligent Systems & Tübingen AI Center LawZero Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出CIAware-Bench基准,通过四个任务域测试模型能否区分自身轨迹与被控制干预修改的轨迹,发现前沿模型在默认设置下感知能力低至中等,且因任务和模型对而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10530 2026-06-10 cs.LG cs.AI 新提交 62%

Machine Learning Methods for Studying Latent Neural Activity Dynamics

研究潜在神经活动动力学的机器学习方法

Shufeng Kong, Fumei Deng, Xinyi Dong, Caihua Liu, Weiwei Chen, Yingheng Wang, Daniel Cao, Azahara Oliva, Antonio Fernandez-Ruiz, Carla Gomes

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) Department of Computer Science, Cornell University(康奈尔大学计算机科学系) Department of Neurobiology and Behavior, Cornell University(康奈尔大学神经生物学与行为学系) Department of Ecology and Evolutionary Biology, Cornell University(康奈尔大学生态学与进化生物学系) School of Computer Science and Artificial Intelligence, Foshan University(佛山大学计算机科学与人工智能学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 综述从状态空间模型到深度生成模型的潜在变量模型,涵盖单区域动力学、多区域通信和行为对齐建模,并讨论大规模神经基础模型及未来挑战。

Comments Accepted by IJCAI 2026 survey track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09470 2026-06-09 cs.CL cs.AI 新提交 62%

A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

一种用于联合多粒度L2评估和自然语言解释的微调SpeechLLM

Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik

机构 * Centre for Language Studies, Radboud University(语言研究中心,拉德堡德大学)

专题命中 评测与基准 :preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于评分准则的SpeechLLM,通过混合训练目标联合预测句子级和词/音素级标签并生成自然语言解释,在SpeechOcean762上达到或超越单粒度模型。

Comments Accepted to Interspeech 2026. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants, which is financed by the Dutch Research Council (NWO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08932 2026-06-09 cs.CL cs.AI cs.CE 新提交 62%

From Statute to Control Flow: Span-Grounded Deontic Trees for Defeasible Scope Parsing

从法规到控制流:基于跨度义务树的可废止范围解析

Jian Chen, Siyuan Li, Chucheng Wan, Zixuan Yuan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-Sen University(中山大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出NormBench基准和跨度义务树(SG-DT)中间表示,用于诊断和缓解规则遵循模型中的静默范围遗漏(SSO)问题,揭示递归衰减和可审计性陷阱两种病理,并通过约束输出改善树结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08481 2026-06-09 cs.LG cs.AI cs.DB cs.SE 新提交 62%

PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems

PIPE-Cypher:面向文本到Cypher系统的自动企业基准生成

Suraj Ranganath, Anish Raghavendra

机构 * Halıcıoğlu School of Data Science and Computing, University of California, San Diego(加利福尼亚大学圣迭戈分校哈勒乔卢数据科学与计算学院) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 提出PIPE-Cypher流水线,利用本地大模型从企业属性图自动生成平衡的NL-to-Cypher基准,通过模式分析、逆向查询约束生成和执行验证等步骤,实现可重复的基准构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08056 2026-06-09 cs.CL cs.AI 新提交 62%

What's the Point? Spatial Grammar & Index Resolution for Sign Language Processing

要点何在?手语处理中的空间语法与索引解析

Oline Ranum, Simon Hadfield, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音与信号处理中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对手语中占10-15%但被忽视的空间索引现象,提出索引检测与话语实体链接的分解框架,建立索引感知手语建模基线,并作为辅助专家提升冻结手语识别模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07141 2026-06-08 cs.LG cs.AI 新提交 62%

REMEDI: A Benchmark for Retention and Unlearning Evaluation in Multi-label Clinical Disease Inference

REMEDI:多标签临床疾病推断中的保留与遗忘评估基准

Anurag Sharma, Sai Teja Chunchu, Prasenjit Mitra, Sandipan Sikdar, Koustav Rudra

机构 * IIT Kharagpur(印度理工学院Kharagpur分校) Carnegie Mellon University(卡内基梅隆大学) L3S Research Center, Leibniz University Hannover(Leibniz汉诺威大学L3S研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出REMEDI基准,针对多标签临床疾病推断中的机器遗忘问题,利用MIMIC-III数据库评估现有方法在效用与遗忘性能间的权衡,并发现其不适用于多标签任务。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22321 2026-08-25 cs.CL 新提交 61%

Semantics or Structure? Auditing Text Sensitivity in Multimodal Time-Series Forecasting

语义还是结构?多模态时间序列预测中的文本敏感性审计

Karthik Sridhar, Atharva Gupta, Nishant Pradhan, Murari Mandal, Dhruv Kumar, Saurabh Deshpande

机构 * Birla AI Labs(贝拉人工智能实验室) BITS Pilani(皮拉尼比特斯学院) KIIT(基伊特学院)

专题命中 评测与基准 :foundation model(abstract,journal_ref);分类 cs.CL

AI总结 本研究审计多模态时间序列预测模型的文本敏感性,发现文本内容并非其在Time-MMD基准上性能提升的有效信号,并发布了相关诊断工具。

Journal ref ICML 2026 Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21460 2026-08-25 cs.CV cs.AI 新提交 61%

FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows

FigmaTrace:捕捉人类Figma设计工作流程中的创意细节

Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

机构 * Patronus AI

专题命中 评测与基准 :language model(abstract);分类 cs.AI;SFT(comments)

AI总结 该研究构建了FigmaTrace数据集,训练模型后其在四个分布外智能体GUI环境中性能可与前沿闭源模型媲美,且通过定性分析关联了性能提升与数据集的趋势,同时开源了数据集和最佳模型。

Comments Dataset: https://huggingface.co/datasets/PatronusAI/figmatrace Model: https://huggingface.co/PatronusAI/Qwen3.8-27B-Figmatrace-SFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21561 2026-07-24 cs.LG q-bio.BM 新提交 61%

Graph Learning on Ensembles of Cyclic Peptides: An Investigation of Molecular Ensemble Modeling

环肽集合上的图学习:分子集合建模研究

Aaron Feller, Kris Deibler, Maxim Secor

专题命中 评测与基准 :foundation model(abstract,comments);分类 cs.LG

AI总结 研究针对分子构象集合预测性质的问题,提出EnsembleEGNN模型,先以EGNN层编码各构象,再用集合注意力块汇集表示,经多任务自监督预训练,在环肽数据集上取得良好效果,联合BERT编码器进一步提升预测性能。

Comments Accepted to Graph Foundation Models workshop at ICML '26. Contains 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏