arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 197 篇

2602.03554 2026-06-02 cs.LG cs.AI cs.CE cs.CL 83%

When Single Answer Is Not Enough: Rethinking Single-Step Retrosynthesis Benchmarks for LLMs

当单一答案不够时:重新思考面向大语言模型的单步逆合成基准

Bogdan Zagribelnyy, Ivan Ilin, Maksim Kuznetsov, Nikita Bondarev, Mathieu Reymond, Roman Schutski, Thomas MacDougall, Rim Shayakhmetov, Zulfat Miftakhutdinov, Mikolaj Mizera, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * DeepMind, London, UK(伦敦英国深度思维公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有逆合成基准依赖单一真实答案的局限,提出基于化学合理性度量ChemCensor的新评估框架,并构建数据集CREED训练模型以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02578 2026-06-02 cs.CV cs.AI 83%

Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

通过感知扰动和奖励建模减轻多模态大语言模型作为评判者中的感知判断偏差

Seojeong Park, Jiho Choi, Junyong Kang, Seonho Lee, Jaeyo Shin, Hyunjung Shim

机构 * University of California, Berkeley(加州大学伯克利分校) KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过构建感知扰动数据集和结合GRPO奖励与批排序目标的统一训练框架,解决了多模态大语言模型作为评判者时因视觉证据与文本线索冲突而产生的感知判断偏差问题,显著提升了感知忠实度和与人类评价的一致性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22276 2026-06-02 cs.CV cs.CL 83%

WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models

WAON:用于对比视觉语言模型文化适应的大规模日语图像-文本数据集

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Yasuo Okabe, Naoaki Okazaki

机构 * Kyoto University(京都大学) NII LLMC(日本国家研究所语言模型中心) NII(日本国家研究所) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学研究所)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 提出WAON,一个从Common Crawl构建的包含约1.55亿样本的最大公开原生日语图像-文本数据集,并通过微调实验证明其在日语文化基准上优于翻译数据。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02302 2026-06-02 cs.CR cs.AI 81%

SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents

SeClaw: 面向自主代理评估的规范驱动安全任务合成

Hao Cheng, Changtao Miao, Tianle Song, Yin Wu, He Liu, Erjia Xiao, Junchi Chen, Xiaoyu Shi, Yichi Wang, Jing Yang, Taowen Wang, Jinhao Duan, Mengshu Sun, Peiyan Dong, Xuan Shen, Yang Cao, Renjing Xu, Kaidi Xu, Jindong Gu, Bo Zhang, Jize Zhang, Chenhao Lin, Philip Torr, Chao Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Xi’an Jiaotong University(西安交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) City University of Hong Kong(香港城市大学) Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) Massachusetts Institute of Technology(麻省理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Beijing University of Technology(北京理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出SeClaw框架,通过规范驱动的安全任务合成与基于执行的安全评估,实现对自主LLM代理在状态化环境中的安全风险的可扩展、可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01820 2026-06-02 cs.CL 81%

TalkTag: Fine-Grained Morphosyntactic Error Annotation for Transcribed Speech

TalkTag: 转录语音的细粒度形态句法错误标注

Shamira Venturini, Oliver Hennhöfer, Steffen Kinkel, Jannik Strötgen

机构 * Karlsruhe Institute of Technology, Germany(德意志联邦共和国卡尔斯鲁厄理工大学) Karlsruhe University of Applied Sciences, Germany(德意志联邦共和国卡尔斯鲁厄应用科学大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出基于LLM的轻量级工具TalkTag,在数据稀缺条件下自动进行口语转录文本的CHAT风格错误标注,实现低资源场景下的精确标注并识别歧义情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01789 2026-06-02 cs.AI 81%

Consistency evaluation of benchmarks used for causal discovery

用于因果发现的基准一致性评估

Yuzhe Zhang, Chihui Chen, Lina Yao, Chen Wang

机构 * Independent researcher(独立研究者) UNSW Australia(新南威尔士大学澳大利亚分校) CSIRO Australia(澳大利亚联邦科学与工业研究组织)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出自动检索论文并利用大语言模型检查基准因果图与领域研究一致性的流程,评估11个流行基准,发现其一致性差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01461 2026-06-02 cs.LG cs.MA 81%

Genotype-Conditioned Molecular Generation via Evidence-Grounded Multi-Objective Latent Perturbation in Diffusion Models

基于证据的多目标潜在扰动在扩散模型中的基因型条件分子生成

Brenda Nogueira, Gisela A. Gonzalez-Montiel, Nitesh V. Chawla, Nuno Moniz

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Notre Dame(诺克斯大学) Department of Chemistry and Biochemistry(化学与生物化学系) Lucy Family Institute for Data & Society(数据与社会学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出一种在预训练的基因型到药物扩散模型的潜在空间中,通过梯度上升优化可学习扰动以最大化药物敏感性、类药性和合成可及性的复合奖励,并利用实验数据和LLM管道确保生物合理性和机制一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01301 2026-06-02 cs.CL 81%

Med-HEAL: Analyzing and Mitigating Hallucinations in Medical LLMs with Hallucination-Aware In-Context Learning

Med-HEAL:通过幻觉感知的上下文学习分析与缓解医学大语言模型中的幻觉

Yiming Liao, Zeno Franco, Jose Eduardo Lizarraga Mazaba, Keke Chen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县) Medical College of Wisconsin(威斯康星医学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Med-HEAL框架,利用临床数据构建幻觉数据集,并通过自我批评和检索增强上下文学习策略缓解医学大语言模型中的幻觉,实验表明自我批评策略可提升多数模型准确率。

Comments 12 pages, 5 figures. Preprint full version of an accepted ACM-BCB 2026 short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00448 2026-06-02 cs.SE cs.AI cs.CR 81%

When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems

当安全技能碰撞:衡量智能体技能生态系统中的组合风险

Su Wang, Pin Qian, Yihang Chen, Junxian You, Xiaoyuan Wang, Xiaochong Jiang, Lifei Liu, Haoran Yu, Jingzhou Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) University of Glasgow(格拉斯哥大学) Independent Researcher(独立研究员) Corespeed Inc.(Corespeed公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出SkillReact框架,通过静态组合基准、双评分者LLM辅助人工审核和基于动作的可利用性测试,研究LLM智能体中个体安全的技能组合后可能产生的不安全行为,发现约18.2%的候选组合存在真实风险,且主机模型决定是否利用这些组合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00251 2026-06-02 cs.AI 81%

Capability Self-Assessment: Teaching LLMs to Know Their Limits

能力自我评估:教会LLM了解自身局限

Haoyan Yang, Reza Shirkavand, Yukai Jin, Jiawei Zhou, Shangqian Gao, Heng Huang

机构 * Stony Brook University(石溪大学) University of Maryland(马里兰大学) Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出能力自我评估(CSA)问题,通过强化学习训练大语言模型准确判断自身能力边界,显著优于监督微调且不损害原始能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27701 2026-06-02 cs.AI 81%

Cross-Entropy Games and Frost Training

交叉熵博弈与Frost训练

Arthur Renard, Franck Gabriel, Valentin Hartmann, Clément Hongler

机构 * Xent Labs(Xent实验室) Université Lyon 1(里昂1大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出Frost训练方法,利用奖励函数在嵌入空间中的梯度改进基于蒙特卡洛的策略优化,用于解决一类称为交叉熵博弈的LLM-as-a-judge任务,在最佳k选择中实现更高最大分数并加速训练。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22978 2026-06-02 cs.CL 81%

A Reproducible Universal Dependencies-Style Pipeline for Katharevousa Greek Parliamentary Text

一种可复现的通用依赖风格管道用于Katharevousa希腊语议会文本

George Mikros, Fotios Fitsilis

机构 * Hamad Bin Khalifa University(哈马德·本·卡立夫大学) Universidad Austral(阿维拉大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对Katharevousa希腊语,提出一种可复现的通用依赖风格解析管道,结合OCR重建、LLM辅助标注、自动验证和模型比较,显著提升解析性能并开源全部资源。

Comments 12 pages, 1 figure, 2 tables; companion to the kathnlp open-source release at https://github.com/gmikros/katharevousa-nlp-tooling

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14791 2026-06-02 astro-ph.IM astro-ph.CO cs.AI 81%

Beyond AI as Assistants: Toward Autonomous Discovery in Cosmology

超越AI助手:迈向宇宙学中的自主发现

Licong Xu, Thomas Borrett

机构 * Institute of Astronomy, University of Cambridge(剑桥大学天文研究所) Kavli Institute for Cosmology, University of Cambridge(剑桥大学凯斯勒宇宙研究所) Cavendish Astrophysics, University of Cambridge(剑桥大学卡文迪许天体物理研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出两种互补的智能体系统(CMBEvolve和CosmoEvolve),通过LLM引导的代码进化与树搜索以及虚拟多智能体研究实验室,实现宇宙学中的自主科学发现,并在弱引力透镜异常检测和ACT DR6数据分析中展示了初步成果。

Comments 4 pages, 2 figures, Contribution to the 2026 Cosmology session of the 60th Rencontres de Moriond

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09549 2026-06-02 cs.IR cs.AI 81%

Beyond Offline A/B Testing: Context-Aware Agent Simulation for Recommender System Evaluation

超越离线A/B测试:面向推荐系统评估的上下文感知智能体模拟

Nicolas Bougie, Gian Maria Marconi, Xiaotong Ye, Narimasa Watanabe

机构 * Woven by Toyota(丰田织物)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对推荐系统评估中离线指标与在线性能脱节的问题,提出基于大语言模型的上下文感知智能体框架ContextSim,通过生活模拟模块生成时间、地点和需求等上下文场景,并保持智能体行为一致,使模拟交互更贴近真实用户行为,且优化后的推荐系统参数能提升实际参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18652 2026-06-02 cs.CV cs.AI cs.IR 81%

Beyond String Matching: Semantic Evaluation of PDF Table Extraction

超越字符串匹配:PDF表格提取的语义评估

Pius Horn, Janis Keuper

机构 * Institute for Machine Learning and Analytics (IMLA)(机器学习与分析研究所) Offenburg University(奥芬堡大学) University of Mannheim(曼海姆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出基于LLM-as-a-judge的语义评估框架,通过合成PDF和人工验证,显著优于现有规则指标(TEDS、GriTS),并评估了21种PDF解析器。

Comments Submitted to BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16142 2026-06-02 cs.CL 81%

Parametric Social Identity Injection and Diversification in Public Opinion Simulation

参数化社会身份注入与多样化在舆论模拟中的应用

Hexi Wang, Yujia Zhou, Bangde Du, Qingyao Ai, Yiqun Liu

机构 * DCST, Tsinghua University(清华大学信息科技系) Quancheng Laboratory(泉城实验室) Tsinghua University(清华大学) Shandong China(山东中国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型在舆论模拟中社会多样性不足的问题,提出参数化社会身份注入(PSII)框架,通过向中间隐藏状态注入显式参数化的人口属性与价值取向表示,显著提升分布保真度与多样性。

Comments Accepted to KDD 2026 Research Track. Project page: https://github.com/halsayxi/PSII

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16794 2026-06-02 stat.ML cs.LG 81%

Beyond Procedure: Substantive Fairness in Conformal Prediction

超越程序:共形预测中的实质性公平

Pengqi Liu, Zijun Yu, Mouloud Belbahri, Arthur Charpentier, Masoud Asgharian, Jesse C. Cresswell

机构 * University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文通过理论分解和LLM辅助评估,研究共形预测中标签聚类方法如何平衡效用与实质性公平,并发现均衡集合大小比覆盖度更能提升公平性。

Comments Camera-ready version. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10943 2026-06-02 cs.MA cs.CL 81%

The Social Cost of Intelligence: Emergence, Propagation, and Amplification of Stereotypical Bias in Multi-Agent Systems

智能的社会成本:多智能体系统中刻板偏见的涌现、传播与放大

Thi-Nhung Nguyen, Linhao Luo, Amardeep Kaur, Rollin Omari, Tamas Abraham, Junae Kim, Thuy-Trang Vu, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,莫纳什大学) Defence Science and Technology Group, Australia(澳大利亚国防科学与技术集团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出一个评估框架,通过三个智能体级指标量化多智能体系统中偏见的涌现、传播和放大,发现通信可触发高达70%的新偏见、传播至80%以上智能体并放大3倍以上刻板印象,且密集竞争性通信增加偏见,系统易受简单偏见注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11083 2026-06-02 cs.CL 81%

RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates

RedDebate:通过多智能体红队辩论实现更安全的响应

Ali Asad, Stephen Obadinma, Radin Shayanfar, Xiaodan Zhu

机构 * Department of Electrical Computer Engineering \& Ingenuity Labs Research Institute, Queen's University, Kingston, Canada

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RedDebate框架,利用多智能体辩论和长期记忆模块,通过全自动红队测试减少大语言模型的不安全输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19489 2026-06-02 cs.AI cs.SE 81%

Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults

驯服系统复杂性:揭秘软件工程代理在诊断Linux内核故障中的作用

Zhenhao Zhou, Zhuochen Huang, Yike He, Chong Wang, Jiajun Wang, Yijian Wu, Xin Peng, Yiling Lou

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对Linux内核故障定位挑战,提出LinuxFLBench基准和LinuxFL$^+$增强框架,将现有LLM代理的文件级top-1准确率从41.6%提升7.2%-11.2%。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00939 2026-06-02 cs.MA 80%

FinCom: A Financial Multi-Agent Demo with Disagree-or-Commit Deliberation

FinCom: 一个具有“异议或承诺”审议机制的金融多智能体演示

Chao Peter Yang, Zixiao Tan, Kaisen Yao, Ziyu Zhou, Eleanor Jiang, Michael Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对金融多智能体系统中存在的谄媚问题,提出基于“异议或承诺”协议的FinCom框架,通过结构化异议提升推理准确性和风险意识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00067 2026-06-02 cs.SI cs.MA 80%

When Agents Talk: Discourse, Manipulation, and Risk in an Agentic Social Network

当智能体对话:一个智能体社交网络中的话语、操纵与风险

10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle Lee, Paige Lee, Vicky Lee, Hailey May, Bobby McKenzie, Christine McNeill, Han Nguyen, Brooke Perreault, David Pham, Charlie Plumb, Olivia Quill, Matthew Swain, Grace Wang, Adam Warren, Corie Wieland, Zachary Yahn

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 通过分析一个Reddit风格的AI智能体社交平台上的22.8万条帖子,结合语义聚类和LLM辅助有害内容分类,发现18.28%的帖子包含有害内容,并识别出74类恶意行为,包括凭证窃取、主机执行指令等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02558 2026-06-02 cs.IR 80%

Lighting the Way for BRIGHT: Reproducible Baselines with Anserini, Pyserini, and RankLLM

为BRIGHT照亮道路:基于Anserini、Pyserini和RankLLM的可复现基线

Sahel Sharifymoghaddam, Yijun Ge, Jimmy Lin

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究系统评估了面向推理的检索基准BRIGHT,通过集成到Anserini、Pyserini和RankLLM中的强基线方法,发现查询端BM25(BM25Q)在长查询下优于标准BM25,并揭示了数据质量问题及融合策略的泛化性。

Comments SIGIR 2026 Reproducibility Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02106 2026-06-02 cs.LG stat.ML 79%

When Tabular Foundation Models Transfer Across Modalities: A Systematic Evaluation Across 95 Datasets, 7 Modalities, and Two Regimes

当表格基础模型跨模态迁移:对95个数据集、7种模态和两种范式的系统评估

Julien Lafrance

机构 * Telecom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种结合等角紧框架预处理与表格基础模型的分类流水线,在跨模态数据上评估其性能,并证明其在速度与质量间取得良好平衡。

Comments 24 pages, 5 figures. Code and data available at https://doi.org/10.5281/zenodo.19982636

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00997 2026-06-02 cs.CL 79%

Decoding in Order-Agnostic Language Models: Chain-Rule Deviation and Uniform Spreading

顺序无关语言模型中的解码:链式法则偏差与均匀扩散

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文研究顺序无关语言模型(OALM)中揭示顺序对似然的影响,提出基于置信度方差的诊断方法,并证明均匀扩散定理以优化解码路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00871 2026-06-02 cs.CV cs.AI 79%

Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

城市感知中的视觉语言模型基准应具备可靠性意识且可协商

Rashid Mushkani

机构 * Rashid Mushkani

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出,用于城市感知的视觉语言模型基准应将分歧和弃权视为测量结果,报告标注者间信度,并将标签空间和评分策略视为可协商的产物。

Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09692 2026-06-02 cs.AI 79%

Causal state binding predicts action control in language agents

因果状态绑定预测语言智能体中的动作控制

Xiao Jia

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳))

专题命中 评测与基准 :language agent(title,abstract);分类 cs.AI

AI总结 提出因果状态绑定框架,通过干预实验测量智能体动作是否随事件特定决定性状态变化,验证了结构化智能体在动作控制上优于随机基线。

Comments 85 pages, 5 main figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16660 2026-06-02 cs.CV cs.LG physics.med-ph 79%

Universal and Transferable Attacks on Pathology Foundation Models

病理基础模型的通用与可迁移攻击

Yuntian Wang, Xilin Yang, Che-Yung Shen, Nir Pillar, Aydogan Ozcan

机构 * Electrical and Computer Engineering Department, University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校电子与计算机工程系) Bioengineering Department, University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校生物工程系) California NanoSystems Institute (CNSI), University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校加州纳米系统研究所) Department of Pathology, Hadassah Hebrew University Medical Center, Jerusalem, 91120, Israel(海法希伯来大学医疗中心病理学系) Department of Surgery, University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校外科系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 提出通用可迁移对抗扰动(UTAP),通过固定弱噪声模式破坏多个病理基础模型的特征表示能力,导致下游任务性能下降,并展示其跨数据集通用性和跨模型可迁移性。

Comments 38 Pages, 8 Figures

Journal ref Light: Science & Applications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24808 2026-06-02 cs.AI 79%

Query Circuits: Explaining How Language Models Answer User Prompts

查询电路:解释语言模型如何回答用户提示

Tung-Yu Wu, Fazl Barez

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出查询电路方法,通过直接追踪模型内部信息流来忠实解释特定输入如何产生输出,并引入归一化偏差忠实度(NDF)度量及采样方法实现稀疏电路发现。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02444 2026-06-02 cs.AI cs.CL 79%

Food Noise & False Safety: A Systematic Evaluation of How LLMs Fail to Adapt to Eating Disorder Queries with Clinician Feedback

食物噪音与虚假安全:系统评估LLMs如何在临床医生反馈下未能适应饮食障碍查询

Giulia Pucci, Emily Hemendinger, Ruizhe Li, Gavin Abercrombie, Tanvi Dinkar, Arabella Sinclair

机构 * University of Aberdeen(阿伯丁大学) University of Colorado Anschutz(科罗拉多大学安舒茨分校) Heriot-Watt University(赫里奥特-瓦特大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过与临床饮食障碍专家合作,系统评估了大型语言模型在处理饮食障碍用户查询时,因不加批判地适应不安全或自伤请求而可能产生的危害。

详情

展开后加载摘要…

URL PDF HTML 收藏