arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 3850
2609.04196 2026-09-04 cs.CV 新提交

Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States

Puffin-World:基于原生3D世界状态扩展统一多模态模型

Kang Liao, Yihang Luo, Xiao-Ming Wu, Linyi Jin, Size Wu, Chunyu Lin, Yao Zhao, Fei Wang, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) University of Michigan(密歇根大学) Beijing Jiaotong University(北京交通大学) ACE Robotics(ACE机器人公司)

AI总结 研究提出无需外部离线模块的Puffin-World统一多模态模型,联合建模三类原生3D世界状态与Omni-Camera表示,构建含1500万三元组的Puffin-16M数据集,支持多任务协同的闭环应用并发布相关资源。

Comments Project Page: https://kangliao929.github.io/projects/puffin-world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04110 2026-09-04 cs.CV 新提交

The Shape of Time: Video-Token Contrast for Temporal Understanding in VideoLMs

时间的形态:用于视频语言模型(VideoLMs)时间理解的视频 token 对比

Yumeng Shi, Quanyu Long, Yin Wu, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 针对 VideoLMs 时间理解中监督与视频表示不匹配的问题,提出 VT-Contrast 表示级时间反事实目标,通过对比视频 token 的顺序视图与反事实提升时间理解性能,且无需改动架构。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03972 2026-09-04 cs.LG 新提交

OSR: Output Space Redistribution for Adaptive Label Removal in Classification Models

OSR:分类模型中自适应标签移除的输出空间重分配

Minyi Peng, Darian Gunamardi, Ivan Tjuawinata, Yongsen Zheng, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学)

AI总结 针对分类系统中标签移除的问题,提出输出空间重分配(OSR)方法,作为模块化输出过滤器绕过特征空间调整,在多项分类任务中实现与全重训练相当的性能,提升了计算效率与隐私保护。

Comments Accepted by ICA3PP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03955 2026-09-04 cs.CL cs.LG 新提交

Two-Stage Reinforcement Learning for Sound and Adversarial Test Generation in Code LLMs

面向代码大语言模型的健全性与对抗性测试用例生成的两阶段强化学习

Jiacheng Xu, Wentao Zhang, Zhiyi Lyu, Fuxiang Zhang, Chaojie Wang, Yang Liu, Bo An

机构 * Nanyang Technological University(南洋理工大学) Skywork AI(天工智源)

AI总结 针对代码LLM测试用例稀缺问题,提出两阶段RL框架TCS,在TACO和LiveCodeBench上提升pass@1与答案选择能力,且可用于其他LLM输出选择。

Comments 21 pages, 7 figures. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03516 2026-09-04 cs.CV 新提交

Residual Optimal Transport-Based Experts Collaboration Towards Modality-Aware Infrared-Visible Object Detection

基于残差最优传输的专家协作实现模态感知的红外-可见光目标检测

Yue Zhao, Hua Yu, Yukun Zhao, Yuzhi Zhang, Maoguo Gong, Xin Mei, Zhuping Hu, Yanchi Li, A. K. Qin

机构 * Xidian University(西安电子科技大学) Nanyang Technological University(南洋理工大学) Zhengzhou University(郑州大学) China University of Geosciences(中国地质大学) Swinburne University of Technology(斯威本科技大学)

AI总结 针对红外-可见光目标检测中模态缺失及异质模态语义相关性估计难题,提出FlexibleFusion方法,结合MAEC机制与RSPEOT,实现跨模态自适应融合,在任意模态配置下均表现稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03504 2026-09-04 cs.LG 新提交

Restricted Eigenvalues Beyond Gaussian Width: Threshold Occupancy under Heavy Tails

超出高斯宽度的受限特征值:重尾分布下的阈值占据

Shi Fu, Huibo Xu, Qixin Zhang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学)

AI总结 该研究针对重尾设计的受限特征值问题,否定了仅通过均匀小球条件可遵循高斯测量基准样本量规律的猜想,明确了阈值占据是关键阻碍,并给出了重尾下样本复杂度的精确表达式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03324 2026-09-04 cs.LG 新提交

DE-Venus: A Data-Efficient RLVR Framework for Large Language Models

DE-Venus:面向大语言模型的高效数据强化学习可验证奖励框架

Shenzhi Yang, Guangcheng Zhu, Kai Tang, Zhengqing Zang, Xing Zheng, Haobo Wang, Yingfan Ma, Bowen Song, Bo Han, Bo An, Lei Feng, Weiqiang Wang, Junbo Zhao, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Hong Kong Baptist University(香港浸会大学) Nanyang Technological University(南洋理工大学) Southeast University(东南大学)

AI总结 DE-Venus 是一种高效数据 RLVR 统一框架,通过三个模块实现监督管理,仅用 10% 标签或 13% 数据即可维持/提升模型质量,减少收敛步数,降低标注与训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27141 2026-09-04 cs.CR cs.AI 版本更新

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Supply Chain Tech Team Y, JD.com(京东Y供应链技术团队) Peking University(北京大学) Fudan University(复旦大学) Fullive-AI(Fullive人工智能)

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02993 2026-09-04 cs.AI cs.RO 版本更新

Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

结合增量知识的神经符号推理用于样本高效分层强化学习

Subrat Prasad Panda, Blaise Genest, Arvind Easwaran

机构 * NTU Singapore(新加坡南洋理工大学) IPAL, CNRS, France(法国IPAL-CNRS)

AI总结 本研究提出结合增量知识(InK)的神经符号分层强化学习,通过符号高层组件执行符号规划、低层神经模块学习运动原语,在导航任务中显著提升了样本效率,还开发了信念世界树搜索方法。

Comments Published in ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02402 2026-09-03 cs.RO 新提交

A Physics-Consistent Benchmark for Contact-Rich Human-Robot Interaction in Assistive Care

辅助护理中接触丰富型人机交互的物理一致性基准

Chengxiao He, Shanghai Yuan, Liuqun Fan, Shenzhen Zhu

机构 * School of Mechanical and Robotics Engineering, Tongji University(同济大学机械与机器人工程学院) Centre for Advanced Robotics Technology Innovation, Nanyang Technological University(南洋理工大学先进机器人技术创新中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

AI总结 该研究提出用于机器人辅助洗澡的接触丰富型人机交互物理一致性基准,经实验发现仅任务完成不代表有效接触,需对辅助机器人策略做物理感知筛选。

Comments 8 pages, 4 figures. Submitted to the 2026 IEEE International Conference on Robotics and Biomimetics (ROBIO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02369 2026-09-03 cs.CV 新提交

Information Density Imbalance in Visual Object Detection

视觉目标检测中的信息密度失衡

Ziwei Zhao, Yanxi Lu, Yuwei Hu, Shiyang Su, Mingxuan Wang, Chenyue Zhou, Jiayi Chen, Hehan Li, Xiaoshuai Hao, Andi Zhang, Yanbiao Ma

机构 * Technical University of Munich(慕尼黑工业大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Nanyang Technological University(南洋理工大学) Baidu Inc.(百度公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Manchester(曼彻斯特大学)

AI总结 本研究针对目标检测中仅用实例数量无法解释的类别偏差问题,引入信息密度概念,改进三种损失函数,在多数据集上验证其可降低偏差并提升性能,为相关研究提供新视角与工具。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02272 2026-09-03 cs.CL cs.AI cs.SE 新提交

PaperCompiler: Faithful Paper-to-Code Generation via Repository-Level Specification Compilation

PaperCompiler:通过仓库级规范编译实现忠实的论文到代码生成

Yunhao Liu, Hong Phuc Pham, Jaehong Yoon

机构 * NTU Singapore(新加坡南洋理工大学)

AI总结 PaperCompiler是一种论文到代码生成框架,通过编译论文相关证据生成仓库级规范,在Paper2CodeBench上实现了优于基线的性能,提升了代码保真度并减少了高严重性批评。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02216 2026-09-03 cs.AI 新提交

PEARL: Path-Entity Aligned Relational Learning with Contextual Subgraphs for Inductive Knowledge Graph Completion

PEARL:面向归纳式知识图谱补全的、结合上下文子图的路径-实体对齐关系学习

Yunchi Yang, Longlong Li, Cunquan Qu

机构 * School of Mathematics, Shandong University(山东大学数学学院) School of Physical and Mathematical Sciences, Nanyang Technological University(南洋理工大学物理与数学科学学院) Data Science Institute, Shandong University(山东大学数据科学研究院)

AI总结 PEARL是一种结合上下文子图建模、LLM引导路径检索与双视图对比学习的归纳式知识图谱补全框架,在WN18RR等三个基准数据集上取得最优平均Hits@10,验证了其核心组件的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02079 2026-09-03 cs.RO cs.SY eess.SY 新提交

Koopman-Based Robust Model Predictive Control for Nonlinear Systems with Stochastic Intermittent Measurements

基于Koopman的带随机间歇测量的非线性系统鲁棒模型预测控制

Guanhua Liu, Tong Wu, Lixian Zhang, Weifeng Du, Minghao Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Astronautics, Harbin Institute of Technology(哈尔滨工业大学航天学院) Nanyang Technological University(南洋理工大学) Nanyang Environment and Water Research Institute (NEWRI)(南洋环境与水研究)

AI总结 本文针对带随机间歇测量的非线性系统,提出基于Koopman的带概率截断软约束的随机MPC框架,经理论分析和视觉伺服跟踪仿真验证,可保证闭环系统的递归可行性与均方最终有界性,实现有效跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01679 2026-09-03 cs.LG 新提交

A Survey on Self-Improving Test-Time Intelligence: Feedback-Driven Adapting, Learning, and Scaling at Inference

自改进测试时智能:推理阶段的反馈驱动适配、学习与扩展综述

Shuaicheng Niu, Guohao Chen, Yaofo Chen, Zhiquan Wen, Jinwu Hu, Zeshuai Deng, Deyu Chen, Shuhai Zhang, Renjie Chen, Zihao Lian, Shoukai Xu, Gang Dai, Yunbei Zhang, Wei Luo, Yifan Zhang, Mingkui Tan, Cheng Deng

机构 * South China University of Technology(华南理工大学) Nanyang Technological University(南洋理工大学) Tulane University(杜兰大学) Pazhou Laboratory(琶洲实验室) National University of Singapore(新加坡国立大学) Hohai University(河海大学)

AI总结 本综述提出反馈驱动的测试时智能(TTI)作为统一视角,关联测试时适配、学习与扩展,梳理相关方法、应用与挑战,为推理阶段自改进AI研究提供基础与路线图。

Comments accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01423 2026-09-03 cs.CV 版本更新

MegaStyle++: Scaling Image Style Space through Hierarchical Style Definition

MegaStyle++:通过分层风格定义扩展图像风格空间

Junyao Gao, Sibo Liu, Jiaxing Li, Yanan Sun, Weidong Zhang, Jun Zhang, Cairong Zhao

机构 * Tongji University(同济大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对图像风格缺乏统一定义的问题,提出分层风格定义,构建含多类数据的大规模风格数据集MegaStyle++-8M,扩展了风格空间并提供研究图像风格的可扩展基础。

Comments The dataset and code will be updated at https://github.com/Tencent/MegaStyle, 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25894 2026-09-03 cs.CV 版本更新

TIGA: Trajectory-Injected Generative Attack against Black-box AIGC Detectors

TIGA:针对黑盒AIGC检测器的轨迹注入生成攻击

Xia Du, Zhuosen Bao, Zheng Lin, Jizhe Zhou, Chi-man Pun, Jun Luo, Symeon Chatzinotas

机构 * School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院) Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性和信任跨学科中心) School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(四川大学计算机学院机器学习与工业智能工程研究中心) PCA Laboratory, Key Laboratory of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院高维信息智能感知与系统教育部重点实验室PCA实验室) Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) School of Engineering, Edith Cowan University(伊迪斯科文大学工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 针对黑盒AIGC检测器,TIGA提出无需源图像和训练的框架,通过操纵DDIM轨迹、聚合梯度及方向搜索估计目标响应,实现强大黑盒攻击性能、可转移性及高鲁棒性,且无需源图像或扩散模型再训练。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24016 2026-09-03 cs.CV 版本更新

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models

DailyBench:用于评估现代生成模型生成和处理的人工智能图像的统一基准

Xin Jiang, Hao Tang, Junyao Gao, Meiqi Cao, Fei Shen, Dongming Zhang, Yongdong Zhang

机构 * People’s Daily Online(人民网) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 研究针对现有生成模型图像检测基准与现实差距问题,提出统一基准DailyBench,含FakeBench和ManipulationBench两个子集,通过实验揭示当前检测器鲁棒性差,凸显其可用于开发更强大的人工智能生成图像检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-09-03 cs.CV 版本更新

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Zhuochen Wang, Xiangtai Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25184 2026-09-03 cs.LG cs.AI 版本更新

Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model

在移动边缘训练:一种在线验证的提示选择方法用于大型推理模型的高效强化学习训练

Jiahao Wu, Ning Lu, Shengcai Liu, Kun Wang, Yanting Yang, Baijiong Lin, Chen Jason Zhang, Li Qing, Ke Tang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学理工大学) Nanyang Technological University(南洋理工大学) Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州))

AI总结 本文提出HIVE方法,通过历史奖励轨迹和实时提示熵实现高效RL训练,提升提示选择效率而不牺牲性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12639 2026-09-03 cs.CL 版本更新

CLASE: A Hybrid Method for Chinese Legalese Stylistic Evaluation

CLASE:一种中文法律文本风格评估的混合方法

Yiran Rex Ma, Yuxiao Ye, Huiyuan Xie

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出CLASE混合方法,通过结合语言特征和经验指导的LLM评估,提升法律文本风格质量,实验表明其比传统方法更符合人类判断。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05605 2026-09-03 cs.LG cs.AI cs.CV 版本更新

Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers

Shiva-DiT:基于残差的可微Top-k选择用于高效扩散变换器

Jiaji Zhang, Hailiang Zhao, Jiaju Wu, Ruichao Sun, Xinkui Zhao, Shuiguang Deng

机构 * AIOS, Alibaba Group(阿里云人工智能实验室,阿里巴巴集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanyang Technological University(南洋理工大学)

AI总结 Shiva-DiT通过基于残差的可微Top-k选择,在保持端到端可学习性的同时,实现了高效扩散变换器的剪枝,提升了计算效率并减少了硬件开销。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21815 2026-09-03 cs.CL cs.CY 版本更新

HarmReduction: Benchmarking LLMs in Harm Reduction Information Provision to Support People Who Use Drugs

HarmReduction:对大语言模型在为药物使用者提供减害信息方面的基准测试

Kaixuan Wang, Chenxin Diao, Jason T. Jacques, Zhongliang Guo, Shuai Zhao

机构 * University of St. Andrews(圣安德鲁大学) University of Edinburgh(爱丁堡大学) Nanyang Technological University(南洋理工大学)

AI总结 本研究推出HarmReduction基准,评估大语言模型(LLM)为药物使用者提供减害信息的准确性与安全风险,发现现有最先进LLM仍难提供准确信息且存在安全风险,贡献了相关评估框架。

Comments 15 pages, 5 figures, 12 tables, a dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01607 2026-09-02 cs.CV 新提交

Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System

揭示原生统一多模态模型中的理解-生成协同效应:从表示、任务到系统

Penghao Wu, Haiwen Diao, Weichen Fan, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) SenseTime Research(商汤科技研究院)

AI总结 本文研究无预训练视觉先验的原生统一多模态模型,从表示、任务、系统层面揭示视觉理解与生成的协同效应,发现适当设计可将二者共存转化为协同,且端到端模型优于规划器-执行器流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01596 2026-09-02 cs.RO cs.LG 新提交

Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation

Facet-0:面向接触丰富型精密操作的机器人基础模型

Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出机器人基础模型Facet-0,通过联合动作-力提议等技术,在ManuFacet-1K上训练后,五项亚毫米计算机装配任务平均成功率达82%,远超基线的15%,实现精密接触型机器人装配。

Comments Project page: https://pine-lab-ntu.github.io/facet-0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01455 2026-09-02 cs.CR cs.AI 新提交

When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning

当安全路由失效:理解良性微调下的对齐脆弱性

Yitong Guo, Xiaoyi Chen, Siyuan Zhang, Xiaofeng Wang, Haixu Tang

机构 * Indiana University Bloomington(印第安纳大学伯明顿分校) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

AI总结 该研究针对良性微调削弱大语言模型安全对齐的问题,提出费歇尔几何视角,揭示输出侧MLP模块的路由通路锐化导致安全失效,发现LoRA和ASAM可缓解早期崩溃但效果随微调规模减弱

Comments Accepted to the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01425 2026-09-02 cs.LG 新提交

CATeye: Coupled Attribute-Topology Invariance Learning for Voucher Abuse Detection

CATeye:用于优惠券滥用检测的耦合属性-拓扑不变性学习

Tian Tian, Shuaicheng Niu, Hao Kuang, Yuanhang Hu, Dong Li, Zhiqi Shen

机构 * Nanyang Technological University(南洋理工大学) Lazada Inc.(来扎达公司) Alibaba Group(阿里巴巴集团)

AI总结 本文针对电商优惠券滥用检测中欺诈模式演变引发的分布偏移问题,提出CATeye框架,通过AIS与EIS选择不变属性和边,构建多视图优化,在Lazada数据集及公开基准上较9种基线最高提升平均F1分数8.61%。

Comments 8 pages, 3 figures, Accepted by CIKM 2026 Applied Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00866 2026-09-02 cs.CV cs.AI 新提交

Benchmarking Vision-Language Models for Automated Pathology Diagnosis and Report Generation

用于自动化病理诊断与报告生成的视觉语言模型基准测试

Yumi Lee, Harim Oh, Hyoryung Kim, Minji Kim, Eunsu Kim, Hyeseong Lee, Junya Fukuoka, Andrey Bychkov, Jijgee Munkhdelger, Rajiv Kumar Kaushal, Ayushi Sahay, Rajni Yadav, Bharathi Prabakaran, Sulen Sarioglu, Serdar Balcı, Ilknur Turkmen, Yuri Tolkach, Christian Harder, Julian Westerdorf, Reinhard Buettner, Audun Ljone Henriksen, Sepp De Raedt, Byung Hyun Lee, Sungjin Lim, Joohoon Lee, Gwanghyun Kim, Se Young Chun, Suryakant Singh, Saarthak Kapse, Prateek Prasanna, Kyung A Kim, Yousun Kang, Sehwan Yoo, Sungman Hong, Shubham Innani, Michael Feldman, Spyridon Bakas, Ujjwal Baid, Prasad Dutande, Suhas Gajare, Bhakti Baheti, Serkan Sökmen, Ece Tuğba Cebeci, Ahmet Halıcı, Musa Balcı, Kardelen Peçenek, Srividhya Sainath, Kyongseok Jang, Messi H. J. Lee, Noorul Wahab, Bodong Du, Jiaming Zhang, Qixiang Zhang, Jang-Hwan Choi, Sangjeong Ahn

机构 * Ewha Womans University(梨花女子大学) Korea University Anam Hospital(高丽大学安岩医院) Korea University College of Medicine(高丽大学医学院) Memorial Health Group(纪念健康集团) Kameda Medical Center(龟田医疗中心) Nagasaki University Graduate School of Biomedical Sciences(长崎大学生物医学科学研究生院) Tata Memorial Hospital(塔塔纪念医院) All India Institute Of Medical Sciences Delhi(全印医学科学研究所德里分院) University Hospital Cologne, Medical Faculty, University of Cologne(科隆大学医院、科隆大学医学院) Institute for Cancer Genetics and Informatics(癌症遗传学与信息学研究所) Seoul National University(首尔大学) Stony Brook University(石溪大学) Yonsei University College of Medicine(延世大学医学院) Tokyo Polytechnic University(东京工艺大学) Nanyang Technological University(南洋理工大学) Korea University(高丽大学) Indiana University School of Medicine(印第安纳大学医学院) Emory University(埃默里大学) Shri Guru Gobind Singhji Institute of Engineering and Technology(斯里古鲁戈宾德辛格吉工程技术学院) Viseur AI(维瑟人工智能公司) EKFZ TU Dresden (KatherLab)(德累斯顿工业大学EKFZ(凯瑟实验室)) MTS Company(MTS公司) University of Warwick(华威大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 该研究建立了含约10500对样本的泛亚WSI-报告数据集及REG 2025基准,评估多模态病理模型,发现需结构化表示等提升性能,指出数字幻觉等局限,为相关模型设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00830 2026-09-02 cs.CV cs.AI 新提交

Visual Attention Faithfulness in Vision-Language Models is Heterogeneous

视觉-语言模型中视觉注意力的忠实性具有异质性

Xurui Song, Weishi Wang, Zhongqi Yue, Kuluhan Binici, Tao Bai, Hongxin Shao, Daniel Dahlmeier, Jun Luo

机构 * SAP(思爱普) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Microsoft(微软公司)

AI总结 研究发现VLMs的视觉注意力忠实性具有异质性,分三种模式,人工标注区域与模型注意力存在约60%的全面性契合度,且该特性随任务和模型架构变化。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00788 2026-09-02 cs.CV 新提交

Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain

禁止你的注意力:通过在频域中有选择地移除固有焦点来欺骗多模态大语言模型

Daizong Liu, Junhao Dong, Zhiyuan Ma, Xiaoye Qu, Xiang Fang, Runwei Guan, Keke Tang, Jianfeng Dong, Yew-Soon Ong

机构 * Institute for Math & AI, Wuhan University(武汉大学数学与人工智能学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学先进技术网络空间学院) College of Computer and Information Engineering, Zhejiang Gongshang University(浙江工商大学计算机与信息工程学院)

AI总结 该研究针对多模态大语言模型,提出一种频域相位感知的对抗攻击方法,结合对抗提示学习,可有效欺骗模型,效果优于现有攻击。

Comments Accepted by IEEE TMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏