arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 29 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 29 篇

2508.05078 2026-08-25 cs.CL cs.AI 版本更新 81%

From Isolation to Alignment: Unified LoRA for Efficient Multi-Task Learning

从孤立到对齐:用于高效多任务学习的统一LoRA

Jinda Liu, Yi Chang, Yuan Wu

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对多任务PEFT中复杂LoRA变体的范式提出挑战,提出统一高效的Align-LoRA框架,通过显式对齐损失实现表示对齐,保留标准LoRA架构并实现零推理延迟,性能优于现有方法。

Comments Accepted by EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23214 2026-08-25 cs.CL cs.IR 新提交 79%

Aligning Biomedical Texts and Knowledge Graphs: A Systematic Comparison of Lightweight Alignment Strategies

生物医学文本与知识图谱的对齐:轻量对齐策略的系统比较

Artem Bisliouk, Elizaveta Nosova, Heiko Paulheim, Andreea Iana, Rita T. Sousa

机构 * University of Mannheim(曼海姆大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究提出统一框架系统比较生物医学文本与KG的轻量对齐策略,构建CTD-Align语料库,发现三元组组合和训练方向影响最大,线性投影效果最优,为二者桥接提供实用基础。

Comments Accepted at the Third Workshop on Knowledge Graphs and Neurosymbolic AI (KG-NeSy 2026) co-located with ISWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03446 2026-08-25 cs.CL 版本更新 79%

Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment -- Is English Enough?

用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?

Adnan Al Ali, Kathy Hämmerl, Jindřich Libovický, Alexander Fraser

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09544 2026-08-25 cs.CL cs.AI cs.LG 版本更新 75%

Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

大语言模型通过一种独特的统一机制生成有害内容

Hadas Orgad, Boyi Wei, Kaden Zheng, Martin Wattenberg, Peter Henderson, Seraphina Goldfarb-Tarrant, Yonatan Belinkov

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Princeton University(普林斯顿大学) Harvard University(哈佛大学) Cohere Technion—IIT(以色列理工学院)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过权重剪枝揭示大语言模型中有害生成的内部结构,发现有害内容生成依赖于一组通用且与良性能力不同的权重,表明对齐训练重塑了有害表示,解释了领域微调引发的广泛对齐偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03058 2026-08-25 cs.CL cs.AI cs.CY 版本更新 67%

Verbalizing LLMs' assumptions to explain and control sycophancy

使LLM的假设 verbal化以解释和控制谄媚行为

Myra Cheng, Isabel Sieh, Humishka Zope, Sunny Yu, Lujain Ibrahim, Aryaman Arora, Jared Moore, Desmond Ong, Dan Jurafsky, Diyi Yang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出Verbalized Assumptions框架,通过揭示LLM对用户的错误假设来解释和控制其谄媚行为,发现LLM在面对用户提问时倾向于提供验证而非客观信息,进而提出可解释的细粒度控制方法。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22908 2026-08-25 cs.CL cs.AI 新提交 62%

Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text

口语语言模型在阅读文本时是否“听到”语音?弥合语音与文本之间的结构差距

Hyeonyu Kim, Hwayeon Kim, Youngwon Choi, Myeongkyun Cho, Huu-Kim Nguyen

机构 * Maum AI Inc.(Maum AI公司) KAIST(韩国科学技术院) Atmanity Inc.(Atmanity公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有口语语言模型(SLMs)未充分解决语音与文本结构差异的问题,提出解耦长度不匹配与语义对齐的框架,经多基准实验验证其性能可与强基线媲美,凸显了明确解决语音文本结构差异的重要性。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22417 2026-08-25 cs.AI cs.CL cs.HC 新提交 62%

LLMs for Survey Text Analysis - A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis

用于调查文本分析的大语言模型(LLMs):人类与GPT-5在归纳内容分析上的性能比较

Leonardo Bergmann, Renata Gheorghiu, Ana Gvritishvili, Alex Mican, Chris Stewart, Topias Tolonen-Weckström

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究对比人类与GPT-5.4在903份欧洲博士生调查开放式回答的归纳内容分析中的性能,发现GPT-5.4编码的ARI为0.61,可近似人类编码表现,或可作为归纳质性分析的可扩展支持工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22076 2026-08-25 cs.LG cs.AI 新提交 62%

Improving Energy Efficiency of Oil Platforms Through Optimal Loading of Diesel Generators Using Machine Learning and Search Algorithms

基于机器学习与搜索算法优化柴油发电机负载,提升石油平台能效

Khivishta Boodhoo, Josh Plumbly, Nicholas Watson

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对海上石油平台能源低效问题,采用机器学习构建柴油消耗预测模型,结合搜索算法优化发电机负载,实现日均27%的柴油消耗降低,为平台能效提升提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24255 2026-08-25 cs.CL cs.AI cs.HC 版本更新 62%

Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games

心理理论与亲社会信念对最后通牒博弈中大型语言模型的人类对齐行为的影响

Neemesh Yadav, Yihuai Lan, Shan Dong, Mai Hieu Hien, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Australian National University(澳大利亚国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究以最后通牒博弈为任务,赋予LLM不同亲社会信念与推理方法,开展2700次模拟,发现ToM推理可增强LLM行为对齐度等,且不同游戏角色适配不同ToM顺序,Llama 3.3 70B的推理与行动信念最一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22196 2026-08-25 eess.AS cs.CL 新提交 57%

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

基于说话人 diarization 的转录校正缓解级联多说话人自动语音识别中的说话人泄漏

Hermann Yepdjio Nkouanga, Minwei Luo, Maggie Wigness, Suresh Singh

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究针对级联多说话人自动语音识别中的说话人泄漏问题,提出基于剪枝的校正范式,利用预训练说话人 diarization 模型剪枝转录片段,在多语料库上实现 cpW ER 最高相对降低 29%,提升了转录可靠性。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23254 2026-08-25 cs.LG 新提交 57%

From Multimodal Observation to Interpretable Suggestions: Counterfactual Time-Expanded Relational Modeling of Surgical Teams

从多模态观察到可解释建议:手术团队的反事实时间扩展关系建模

Vincenzo Marco De Luca, Antonio Longa, Giovanna Varni, Andrea Passerini

机构 * University of Trento(特伦托大学) UiT the Arctic University of Norway(挪威北极大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 针对现有外科AI忽略团队互动建模的问题,提出tempo-relational框架结合Time-Expanded图,通过反事实程序生成可解释建议,在模拟手术实验中提升了多目标预测性能。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22854 2026-08-25 cs.LG 新提交 57%

Thinking at the Right Size: Amortized Distillation Across Post-Trained LLMs

合适规模的思考:跨后训练大语言模型的摊销蒸馏

Yan Zhou, Sara Kangaslahti, Jonathan Geuter, Nihal V. Nayak, Marco Fumero, Francesco Locatello, David Alvarez-Melis

机构 * Harvard University(哈佛大学) IST Austria(奥地利科学技术研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 该研究提出ADAPT框架,可单次蒸馏生成跨后训练大语言模型的多规模多变体模型,实现平滑规模插值与自适应规模选择,优化长文本推理的计算-准确率权衡。

Comments 8 pages, 6 figures. EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22552 2026-08-25 cs.DC cs.CR cs.LG 新提交 57%

Model-Consistent Byzantine-Resilient Decentralized Federated Learning for Collaborative Missions

面向协作任务的模型一致、拜占庭容错的去中心化联邦学习

Yue Li, Sudip Bhujel, Cameron Lira, Ning Wang, Yang Xiao

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出DFL-C架构,将ACS共识协议与双域信任评分机制结合,实现拜占庭容错的全局模型一致去中心化联邦学习,在非IID场景下优于BALANCE方案。

Comments Accepted for publication at the IEEE Conference on Communications and Network Security (CNS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22411 2026-08-25 cs.CL 新提交 57%

Don' t Box Me In: Dynamic Cultural Adaptation and Cognitive Tracking for Social Understanding

不要限制我:面向社会理解的动态文化适应与认知跟踪

Chongyuan Dai, Yaling Shen, Shengeng Tang, Hui Ma, Jinpeng Hu

机构 * Hefei University of Technology(合肥工业大学) Monash University(莫纳什大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文针对现有LLMs将文化建模为静态属性的局限,提出无需训练的DyCAC框架,结合动态文化适应与心理理论驱动的认知跟踪,在多元文化互动基准上展现出更优社会智能与适应性。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22359 2026-08-25 cs.CV cs.AI cs.SD 新提交 57%

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

面向未修剪自我中心视频的预算受限视觉-语言字幕生成的预解码音频分诊

Masoud Jalayer, Changyi Li, Yu Xiao

机构 * Aalto University(阿尔托大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究针对预算受限的未修剪自我中心视频视觉-语言字幕生成问题,提出预解码音频分诊策略,通过音频优先选择窗口减少VLM调用,提升动作覆盖率,在多个数据集上优于现有方法。

Comments 18 pages, 5 figures, 9 tables. Under review at IEEE BigData 2026, Industrial and Government Track. Code: this https URL (https://github.com/masjalayer/PreDecoding-AcousticTriage)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21909 2026-08-25 cs.LG 新提交 57%

CD-LoRA: Consistency-Driven Low-Rank Adaptation for Multi-Task Fine-Tuning

CD-LoRA:面向多任务微调的一致性驱动低秩适配

Qian Zha, Jinda Liu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 该研究针对多任务LoRA方法存在的训练-推理不一致问题,提出无路由的CD-LoRA,通过一致性驱动对齐机制提升多任务微调的稳定性与性能,优于现有多适配器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21529 2026-08-25 cs.CV cs.CL cs.IR 新提交 57%

DamageScope: Vision-Language Retrieval at Scale for Disaster Damage Assessment from Satellite Imagery

DamageScope:面向卫星图像灾害损失评估的大规模视觉-语言检索方法

Ravi K. Rajendran, Biplob Debnath, Murugan Sankaradas, Srimat T. Chakradhar

机构 * NEC Laboratories America(美国 NEC 实验室)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 DamageScope是一种结合VLMs与LLMs的检索增强框架,通过多向量嵌入聚类和双存储架构,实现了卫星图像灾害损失评估的高效自动化,可扩展性与运营效率优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-25 cs.MA cs.AI 版本更新 57%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-08-25 cs.CV cs.LG 版本更新 57%

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Kangwei Liu, Sanyi Zhang, Zhangcheng Wang, Shiming Liu, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01028 2026-08-25 cs.CL stat.ME 版本更新 57%

Syntax-Guided Diffusion Language Models with User-Integrated Personalization

带有用户集成个性化的语法引导扩散语言模型

Ruqian Zhang, Yijiao Zhang, Juan Shen, Zhongyi Zhu, Annie Qu

机构 * Department of Statistics and Data Science, Fudan University(复旦大学统计与数据科学系) Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣巴巴拉分校统计与应用概率系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究提出语法引导扩散语言模型,结合结构监督与个性化条件,通过级联及非级联架构、共享表示机制,在多任务实验中展现出文本生成的流畅度、多样性与风格保真度优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11827 2026-08-25 cs.CL 版本更新 57%

Bridging Linguistic Structure and Mechanistic Interpretability for Conceptual Interpretation in Language Models

弥合语言结构与机械可解释性以实现语言模型中的概念解释

Nura Aljaafari, Danilo S. Carvalho, André Freitas

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究提出DSRA方法,结合因果追踪与定义性语义角色,在GPT-J-6B和BERTIN GPT-J-6B中揭示语言模型内部激活与定义结构的系统对应,为概念解释研究提供新路径。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18494 2026-08-25 cs.LG 版本更新 57%

Learning in PINNs: Phase transition, diffusion equilibrium, and generalization

物理信息神经网络(PINNs)中的学习:相变、扩散平衡与泛化

Sokratis J. Anagnostopoulos, Juan Diego Toscano, Nikolaos Stergiopulos, George Em Karniadakis

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 该研究通过神经梯度信噪比识别出全连接神经网络的扩散平衡阶段,提出逐样本重加权方案提升残差同质性与泛化,基于PINNs实验表明梯度与残差有序可加快收敛、改善泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22702 2026-08-25 cs.HC 新提交 50%

AffAdapt: AFFect-driven ADAPTive AI Personas for Seamless Conversations

AffAdapt:面向流畅对话的情感驱动型自适应AI角色

Nishanth Chidambaram, Kaustubh Paliwal, Kayla Hom, Shaoze Zhou, Chen Chen, Manas Satish Bedmutha, Nadir Weibel

专题命中 其他安全 :alignment(abstract)

AI总结 研究提出AffAdapt框架,整合多模块构建AI角色交互循环,实现流畅人机对话,在高风险对话场景验证其有效性,指出相关挑战并说明其应用场景。

Comments 3 pages, 2 figures, Adjunct Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26 Adjunct), Detroit, MI, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21450 2026-08-25 cs.CV 新提交 50%

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

超越视觉相似度:面向基于知识的视觉问答的实体对齐检索

Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong, Xiangwen Deng, Zhifang Liu, Peng Jiao, Haoqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Arizona(亚利桑那大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对KB-VQA现有检索范式忽略实体语义对齐的缺陷,提出首个MLLM嵌入检索器KBMR,结合语义判别器与连续语义蒸馏目标,在Recall@1和VQA准确率上较CLIP基线实现显著提升。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21445 2026-08-25 cs.CV 新提交 50%

ViTexSZ: Heterogeneous Vision-Text Knowledge Distillation for EEG Seizure Detection

ViTexSZ:用于脑电图癫痫发作检测的异构视觉-文本知识蒸馏框架

Chenxi Liu, Mingzhao Li, Yicong Liu, Hao Miao, Hongyuan Zhang, Ziyi Chen, Gaofeng Meng

专题命中 其他安全 :alignment(abstract)

AI总结 ViTexSZ是用于EEG癫痫发作检测的异构视觉-文本知识蒸馏框架,通过多模态大语言模型对齐异构EEG与临床语义,在四个数据集上实现最高准确率,相对第二优基线提升达12.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-08-25 cs.CV 版本更新 50%

Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16537 2026-08-25 cs.RO 版本更新 50%

Nori A3: A Bimanual Mobile Manipulator at the Appliance Price Point

Nori Bot:一款不到1000美元的 floor-to-counter 移动机械臂

Antonio Li

机构 * LeRobot

专题命中 其他安全 :safety(abstract)

AI总结 Nori Bot 通过600mm Z轴提升、Raspberry Pi 4与OpenClaw协同控制以及软件安全栈解决移动机械臂的三大限制,成本仅为同类商业平台的3%。

Comments 5 pages, 4 figures, 2 tables. Supersedes arXiv:2605.16537 (https://arxiv.org/abs/2605.16537), which described an earlier prototype on a different mechanical base

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09754 2026-08-25 stat.AP 版本更新 50%

Surface temperature extremes produced by huge machine learning hindcasts of summer 2023

由2023年夏季巨大机器学习预测产生的表面温度极值

Mark Risser, Ankur Mahesh, William D. Collins, Joshua North, Boris Bonev, Karthik Kashinath, Thorsten Kurth, Michael S. Pritchard, Shashank Subramanian

专题命中 其他安全 :safety(abstract)

AI总结 本文利用球面傅里叶神经算子机器学习模型生成7424个天气情景,研究2023年夏季极端高温事件,发现其极值温度在大部分地区不寻常,但在部分区域超出传统预测范围,凸显大规模模拟在预测湿热和干旱温度极值中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-08-25 cs.CV 版本更新 50%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 其他安全 :safety(abstract)

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏