arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 598 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 598 篇

2607.15600 2026-07-20 cs.CV 新提交 50%

Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth

从校正立体中进行几何蒸馏:利用对极线索进行单目深度估计

Jung-Hee Kim, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对单目深度估计在不同环境下的难题,提出将多视图模型的尺度感知几何先验转移到单目深度基础模型的框架,通过对极蒸馏方法,无需多视图输入就能保持几何一致性,显著提升零样本度量深度估计性能,且与模型无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14870 2026-07-17 physics.med-ph 新提交 50%

One-for-All Adaptive Radiotherapy Planning Agent: A Foundation Framework for Daily CBCT-guided Radiotherapy

一适用于所有情况的自适应放射治疗计划智能体:基于每日锥束CT引导的放射治疗基础框架

Shaoyan Pan, Kirk Jon Luca, Yuan Gao, Shansong Wang, Mingzhe Hu, Ryan Sanford, Mojtaba Safari, Justin Roper, Zhen Tian, Tonghe Wang, Xiaofeng Yang

专题命中 其他安全 :alignment(abstract)

AI总结 介绍一适用于所有情况的自适应放射治疗计划智能体,它基于统一基础模型,能从每日锥束CT执行在线自适应计划,自主预测关键组件并设计临床计划,经多数据集评估,其准确性和计划质量与临床方案相当,为放射治疗带来新机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-07-16 cs.CV 新提交 50%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13674 2026-07-16 cs.CV cs.RO 新提交 50%

WAVE-Stereo: Warp-Aligned Volume Encoding for Stereo Matching

WAVE-Stereo:用于立体匹配的扭曲对齐体素编码

Zehan Liu, Yage He, Xianwu Gong

专题命中 其他安全 :alignment(abstract)

AI总结 研究提出WAVE-Stereo立体匹配方法,基于相关体与特征扭曲互补线索,通过地理扭曲对应编码器并行编码多信息,用周期性全局上下文传播减轻无纹理区匹配退化,在多基准测试中实现精度与效率良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13257 2026-07-16 cs.SE 新提交 50%

Can LLMs Learn and Apply Multi-Level Modelling Semantics? A First Empirical Study

大语言模型能否学习并应用多层次建模语义?首次实证研究

Yuhong Fu, Weixing Zhang, Bowen Jiang, Haowei Cheng, Karamjti Kaur, Markus Stumptner

专题命中 其他安全 :alignment(abstract)

AI总结 研究大语言模型能否学习应用多层次建模语义,通过让三种商业大语言模型在六种提示策略下为挑战生成模型并与参考对比,发现句法正确性可及,语义正确性部分实现,明确能力边界,为工业5.0建模工作流设计提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12460 2026-07-15 cs.SE 新提交 50%

CodeOwl: Automatic Generation of Tiered Parsons Problems for Introductory Programming

CodeOwl:用于编程入门的分层帕森斯问题自动生成

Luca Cisternino, Florian Obermüller, Gordon Fraser

专题命中 其他安全 :alignment(abstract)

AI总结 针对编程教育中学习者异质性难题,介绍CodeOwl这一人工智能驱动工具自动生成分层帕森斯问题,经混合方法框架评估,该工具生成的问题难度提升效果好,获专家、教师和学生认可,不过教师和学生也分别提出了改进意见。

Comments To appear at the 38th CSEE&T

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12429 2026-07-15 cs.CV 新提交 50%

More Than Where You Are: Learning Semantics, Structure, and Geometry from Cross-View Localization

不仅仅是你在哪里:从跨视图定位中学习语义、结构和几何

Mao Chen, Xiangkai Zhang, Zhiyong Liu, Chuankai Liu, Xu Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Aerospace Control Center(北京航天飞行控制中心)

专题命中 其他安全 :alignment(abstract)

AI总结 研究如何在极端视角变化下通过跨视图定位让模型学习语义、结构和几何。提出CROSS框架,克服现有方法局限,经实验验证该框架在跨视图定位中性能最优,能有效学习多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12418 2026-07-15 cs.CV 新提交 50%

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

MQAdapter:用于从粗到细的视觉语言模型微调的多模态量子适配器

Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang

机构 * Anhui University(安徽大学) Origin Quantum Computing Company Limited(本源量子计算有限公司)

专题命中 其他安全 :alignment(abstract)

AI总结 针对视觉语言模型在少样本学习中细粒度区分不足的问题,提出多模态量子适配器MQAdapter。先检索Top-K候选类别作语义锚点,再用跨模态量子学习机制,利用量子特性建模高阶交互,细化视觉特征,参数高效且能集成现有算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12221 2026-07-15 cs.HC 新提交 50%

From Chaos to Clarity: A Framework for Program-Level AI Learning Outcomes

从混乱到清晰:程序级人工智能学习成果框架

Grace Barkhuff, Ian Pruitt, William Gregory Johnson, Rodrigo Borela, Ben Rydal Shapiro, Anu G. Bourgeois

专题命中 其他安全 :alignment(abstract)

AI总结 针对高等教育中缺乏明确人工智能准备界定结构的问题,提出程序级人工智能学习成果(PLAI-LOs)框架,通过工件级GenAI政策实施,为高等教育从分散规则走向清晰、以学习为中心的战略提供路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12193 2026-07-15 cs.HC cs.CV 新提交 50%

Compos3D: Interactive Part-Based Composition for Creative Control in Generative 3D Models

Compos3D:用于生成式3D模型中创意控制的基于部件的交互式合成

Faraz Faruqi, Sean J. Liu, George Fitzmaurice, Justin Matejka

机构 * Autodesk Research(Autodesk研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对生成式3D建模中控制有限问题,提出Compos3D系统,通过重新混合部件实现创意控制。用户从提示生成候选,选择部件组装,系统合成模型。用户研究表明该方法能带来更好控制、意图匹配和满意度,还给出了未来工作流程设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11196 2026-07-14 cs.CV 新提交 50%

Slot-RAE: Streamlining Object-Centric Learning via Direct Representation Auto-Encoders

Slot-RAE:通过直接表示自动编码器简化以对象为中心的学习

Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * LIRIS(里昂图像与信息系统实验室) Ecole Centrale de Lyon(里昂中央理工学院)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对以对象为中心的模型部署问题,提出Slot-RAE框架,直接在视觉基础模型特征空间运行,采用特征空间扩散过程及独特训练方式,在COCO数据集实验中取得领先成果,实现高效无监督对象发现等,速度和计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11106 2026-07-14 cs.CV 新提交 50%

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

超越视觉:通过自我调节的隐式视觉工具实现高效多模态推理

Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对多模态大语言模型推理效率问题,提出超越视觉(BEE)的隐式视觉工具范式,通过将视觉工具调用行为纳入训练目标,经两阶段训练,包括形式化思维链监督微调与自我调节奖励驱动对齐,提升了模型在细粒度视觉感知任务中的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10986 2026-07-14 eess.SY cs.SY 新提交 50%

Capture, Shield, or Neutralize: Engagement-Aware Pursuit-Evasion

捕获、防护或中和:基于交战感知的追逃

Ananya Acharya, Trenton Goyette, Masoud Ataei, Adrian Stoica, Vikas Dhiman, Mohammad Javad Khojasteh

专题命中 其他安全 :safety(abstract)

AI总结 研究多智能体对抗环境下的追逃问题,提出分层控制架构,将战略规划与安全保证解耦。通过零和滚动时域博弈及MPC求解,利用横向速度惩罚和CBF保证安全。模拟实验表明该框架能灵活切换策略,不同规则下性能稳健且控制逻辑不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10953 2026-07-14 cs.CV 新提交 50%

Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge

利用器官分层报告知识学习基于解剖学的CT视觉语言表征

Guoliang You, Hongming Li, Yuanwang Zhang, Yong Fan

机构 * Department of Radiology, Perelman School of Medicine, University of Pennsylvania(放射科,佩尔曼医学院,宾夕法尼亚大学)

专题命中 其他安全 :alignment(abstract)

AI总结 研究利用CT图像与放射学报告进行医学视觉语言预训练,提出OKA-CT框架,通过转化报告为器官条件知识,分阶段学习,在数据集上实现零样本异常诊断高AUROC,优于基线,提升报告-图像对齐。

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10851 2026-07-14 cs.CV 新提交 50%

Learning To Focus: Anatomy-Guided Attention Regularization for Medical Image Classification

学习聚焦:用于医学图像分类的解剖学引导注意力正则化

Tonmoy Hossain, Atiqur Rahman, Farhana Hossain Swarnali, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学) Ahsanullah University of Science and Technology(阿山努拉科技大学) University of Utah(犹他大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对医学图像分类中标准分类损失缺乏空间监督的问题,提出Locus框架,利用预训练分割基础模型引导分类器关注诊断相关解剖结构,引入正则化项平衡注意力,在多数据集上验证,提升了分类性能和解剖学注意力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10598 2026-07-14 cs.CV 新提交 50%

Anomalous Frame Detection by Grouping Frame Similarities between Two Videos Computed by Vision-Language Model to Extract Expert Workers' Unique Actions

通过对视觉语言模型计算的两个视频之间的帧相似性进行分组来检测异常帧,以提取专家工人的独特动作

Ryo Sakai, Yongpeng Cao, Nobutaka Kimura

专题命中 其他安全 :safety(abstract)

AI总结 针对熟练维护工人减少的问题,提出通过比较两个视频帧相似性检测异常帧来提取专家独特动作的方法,在模拟实验中对特定动作类型提取率达66.9%,比传统技术提高50个百分点,有助于技能转移和劳动力发展。

Comments 11 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10205 2026-07-14 math.OC 新提交 50%

Exploiting Structure with Anisotropic Consensus-Based Optimization

基于各向异性共识的优化方法利用结构

Sabrina Bonandin, Konstantin Riedl, Sara Veneruso

专题命中 其他安全 :alignment(abstract)

AI总结 研究基于各向异性共识的优化方法(CBO),该方法能利用高维目标函数可加分离结构减轻维度诅咒。证明其计算复杂度仅指数依赖内在维度\(\mathbf{d}\),数值实验验证理论结果,突出相关因素对算法性能和复杂度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09008 2026-07-13 cs.CV 新提交 50%

C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes

C-GAP:类感知与在线提示改进不均衡类上的视觉语言模型

Francis Fernandez, Arash Jahangiri, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 其他安全 :safety(abstract)

AI总结 研究针对安全关键感知系统检测小标签空间中罕见物体类别的问题,提出C-GAP框架,通过建立复合字幕基线并利用语言模型迭代细化提示,无需更新检测器权重,有效提升少数类检测精度,实验证明其成效显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02300 2026-07-10 cs.CV cs.SE 新提交 50%

Search-based Testing of Vision Language Models for In-Car Scene Understanding

基于搜索的车内场景理解视觉语言模型测试

Lev Sorokin, Chen Yang, Ken E. Friedl, Andrea Stocco

机构 * BMW Group, Technical University of Munich(宝马集团、慕尼黑技术大学) Technical University of Munich(慕尼黑技术大学) Technical University of Munich, fortiss GmbH(慕尼黑技术大学、fortiss GmbH)

专题命中 其他安全 :safety(abstract)

AI总结 提出ISU-Test方法,结合渲染场景生成与搜索测试,通过优化场景参数自动生成多样化车内场景,评估VLM在问答和字幕任务中的性能,相比随机生成故障率提高10倍,故障覆盖率提高3.6倍。

Comments Accepted at the Industry Track of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07675 2026-07-09 cs.CV 新提交 50%

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

用于具身智能的缩放专家混合视频预训练

Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng

机构 * Robbyant(蚂蚁灵波)

专题命中 其他安全 :alignment(abstract)

AI总结 针对视频生成模型领域不匹配问题,提出LingBot-Video,采用MoE架构、构建数据剖析引擎、开发多维奖励系统进行视频预训练,验证了其性能和效率,贡献了首个大规模开源MoE视频基础模型。

Comments Project page: https://technology.robbyant.com/lingbot-video

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06937 2026-07-09 cs.DL 新提交 50%

Exploring Serendipity in Information Seeking for Digital Collections: A Mixed-Methods Survey Study toward Human-Centered Design

探索数字馆藏信息检索中的意外发现:以用户为中心设计的混合方法调查研究

Saumik Shashwat, Xiaoyi Xue, Benjamin Charles Germain Lee

专题命中 其他安全 :alignment(abstract)

AI总结 该研究以混合方法调查探索数字馆藏信息检索中的意外发现,通过在线调查获取用户体验等数据,发现目标宽泛和具体的参与者意外发现感知情况、意外数字环境与发现的关联及影响因素等,并讨论了促进意外发现的系统设计方向。

Comments 9 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06791 2026-07-09 cs.CE 新提交 50%

Machine Learning-Based Battery State-of-health Prediction for Unmanned Aerial Vehicles Predictive Maintenance

基于机器学习的无人机预测性维护电池健康状态预测

Jiarui Xie, Lingchen Kong, Mohamed Rami Latreche, Sean Smith, Elaine Mosconi, Yaoyao Fiona Zhao

专题命中 其他安全 :safety(abstract)

AI总结 研究针对无人机电池健康状态预测中数据稀缺等问题,开发基于机器学习的管道,通过飞行实验收集数据,选电压等为输入特征,将时间序列数据转图像,利用迁移学习获准确预测模型。

Comments 6 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06185 2026-07-08 cs.CV 新提交 50%

Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

用于细粒度图像识别的视觉语言模型中的结构化压缩提示调优

Xinda Liu, Qinyu Zhang, Weiqing Min, Guohua Geng, Shuqiang Jiang

机构 * School of Information Science and Technology, Northwest University(西北大学信息科学与技术学院) Laboratory of Intelligent Information Processing, Institute of Computing Technology(中国科学院计算技术研究所智能信息处理重点实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 针对细粒度图像识别中视觉语言模型捕捉细微差别能力有限的问题,提出结构化压缩提示调优(SCPT),通过语义关系编码和语义压缩损失增强语义结构建模,在多基准实验中有效减轻语义模糊性,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06019 2026-07-08 cs.CV 新提交 50%

KOAL: Knowledge-Driven Prostate Cancer Grading with Ordinal-Aware Learning

KOAL:基于序数感知学习的知识驱动前列腺癌分级

Zheng Guo, Jiaqi Cui, Haocheng Xiong, Jize Han, Bo Liu, Qianwen Zhang, Rui Chen, Yan Wang

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) China Mobile (Suzhou) Software Technology Company Limited(中国移动(苏州)软件技术有限公司) Shanghai Changhai Hospital, Naval Medical University(上海长海医院,海军医学大学) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院)

专题命中 其他安全 :alignment(abstract)

AI总结 研究利用mpMRI无创预测前列腺癌GGG的问题,提出KOAL框架,含临床上下文调制、知识引导原型对齐和分层序数感知约束三个模块,实验证明该框架优于现有方法,提升了前列腺癌GGG预测准确性。

Comments 10 pages, 2 figures, 2 tables. Accepted at MICCAI 2026. This is the submitted version prior to peer review. The final authenticated version will be available on SpringerLink

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05733 2026-07-08 cs.CV 新提交 50%

ARMS: Anchor-Relational Motion Streaming for Seamless Solo-Social Motion Transitions

ARMS:用于无缝单人-社交运动转换的锚定关系运动流

Huakun Liu, Qing Yu, Kent Fujiwara, Hideaki Uchiyama, Kiyoshi Kiyokawa

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) LY Corporation(LY 公司)

专题命中 其他安全 :alignment(abstract)

AI总结 研究旨在从文本生成连续且连贯的人类运动。提出ARMS框架,统一单人运动和人际互动,引入动态不对称表示,用因果关系扩散模型及关系门控实现。实验表明其提升了转换平滑度与社会连贯性,在互动基准测试中表现良好。

Comments Accepted by ECCV 2026. Project page: https://hkliu.com/arms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05637 2026-07-08 cs.CV 新提交 50%

Recovering Cloud Microstructures with Cascaded Diffusion Inversion

通过级联扩散反演恢复云微观结构

Hanan Gani, Guy Pulik, Daniel Rosenfeld, Duncan Watson-Parris, Salman Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 其他安全 :alignment(abstract)

AI总结 针对卫星云图像分辨率不足及现有方法不适用于此类图像的问题,提出基于扩散的两阶段超分辨率框架,能将云微观结构分辨率提高4倍,在精度和视觉质量上优于现有方法,为云微物理分析及利用AI促进气候和可持续性提供路径。

Comments Published at ML4RS Workshop ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05093 2026-07-08 cs.CV 新提交 50%

Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing

通过多尺度卷积和动态路由实现下一代网络的语义视频通信

Gengtian Shi, Jinze Yu, Chenhao Wu, Shaofei Wang, Eiji Fukuzawa, Junjie Tang, Hiroshi Onoda, Jiang Liu

机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院) Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成人工智能创新中心) Amazon(亚马逊)

专题命中 其他安全 :alignment(abstract)

AI总结 针对视频流量增长需求,提出语义视频通信框架,用多尺度时间卷积编码器捕捉运动模式,基于胶囊的动态路由机制优化关联,多任务学习统一组件,在实验中取得显著改进。

Comments Accepted at the AAAI 2026 Workshop on AI for Time Series (AI4TS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01148 2026-07-08 cs.SI cs.SY eess.SY 新提交 50%

Emergence of Preferential Attachment and Glass-Ceiling Effects in Autonomous Networks of LLMs

LLM自主网络中优先连接与玻璃天花板效应的涌现

Yiming Zhang, Vikram Krishnamurthy

专题命中 其他安全 :alignment(abstract)

AI总结 研究LLM代理自主选择合作者时网络结构的涌现,发现优先连接和类型依赖的玻璃天花板效应,通过平均场模型证明中心性收敛,实验验证了网络动态对集体性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04665 2026-07-07 cs.CV 新提交 50%

DiCE-CIR: Direct Composition Learning for Efficient Zero-Shot Composed Image Retrieval

DiCE-CIR:用于高效零样本合成图像检索的直接合成学习

Gwang-Ho Na, Ho-Joong Kim, Seong-Whan Lee

机构 * Institute of Information & Communications Technology Planning & Evaluation (IITP)(信息通信技术规划与评估研究所(IITP)) Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 其他安全 :alignment(abstract)

AI总结 研究零样本合成图像检索问题,提出直接合成学习方法DiCE-CIR,直接组合参考图像和编辑文本预测合成查询表示,用大语言模型自动构建训练样本,训练轻量级模块,实验表明其性能优且效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04559 2026-07-07 cs.CV 新提交 50%

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

QSVideo:用于视频理解的查询条件语义时间检索

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

机构 * Michigan State University(密歇根州立大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏