Efficient Exploration of Multi-Modal Posterior Distributions
专题命中 多模态生成 :multi-modal(title,abstract)
Comments 6 pages, 1 figure
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multi-modal(title,abstract)
Comments 6 pages, 1 figure
专题命中 多模态生成 :multi-modal(title,abstract)
Comments 18 pages
专题命中 多模态生成 :multimodal(title,abstract)
Comments Pages IEEE format, International Journal of Computer Science and Information Security, IJCSIS January 2010, ISSN 1947 5500, http://sites.google.com/site/ijcsis/
Journal ref International Journal of Computer Science and Information Security, IJCSIS, Vol. 7, No. 1, pp. 296-305, January 2010, USA
基于合规评分的Best-of-N护栏编排用于支付争议防御中的多模态文档生成
机构 * eBay Inc.(eBay公司)
专题命中 多模态生成 :multimodal(title,comments);分类 cs.CL、cs.AI
AI总结 提出一种结合多候选生成与合规评分早退机制的护栏编排层,通过并行生成、加权评分和最佳输出选择,在支付争议防御场景中实现高合规率与低延迟。
Comments 8 pages, 7 figures, 4 tables. Preprint. Applied systems paper on compliance-scored guardrail orchestration for multimodal LLM document generation. Contains aggregate operational readouts; not a randomized A/B test
用于一致多参考图像编辑的评估-验证奖励
机构 * Xi’an Jiaotong University(西安交通大学) ; Amap, Alibaba(高德,阿里巴巴) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。
Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) ; Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) ; Ant Group(蚂蚁集团) ; Sangfor Technologies Inc.(深信服科技股份有限公司)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV
AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。
读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型
机构 * The University of Hong Kong(香港大学) ; ByteDance Seed(字节跳动Seed) ; Peking University(北京大学)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。
SuperVoxelGPT: 自适应有序3D令牌化用于自回归形状生成
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Tencent America(腾讯美国)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出SuperVoxelGPT框架,通过自适应且有序的超体素令牌化解决自回归3D生成中序列长度与空间顺序的矛盾,实现高质量、高效率的形状生成。
Dress-ED:基于指令的虚拟试穿和试脱编辑
机构 * University of Modena(摩德纳大学) ; University of Trento(特伦托大学) ; University of Pisa(比萨大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。
Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/
Edit-R2:面向多轮图像编辑的上下文感知强化学习
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Kuaishou Technology(快手科技)
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 提出Edit-R2框架,通过重构会话意图和联合优化推理与生成的强化学习,解决多轮图像编辑中的长上下文稀释和状态污染问题,并在MICE-Bench基准上取得领先性能。
再思考:通过候选发现与比较推理进行分割
机构 * The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出两阶段框架Rea2Seg,先基于注意力图生成候选掩码,再用多模态大语言模型推理评分,将分割转化为候选发现与判别选择,并引入新基准ReasonSeg-SGDR全面评估感知、定位与推理能力。
Comments Project page: https://snowball521.github.io/Rea2Seg-Project/
ChartAttack: 测试大型语言模型在图表生成中对恶意提示的脆弱性
机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT索菲亚大学"圣克莱门特·欧赫里迪斯基") ; Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(无处不在知识处理实验室(UKP实验室)、计算机科学系、图腾达姆斯塔特大学和应用网络安全国家研究中心ATHENE) ; Arizona State University(亚利桑那州立大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL
AI总结 本文提出ChartAttack框架,用于评估多模态大语言模型在生成误导性图表方面的能力,通过注入误导性元素来诱导错误解释,并引入AttackViz数据集来评估和改进模型的鲁棒性。
先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架
机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) ; Zhongnan University of Economics and Law(中南财经政法大学) ; Jilin University(吉林大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。
Any2Any: 统一任意模态遥感翻译
机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(多媒体软件国家工程研究中心、人工智能研究院、计算机科学学院、武汉大学) ; Hubei Key Laboratory of Multimedia(湖北省多媒体重点实验室) ; Zhongguancun Academy, Beijing, China. 100094(中关村学院,北京,中国。100094) ; School of Electronic Information, Wuhan University, Wuhan, China(电子信息学院,武汉大学,武汉,中国) ; School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, Wuhan, China(测绘、制图与遥感信息工程国家重点实验室,武汉大学,武汉,中国)
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CV
AI总结 提出统一潜扩散框架Any2Any,通过共享潜空间和轻量残差适配器实现任意模态间的高效翻译,并在新数据集RST-1M上验证了其优于成对方法且具备零样本泛化能力。
Comments Accepted by ICML 2026
EVA01: 通过混合变换器实现统一的原生3D理解和生成
机构 * SeeleAI Team(SeeleAI团队)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出EVA01框架,通过混合变换器架构扩展多模态大语言模型的模态边界,实现原生的3D网格理解和生成以及上下文感知编辑,提升文本到3D生成的保真度和多轮几何编辑能力。
Comments 28 pages, 10 figures, 6 tables. Technical report
COP-GEN:用于Copernicus地球观测数据的潜在扩散变换器
机构 * School of Engineering University of Edinburgh(工程学院爱丁堡大学) ; European Space Agency (ESA)(欧洲航天局) ; Asterisk Labs(Asterisk实验室)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CV
AI总结 COP-GEN通过建模异质地球观测模态的联合分布,实现了多模态潜在扩散变换器,支持灵活的任意到任意条件生成,包括无需重新训练的零样本模态翻译。
简洁几何描述作为桥梁:释放LLM在平面几何问题求解中的潜力
机构 * Beihang University(北航大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 本文提出通过训练多模态大语言模型解释器生成几何描述,再利用通用LLM进行推理,以解决平面几何问题。通过设计CDL匹配奖励机制,提升生成几何描述的效率,并在新构建的Formalgeo7k-Rec-CoT数据集上验证了方法的有效性。
Comments CVPR 2026 Findings
Marmot:通过多智能体推理实现对象级自校正
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
AI总结 Marmot通过多智能体推理实现对象级自校正,提升图像文本对齐的准确性,解决多对象场景中计数、属性和空间关系的校正问题。
Journal ref Machine Intelligence Research, 2026
AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。
Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM
Video4Edit: 将图像编辑视为一种退化的时间过程
机构 * Baidu Inc.(百度公司)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 Video4Edit通过将图像编辑视为退化的时间过程,利用视频预训练的单帧演化先验,实现高效的数据微调,从而在性能上与主流模型相当,但仅需1%的监督数据。
Comments 10 pages, 5 figures
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CL
机构 * Ant Group(蚂蚁集团)
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
机构 * CUHK MMLab(香港中文大学MML实验室) ; ByteDance Seed(字节跳动种子)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project page: https://tar.csuhan.com
机构 * College of Computer Science, Sichuan University(四川大学计算机学院) ; National Key Laboratory of Fundamental Algorithms and Models for Engineering Simulation, Sichuan University(四川大学国家工程仿真基础算法与模型重点实验室) ; Sichuan National Innovation New Vision UHD Video Technology Co., Ltd(四川国家创新新视觉超高清视频技术有限公司) ; Tianfu Jincheng Laboratory(天府锦城实验室)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.MM
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
多模态大语言模型在农业图像解释与生成任务中的幻觉行为
机构 * Texas A&M University System(德克萨斯大学系统)
专题命中 多模态生成 :multimodal(title);分类 cs.CV、cs.AI
AI总结 本研究系统评估了多模态大语言模型在农业图像解释(图像到文本)和生成(文本到图像)任务中的幻觉行为,发现模型存在生物不一致、上下文不准确和农学不合理等错误模式,并通过少样本提示等方法分析了幻觉的残留影响。
探索互惠的跨模态注意力以实现情境感知的人体可供性生成
机构 * University of Technology Sydney(技术大学悉尼大学) ; Indian Institute of Technology, Kharagpur(印度理工学院哈里科特) ; Indian Statistical Institute, Kolkata(印度统计研究所科契)
专题命中 多模态生成 :cross-modal(title);分类 cs.CV、cs.MM
AI总结 本文提出一种互惠的跨模态注意力机制,通过不同模态的空间特征图互相关注,以提升2D场景中人体可供性预测的准确性与效率。
Comments Accepted in The IEEE Transactions on Artificial Intelligence (TAI) 2026
XD-MAP:通过语义参数地图实现跨模态领域适应以实现可扩展的训练数据生成
机构 * KIT Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; FZI Research Center for Information Technology(FZI信息技术研究中心)
专题命中 多模态生成 :cross-modal(title);分类 cs.CV、cs.AI
AI总结 本文提出XD-MAP,通过语义参数地图将图像数据集中的传感器特定知识转移到LiDAR领域,无需手动标注即可提升多模态领域适应性能。
Comments 10 pages, 7 figures, 3 tables, accepted at CVPRW