Unpaired Modality-Agnostic Generative Recommendation
非配对模态无关生成式推荐
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出UnpairGR模型,从多类观测中学习统一语义ID空间,在三类基准数据集上验证其可提升完全与不完全观测下的推荐性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
非配对模态无关生成式推荐
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出UnpairGR模型,从多类观测中学习统一语义ID空间,在三类基准数据集上验证其可提升完全与不完全观测下的推荐性能。
并发图像理解与生成:自校正耦合马尔可夫跳跃过程
机构 * Stony Brook University(纽约州立大学石溪分校) ; Google DeepMind(谷歌DeepMind)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 研究针对人类认知中理解与生成的耦合循环,引入自校正耦合马尔可夫跳跃过程框架及$\texttt{CO}_\texttt{2}\texttt{Jump}$采样器,解决掩码扩散模型跨模态矛盾问题,创建多模态语料库,该方法在图像相关任务中性能优异,且性能随去噪步骤数提升。
Comments Project page: https://coupled-jump.github.io
T2MM:一种支持基于探究建模的LLM架构
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 提出T2MM架构,利用LLM在生态建模软件VERA中生成交互式模型,优于全代码生成基线。
Comments 16 pages, 4 figures
从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计
机构 * Alibaba Group(阿里巴巴集团)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。
Comments 19 pages, 10 figures
TRACE-Bench:多参考图像生成的分解与诊断
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对多参考图像生成基准的缺陷,构建TRACE-Bench基准,采用算子分解方法评估9个主流模型,发现解耦与属性绑定是核心瓶颈,最优模型属性保真度仅0.74
Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)
更多检索到的证据是否有助于基于扩散语言模型的视觉检索增强生成?
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对基于扩散语言模型的视觉检索增强生成,研究发现无条件扩大检索证据会因语义冲突降低准确率,提出无需训练的基于熵的候选过滤框架,可平均提升答案准确率2.62个百分点。
FinReportBench:衡量与提升机构级财务报告生成能力
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出FinReportBench基准,发现大型语言模型生成机构级财务报告的瓶颈在于报告身份认同与机构完整性,通过基准引导的技能蒸馏可显著提升模型相关指标。
Comments 9 pages, 9 figures
ChartAnno:评估多模态大语言模型的图表标注生成能力
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ChartAnno基准评估MLLMs的图表标注生成能力,实验显示专有模型表现更优,大规模开源模型正缩小差距,更具体指令可提升标注质量,图表图像仅在设计相关指标上有有限提升。
CorePath:用于核心针活检诊断和风险可控报告生成的乳腺专用病理基础模型
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究开发乳腺专用病理基础模型CorePath,经7901对数据微调后,在多队列及基准上的CNB诊断任务中性能优于现有模型,结合风险控制模块实现低幻觉的可靠报告生成。
Comments The code will be made publicly available upon publication
无实体的溯因推理?科学假说生成的表征奠基与溯因循环
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出无需实体的科学溯因推理,构建含弃权机制的溯因循环架构,以惯例空间解决跨领域检索难题,通过案例抽象架构并提出DAB-30基准作为评估方案。
Comments 20 pages, 4 figures. DAB-30 execution reported in companion paper
UDT:通过数据自适应令牌缩减协调U-Net与扩散Transformer
机构 * University of Minnesota(明尼苏达大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出UDT架构,通过数据自适应令牌合并协调U-Net与DiTs,在ImageNet图像生成任务中收敛速度更快、FID指标更优,为DiTs提供了新的高效骨干网络。
约束锚定推理轨迹
机构 * University of Oxford(牛津大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。
Comments 15 pages, ACM MM 2026
思考、规划、绘制:统一模型中用于可控图像生成的布局感知推理
机构 * Tencent(腾讯) ; Peking University(北京大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对统一多模态大语言模型在可控图像生成中难以遵循复杂空间指令的问题,提出ATLAS框架,采用“思考、规划、绘制”范式及布局共享表示,经强化学习提升性能,在图像生成等任务中效果显著,还支持相关编辑与多模态基础,并引入评估基准。
Comments 22 pages, 12 figures, 9 tables
HIVE:理解视觉语言模型中的幻觉后推理
机构 * Purdue University(普渡大学) ; Rutgers University(罗格斯大学) ; Meta AI ; Kent State University(肯特州立大学) ; Imperial College London(伦敦帝国学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。
Comments Accepted by ECCV 2026
用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥
机构 * The University of Sydney(悉尼大学) ; Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) ; Beijing Normal University(北京师范大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。
Comments Accepted at MICCAI 2026
用于文本到图像上下文学习的思维树推理
机构 * Korea University(韩国大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究文本到图像上下文学习中模型的推理问题,提出思维树推理框架,通过多阶段推理和选择层减轻提示模糊性与组合错误,实验表明该结构化多分支推理能提升图像生成效果,无需额外训练或微调。
Comments 6 pages, 3 figures, 4 tables. Accepted at IEEE SMC 2026. Code available at https://github.com/Pandastep/ToT-T2I-ICL
ELSA3D:用于统一3D理解与生成的弹性语义锚定
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究统一3D基础模型文本-3D交互隐式问题,提出ELSA3D模型,通过弹性语义锚定联合构建语言和几何推理,用尺度感知八叉树令牌化器和锚定令牌表示几何,轻量级路由器使计算和推理弹性化,性能领先且减少计算量和延迟。
代理分析:作为条件编码器的视觉语言模型中的定位信号
机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) ; Google DeepMind(谷歌DeepMind)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。
Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop
看见情感:用于脑电图情感识别的面部表情符号代理建模
机构 * Hefei University of Technology(合肥工业大学) ; PLA Information Engineering University(中国人民解放军信息工程大学) ; University of Science and Technology of China(中国科学技术大学) ; MBZUAI
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 研究将脑电图可解释性重构为跨模态生成任务,提出面部表情符号代理建模框架,把高维脑电图信号转化为面部表情符号,在相关基准测试中取得先进准确率,能生成忠实面部动画展现大脑情感演变。
Comments Accepted by ICML 2026
ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维
机构 * Basic Algorithm Center, PCG, Tencent(腾讯PCG基础算法中心) ; Zhejiang University(浙江大学) ; Peking University(北京大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对多模态大语言模型在复杂视觉推理任务中的不足,ProLaViT框架利用内生自蒸馏机制等,设计两种推理范式及损失函数,使其能在潜在空间进行结构化视觉推导,实验证明效果优于基线。
Comments Accepted by ECCV 2026
通过迭代元反射实现自主科学发现
机构 * University of Edinburgh(爱丁堡大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出DiscoPER框架,利用大语言模型进行开放式的自主科学发现,通过动态代码生成、统计检验和二阶推理机制,在iNatDisco基准上以72.7%假设支持率恢复8/9已知模式。
Home3D 1.0:面向室内设计的高保真图像到三维资产生成系统
机构 * Alibaba Group / Taobao(阿里巴巴集团/淘宝)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出Home3D 1.0模块化系统,从单张参考图像生成高质量3D资产,包含几何重建、纹理预测、材质生成和部件分解四个模块,适用于室内设计和电子商务。
Comments 18 pages, 10 figures, 2 tables; technical report
基于全局与局部重建的点云扩散用于实例级3D异常检测
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Guangdong Artificial Intelligence and Digital Economy Laboratory (SZ)(广东人工智能与数字经济实验室(深圳))
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出PCDiff框架,通过实例级多模态条件生成弱缺陷异常,并采用联合局部-全局重建算法恢复前景缺陷同时保持背景正常结构,在3D异常检测中显著优于现有方法。
解剖条件约束的潜在扩散模型用于数据高效的小样本跨域3D胶质瘤MRI合成
机构 * Analytics Everywhere Lab, University of New Brunswick, Canada(新不伦瑞克大学分析无处不在实验室,加拿大)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出解剖条件约束的潜在扩散模型(ALDM),通过两阶段框架(3D变分自编码器学习解剖先验,ControlNet引导的潜在扩散生成结构一致体积)在仅16张目标图像的小样本设置下优于GAN基线,实现FID 85.40和分类AUC 0.987。
Comments Published in Canadian AI 2026
IV-CoT: 面向结构感知文本到图像生成的隐式视觉思维链
机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; Ant Group(蚂蚁集团) ; The University of Hong Kong(香港大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出隐式视觉思维链(IV-CoT)框架,通过结构到语义的级联分解和训练时草图监督,在不增加推理开销的情况下提升文本到图像生成的结构感知能力。
HilDA:利用扩散的分层蒸馏推进自监督LiDAR预训练
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) ; Linköping University(林雪平大学) ; TRATON AB(TRATON公司) ; Qualcomm Auto Ltd Sweden Filial(高通汽车有限公司瑞典分公司)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出HilDA框架,通过分层蒸馏(多层蒸馏和全局上下文蒸馏)结合时间占用扩散目标,自监督预训练LiDAR骨干网络,在3D检测、场景流和语义占用预测任务上达到最先进水平。
Comments Accepted to ECCV 2026. Maciej and Jesper contributed equally
PRIDE: 特权信息增强的共情对话生成蒸馏方法
机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。
TriMotion: 模态无关的摄像机控制用于视频生成
机构 * GIST(光州科学技术院) ; Huawei Noah's Ark Lab(华为诺亚方舟实验室) ; Yonsei University(延世大学) ; Imperial College London(伦敦帝国理工学院)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出TriMotion框架,通过将视频、姿态和文本输入映射到共享运动嵌入空间,实现模态无关的摄像机控制视频生成,并引入潜在运动一致性目标,无需像素级解码即可准确跟随目标轨迹。
Comments ECCV Accepted
GEOPHYS: 物理合理性的几何学
机构 * Bielefeld University(比勒费尔德大学) ; University of Oxford(牛津大学) ; Cold Spring Harbor Laboratory(冷泉港实验室) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Independent(独立作者) ; Honda Research Institute EU(本田欧洲研究院) ; New York University(纽约大学) ; Flatiron Institute, Simons Foundation(西蒙斯基金会熨斗研究所)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出GEOPHYS方法,利用冻结图像编码器的每帧嵌入的五个几何特征检测视频中的物理不合理性,在物理违反检测上达到SOTA,并作为验证器提升视频生成模型的物理一致性。
重新审视用于3D CT报告生成的LLM适应:缩放与诊断先验研究
机构 * Northwestern University(西北大学) ; University of South Dakota(南达科他大学) ; Aalto University(阿尔托大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 提出RAD3D-Prefix轻量级诊断先验框架,通过冻结大语言模型并融合多标签分类逻辑,在少量可训练参数下实现3D CT报告生成,优于全微调基线并展现强泛化性。