MMGRec: Multimodal Generative Recommendation with Transformer Model
MMGRec: 基于Transformer模型的多模态生成推荐
专题命中 多模态生成 :multimodal(title,abstract)
AI总结 MMGRec通过生成范式引入多模态推荐,利用分层量化和Transformer模型生成用户偏好的项目标识符,提升推荐效果。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
MMGRec: 基于Transformer模型的多模态生成推荐
专题命中 多模态生成 :multimodal(title,abstract)
AI总结 MMGRec通过生成范式引入多模态推荐,利用分层量化和Transformer模型生成用户偏好的项目标识符,提升推荐效果。
生成式AI时代的深度伪造媒体生成与检测:综述与展望
机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 综述了深度伪造生成与检测技术,涵盖图像、视频、音频和多模态内容,构建了分类体系,并提出了新的多模态基准测试,发现现有检测器对未见生成器的深度伪造泛化能力不足。
Comments Accepted in ACM Computing Surveys
StructBiHOI: 结构化关节建模用于长时程双臂手-物体交互生成
机构 * Hefei University of Technology(合肥工业大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 StructBiHOI通过结构化关节建模框架实现长时程双臂手-物体交互生成,提升稳定性和效率。
RAPiD: 通过扩散行为先验实现安全高效的实时确定性轨迹规划
机构 * School of Information Technology, Monash University, Malaysia(墨尔本大学信息科技学院) ; Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院) ; TCS Research, India(印度TCS研究)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
AI总结 RAPiD通过扩散行为先验实现高效安全的实时轨迹规划,优于现有方法。
可证明的扩散后验采样用于贝叶斯反问题
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文提出了一种基于扩散的可证明后验采样方法,通过数据学习分数以捕捉先验分布结构,并提供非渐近误差界以确保复杂多模态后验分布的收敛性。
通过电池文献的多模态挖掘利用X射线吸收光谱数据
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 研究利用多模态文献挖掘将电池文献中分散的X射线吸收光谱数据转化为可用于人工智能的实验数据资源,开发数字化管道并应用于电池文献,产生开放数据集,为相关分析、比较及材料发现提供基础。
苏格拉底测试的理论基础:动态、多模态、对话式考试
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出苏格拉底测试的理论基础,整合多类教育评估原则与分类学,量化最近发展区并设计非补偿性加法评分架构,以解决传统评估的缺陷并提升测量可靠性。
Comments 21 pages, 1 figure, submitted to Computers and Education: Artificial Intelligence
ReMoE:报告引导型混合专家模型用于多模态OCT/OCTA异常检测
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 针对多模态OCT/OCTA异常检测,提出ReMoE模型,融合正常报告语义构建模态感知先验,在两个数据集上取得最优性能。
MMShopBench:面向多模态多轮购物智能体的真实日志基准
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 该研究推出首个多模态多轮购物智能体真实日志基准MMShopBench,构建离线购物沙箱,经微调后开源模型性能大幅接近领先专有模型,验证了基准及配套训练数据的有效性。
Comments 16 pages, 6 figures, including appendix
CAER:面向多模态大语言模型的冲突感知证据路由,采用双前缀专家机制
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本研究提出与主干无关的CAER框架,通过双前缀专家路由机制实现视觉-语言冲突检测与冲突感知生成,在MMMC及AgriConflict数据集上验证可提升开源多模态大语言模型的可靠性。
多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?
专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。
Comments 10 pages, 4 figures, conference
M3MAD-Bench: 多智能体辩论在不同领域和模态中真的有效吗?
机构 * Shandong University(山东大学) ; MBZUAI ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; BOB Cloud(BOB云)
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI
AI总结 M3MAD-Bench通过多领域、多模态和多维指标评估多智能体辩论方法的有效性,提供全面的性能-成本分析。
Comments Accepted by ACMMM 2026
SciFigPlag-Bench:面向来源感知的科学图片抄袭检测基准
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出SciFigPlag-Bench基准,用于科学图片的来源感知抄袭检测,含四类任务,实验发现视觉语言模型在细粒度来源推理等方面仍有挑战。
Comments 30 pages, 18 figures
EduPanel:用于教学视频的三智能体大语言模型评判器——可靠性、互补性和人类信任校准
机构 * National Taiwan University(国立台湾大学) ; NTU Artificial Intelligence Center of Research Excellence(NTU人工智能卓越研究中心)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 针对教学视频教学质量评估需求,提出基于评分标准、以学习者为条件的EduPanel大语言模型评判器,通过专门智能体分解评估,经多项分析实现高可靠性,能辅助教育评估,提高评分准确性且让专家可检测不可靠输出。
Comments 19 pages
手术风险分层与结局预测中缺失的内容:端到端机器学习方法的范围综述
专题命中 多模态评测 :multimodal(abstract)
AI总结 本范围综述回顾190项研究,分析手术风险分层与结局预测的ML流程,发现数据、方法、评估等方面存在差距,为开发更严谨的围手术期ML工具提供参考。
Comments This work has been submitted to the IEEE JBHI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
GEMSS: 一种用于在分类和回归问题中发现多个稀疏解的变分贝叶斯方法
机构 * Faculty of Electrical Engineering, Czech Technical University(捷克技术大学电子工程系)
专题命中 多模态评测 :multimodal(abstract)
AI总结 提出GEMSS算法,利用结构化spike-and-slab先验、高斯混合近似后验和Jaccard惩罚,通过变分推断同时发现多个多样化的稀疏特征组合,在128个实验和3个真实数据集上优于对比方法。
CodeShrink:面向高效多模态代码理解的自适应视觉压缩
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。
具有自适应验证器的多模态强化学习
机构 * Microsoft Research(微软研究院) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; ETH Zurich(苏黎世联邦理工学院) ; UW–Madison(威斯康星大学麦迪逊分校)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。
SeekBrain:用于加速神经科学发现的自主多智能体系统
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 SeekBrain是用于加速神经科学发现的自主多智能体框架,通过分层规划与跨模态分析生成分析流程,在BrainArena基准上优于现有智能体,实际研究中成功揭示了斑马鱼与小鼠的神经表征规律。
HAM-VLN:利用分层智能体记忆实现零样本视觉与语言导航
专题命中 多模态Agent :multimodal(abstract,abstract_cn)
AI总结 本研究提出HAM-VLN零样本VLN方法,通过分层智能体记忆缓解长程导航的记忆与推理瓶颈,提升导航指标并缩短上下文长度,在多个基准数据集上取得优异零样本性能。
面向神经多样性儿童的数字词汇学习干预方案设计:发育性语言障碍儿童的经验与思路
专题命中 多模态Agent :multimodal(abstract)
AI总结 该研究针对发育性语言障碍儿童,采用定制化参与式设计方法,设计词汇学习干预方案,明确了多模态等关键设计要求,为相关干预开发提供了宝贵见解。
Comments 56 pages, 7 tables, 7 figures
专题命中 多模态Agent :multi-modal(abstract)
Comments Minor corrections. 12 pages, 2 figures, 3 tables; 20 pages with appendix and references
Journal ref Foundations of Science, 30(4), 971-1002 (2025)
用于持续指令微调的渐进式多模态对齐
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心) ; Kyoto University(京都大学) ; Migu Culture Technology Co.,Ltd.(咪咕文化科技有限公司) ; State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与类脑智能技术国家重点实验室)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(summary_cn,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对多模态持续指令微调中投影器级遗忘问题,提出渐进式多模态对齐框架PMA,以亚线性参数增长平衡稳定性与可塑性,在多基准实验中提升了现有方法性能且适配多种MLLM主干。
Comments Accepted by ACM MM2026
融合双语义引导与全局-局部互调制的多模态物体重识别
机构 * Dalian University of Technology(大连理工大学) ; University of California, San Francisco(加利福尼亚大学旧金山分校) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文针对多模态物体重识别的语义先验利用不足与全局-局部协同缺失问题,提出含TSI、MGLM、HMF的双语义引导与全局-局部互调制框架,经多基准实验验证有效。
Comments Accepted by IEEE TCSVT 2026. The version of record may differ slightly
PMC-InterCPT:重新思考用于多模态持续预训练的医学交错数据
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Sun Yat-sen University(中山大学) ; InfiX.ai ; PolyU-Daya Bay Technology and Innovation Research Institute(PolyU-大亚湾技术与创新研究院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CL
AI总结 针对医学多模态持续预训练中图像-文本对数据存在的上下文缺失、结构噪声等问题,提出PMC-InterCPT交错语料库,通过恢复缺失标题、清洗文本、重建交错样本及LLM监督过滤,结合模态感知重采样,有效提升医学与通用多模态性能。
GALA:淘宝商购推荐系统中用于自适应多模态表示的生成对齐学习
专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract)
AI总结 本文针对外卖推荐系统多模态融合难、语义与行为对齐不足的问题,提出三阶段流程GALA,通过生成式RL对齐阶段弥合预训练-微调差距,在淘宝商购部署后提升了订单量与AUC等指标。
Comments 13 pages, 12 figures, 5 tables. Accepted at the 2026 IEEE International Conference on Data Engineering (ICDE 2026), Industry and Applications Track
PaletteID:用于多模态点击率预测的原型组合语义标识符
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 提出PaletteID模型,以SQ-DPP构建原型调色板聚合语义相关原型,在两个公开数据集上提升CTR预测性能,对长尾物品增益更显著且标识符分配更鲁棒、语义更可解释。
MMFGU:多模态联邦图遗忘
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 针对现有联邦图遗忘无法满足多模态细粒度遗忘请求的问题,提出MMFGU框架,通过目标特定表示解耦等技术解决三大挑战,实验显示其能有效移除请求信息并实现41.5倍加速。
隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性
机构 * New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Columbia University(哥伦比亚大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。
TerraNova:人类世的基础模型
机构 * Politecnico di Milano(米兰理工大学) ; RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) ; Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI
AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。
Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/