Syntax Meets Semantics: Understanding Scientific Formulae
语法与语义融合:理解科学公式
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 本研究针对科学公式语法与语义表征不匹配问题,采用图编码器、文本编码器结合对比学习实现跨模态对齐,显著提升了学术信息检索中的跨模态检索性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
语法与语义融合:理解科学公式
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 本研究针对科学公式语法与语义表征不匹配问题,采用图编码器、文本编码器结合对比学习实现跨模态对齐,显著提升了学术信息检索中的跨模态检索性能。
StyleForge:基于超图场中反事实推理的室内家具风格生成
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。
排序前分配:面向通用大模型(OmniLLMs)的解耦令牌压缩
机构 * University of Houston(休斯顿大学) ; The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 针对通用大模型令牌压缩的偏向音频分配问题,提出无需训练的Macer压缩器,先分配音视频预算再按模态排序,降本同时在多基准上保持性能,在OmniVinci-9B上提升达12.9个点。
判别轴,而非数据量:对比语料库能为音频嵌入模型带来什么启示
机构 * Eximius Labs(埃克西米厄斯实验室) ; Wabash College(沃巴什学院)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL
AI总结 该研究发现对比音频嵌入模型编码的属性由语料库结构而非规模决定,通过调整语料标注多样性可提升情感识别性能,同时平衡关键词检测能力。
Comments 10 pages, 4 figures
面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界
专题命中 跨模态检索 :multi-modal(abstract)
AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。
AgenTag:基于行为指纹的AI编码智能体归因
专题命中 跨模态检索 :multimodal(abstract)
AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。
GARDRec:面向大语言模型推荐的决策级图接地方法
专题命中 跨模态检索 :multimodal(abstract)
AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。
Comments 18 pages, 2 figures
GenED-SC:集成多模态大模型的生成式编辑语义通信
专题命中 多模态生成 :MLLM(summary_cn,abstract);multi-modal(title);multimodal(abstract)
AI总结 提出一种两阶段语义图像传输框架,结合JSCC判别传输与MLLM生成编辑,在低信噪比下提升语义保真度和感知质量。
CoT-Edit:让思维链(CoT)指导指令视频编辑
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Tsinghua University(清华大学)
专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法
跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。
Comments 14 pages, preprint
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments Project page:https://hanxjing.github.io/CultureVidBench/
基于拉姆伯特W函数框架的石墨烯纳米带量子传感:理论、验证与多模应用
专题命中 多模态生成 :multi-modal(title)
AI总结 基于拉姆伯特W函数的石墨烯纳米带量子传感框架,通过理论验证和多模应用,实现了灵敏度增强和性能预测。
Comments 21 pages, 10 figures, published version at Results in Engineering journal
Journal ref Results in Engineering, Volume 32, 2026, 112238
从不确定性到确定性:无射线匹配的由粗到细视觉楼层平面图定位
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 该研究针对视觉楼层平面图定位的多模态姿态分布问题,提出无射线匹配的由粗到细框架,通过图像条件姿态扩散模型与局部细化器实现定位,在S3D和ZInD基准上达到最优精度与鲁棒性。
MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; StepFun(阶跃星辰) ; Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) ; School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。
Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page
非配对模态无关生成式推荐
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出UnpairGR模型,从多类观测中学习统一语义ID空间,在三类基准数据集上验证其可提升完全与不完全观测下的推荐性能。
无实体的溯因推理?科学假说生成的表征奠基与溯因循环
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出无需实体的科学溯因推理,构建含弃权机制的溯因循环架构,以惯例空间解决跨领域检索难题,通过案例抽象架构并提出DAB-30基准作为评估方案。
Comments 20 pages, 4 figures. DAB-30 execution reported in companion paper
UDT:通过数据自适应令牌缩减协调U-Net与扩散Transformer
机构 * University of Minnesota(明尼苏达大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出UDT架构,通过数据自适应令牌合并协调U-Net与DiTs,在ImageNet图像生成任务中收敛速度更快、FID指标更优,为DiTs提供了新的高效骨干网络。
学习局部感知并与病理学语义临床对齐的放射学报告生成方法
专题命中 多模态生成 :image-text(abstract);分类 cs.CV
AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性
PosterMELD:面向可编辑打印就绪输出的可控设计多样性多智能体论文转海报生成
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 PosterMELD是模板条件化多智能体海报生成流水线,可导出可编辑PPTX和PNG,在621篇论文实验中PRR达81.3%,成本仅为Codex+Skill的3.5%,性能优于P2P、PosterGen等方法。
Comments 9 pages, 5 figures, and 4 tables. Code and resources are available at https://github.com/Shannon4Science/PosterMELD
GeoCore-9B:面向地球观测的地理感知生成基础模型
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 本文针对现有EO生成模型的地理空间约束冲突问题,推出90亿参数的GeoCore-9B,采用Flow Matching的DiT与地理空间元数据条件生成,结合地理空间语义对齐损失,在多项EO任务上实现最优性能。
Comments Please visit our project page at https://kaist-viclab.github.io/GeoCore-9B_site/
Remember-R1:通过强化学习缓解长上下文视觉遗忘
机构 * Northwestern Polytechnical University(西北工业大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。
Comments Accepted by ACM Multimedia 2026
SymphonyGen:具有可控和声骨架的3D分层交响乐生成
机构 * Department of AI Music and Music Information Technology, Central Conservatory of Music(中央音乐学院人工智能音乐与音乐信息科技系) ; Frontier Institute of Science and Technology, and Interdisciplinary Research Center of Frontier Science and Technology, Xi’an Jiaotong University(西安交通大学前沿科学与技术研究院及交叉科学与技术 interdisciplinary research center) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen University(深圳大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI
AI总结 SymphonyGen通过3D分层框架实现当代电影交响乐生成,采用分层解码器架构提升效率,引入短谱条件和GRPO优化,增强和声纯净度与音乐表现力。
Comments Accepted at ISMIR 2026
DriveCode: 针对基于LLM的自动驾驶的领域特定数值编码
机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) ; The School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) ; The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; DiDi, Beijing, China(滴滴出行) ; State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出DriveCode,一种将数字表示为专用嵌入而非离散文本标记的新型数值编码方法,提升LLM在自动驾驶中的数值推理与解码效率。
Comments The project page is available at https://shiftwilliam.github.io/DriveCode
在想象之翼上:用于幽默标题生成的冲突脚本多角色框架
机构 * Hong Kong Baptist University(香港 Baptist 大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL
AI总结 本文提出基于幽默理论GTVH的HOMER框架,通过多角色LLM协作生成幽默标题,实验表明其在多模态幽默标题生成中优于现有方法。
Comments Paper published as a conference paper at ICLR 2026
基于环境偏微分方程的时空场定位方法
专题命中 多模态生成 :multimodal(abstract)
AI总结 该研究提出基于PDE控制的环境时空场的定位框架,采用Rao-Blackwellized粒子滤波器分解车辆状态,仿真与实验表明其定位精度优于标准粒子滤波器,验证了环境场用于实际定位的可行性。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2
机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) ; College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
专题命中 多模态评测 :MLLM(title,summary_cn);multimodal(abstract);分类 cs.CV
AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。
探索与弥合未学习多模态大语言模型中的知识缺口
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对未学习多模态大语言模型存在的知识缺口问题,提出带锚定正则化的选择性保护方法,在保障未学习安全性的同时大幅恢复模型响应质量。
MMOOC:多模态大语言模型的上下文外评估综合基准
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Eastern Institute of Technology(东方理工大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出MMOOC基准,评估多模态大语言模型在上下文偏移场景下的拒绝与作答能力,实验发现当前模型难以平衡可答性与拒绝性,后训练可提升稳健性,该基准将公开。
Comments project page:https://zhuwenjie98.github.io/MMOOC-project-page/
Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试
机构 * National University of Defense Technology(国防科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CL、cs.AI
AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。
ReMiX-MAE:从仅含RGB的临床面部视频中学习缺失通道跨模态表征以用于交感介导的疼痛评估
机构 * School of Computing, Binghamton University(宾汉姆顿大学计算学院) ; SUNY Upstate Medical University(纽约州立大学上州医科大学)
专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出ReMiX-MAE框架,构建SMP数据集,在仅用RGB的疼痛评估任务中,其性能优于仅用RGB的基线,且在数据有限的临床场景中迁移能力更优。