LORE: A Large Generative Model for Search Relevance
LORE:一种大规模生成模型用于搜索相关性
机构 * Alibaba Group(阿里巴巴集团)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 LORE提出了一种基于大规模生成模型的搜索相关性框架,通过两阶段训练和分层部署策略提升搜索效果,为垂直领域提供方法参考。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
LORE:一种大规模生成模型用于搜索相关性
机构 * Alibaba Group(阿里巴巴集团)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 LORE提出了一种基于大规模生成模型的搜索相关性框架,通过两阶段训练和分层部署策略提升搜索效果,为垂直领域提供方法参考。
SciEvalKit: 一个用于科学通用智能的开源评估工具包
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 SciEvalKit是一个开源工具包,用于评估科学通用智能,涵盖科学多模态感知、推理、理解等核心能力,并提供灵活的评估流程和可定制的基准测试环境。
重新审视语言模型在数据压缩中的应用
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL
AI总结 本文探讨了使用大型语言模型进行数据压缩的潜力,展示了在enwik9数据集上达到18%的调整压缩率,并探讨了LLM在压缩非英语数据、代码和字节流序列中的应用。
Comments Preprint
赋能多模态大语言模型中的可靠指令跟随
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Penn State(宾夕法尼亚州立大学)
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出VC-IFEval基准,通过引入视觉依赖性约束,系统评估多模态大语言模型在指令跟随任务中的性能与改进。
Comments Submitted to ARR Jan
E$^2$AT: 通过动态联合优化实现多模态对抗防御
机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) ; HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) ; College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。
VLN-MME: 诊断MLLMs作为语言引导的视觉导航代理
机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) ; Adelaide University(阿德莱德大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 VLN-MME通过统一评估框架揭示MLLMs在具身导航任务中的局限性,发现其3D空间推理能力不足。
通过大型语言模型理解多智能体推理用于漫画视觉问答
机构 * University of Reading(阅读大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。
基于代理记忆的递归推理用于微服务根因定位
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学) ; Institute of Artificial Intelligence(人工智能研究院)
专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI
AI总结 本文提出AMER-RCL框架,通过递归推理和代理记忆提升微服务根因定位的准确性和效率。
Comments accepted by ICSE-SEIP'26
对LLM控制的机器人信任:安全威胁、防御和挑战的综述
机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) ; Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院) ; Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系) ; School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文综述了LLM控制机器人面临的安全威胁和防御策略,强调了具身系统中恶意输出的物理风险,并提出了安全规范和多LLM监督等防御方法。
基于多通道和对称互促特征融合的多模态情感分析
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于多通道和对称互促特征融合的多模态情感分析方法,通过增强模态内特征表示和促进模态间信息交互,提升情感识别的准确性和鲁棒性。
DCG ReID: 解构协作与指导融合表示以实现多模态车辆重识别
专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 DCG-ReID通过解构协作与指导融合表示,解决多模态车辆重识别中模态质量分布不平衡的问题,提升多模态联合决策性能。
MIAR: 多模态情感的模态交互与对齐表示融合
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 MIAR通过模态交互与对齐表示融合,提升多模态情感识别的性能。
多模态数据增强的基础模型用于无线网络中的预测与控制:综述
机构 * School of Electrical Engineering and Computer Science, University of Ottawa(Ottawa 大学电子工程与计算机科学学院) ; Ericsson(埃里克森公司)
专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文综述了多模态数据增强的基础模型在无线网络预测与控制中的应用,探讨了其在无线网络管理中的关键任务和未来发展方向。
Comments 5 figures, 7 tables, IEEE COMST
通过MLLM引导的可靠性基于课程学习增强源无关领域适应
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Kentucky(肯塔基大学)
专题命中 其他多模态 :MLLM(title);multimodal(abstract);分类 cs.CV
AI总结 通过MLLM引导的可靠性基于课程学习增强源无关领域适应,提出一种新的框架,利用多个冻结的MLLMs的稳健监督蒸馏到目标模型,实现稳定且噪声感知的训练。
多模态振荡器网络学习解决分类问题
专题命中 其他多模态 :multimodal(title)
AI总结 多模态振荡器网络通过结合长期记忆、短期记忆和演化法则,实现从示例中学习解决分类任务。
Comments 14 pages, 9 figures
2025年的全息成像:从形态学成像到AI驱动的多模态表型分析
专题命中 其他多模态 :multimodal(title)
AI总结 2025年,全息成像从 niche 技术发展为多功能生物医学成像平台,结合深度学习和多模态技术,推动数字病理学和高通量筛选的应用。
DGA-Net:通过深度提示和图锚引导增强SAM用于伪装物检测
专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV
AI总结 DGA-Net通过深度提示和图锚引导增强SAM,提升伪装物检测的精度和一致性。