arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3496 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3496 篇

1704.04394 2017-04-17 cs.CV 57%

DESIRE: Distant Future Prediction in Dynamic Scenes with Interacting Agents

Namhoon Lee, Wongun Choi, Paul Vernaza, Christopher B. Choy, Philip H. S. Torr, Manmohan Chandraker

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

Comments Accepted at CVPR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.07571 2017-04-12 cs.CV cs.LG cs.NE 57%

Quad-networks: unsupervised learning to rank for interest point detection

Nikolay Savinov, Akihito Seki, Lubor Ladicky, Torsten Sattler, Marc Pollefeys

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Accepted at CVPR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.03567 2017-03-13 cs.CV 57%

A New Evaluation Protocol and Benchmarking Results for Extendable Cross-media Retrieval

Ruoyu Liu, Yao Zhao, Liang Zheng, Shikui Wei, Yi Yang

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.08319 2017-02-28 cs.CV 57%

Visual Translation Embedding Network for Visual Relation Detection

Hanwang Zhang, Zawlin Kyaw, Shih-Fu Chang, Tat-Seng Chua

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.08680 2017-01-11 cs.CV 57%

Measuring and Predicting Tag Importance for Image Retrieval

Shangwen Li, Sanjay Purushotham, Chen Chen, Yuzhuo Ren, C. -C. Jay Kuo

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.04307 2016-08-16 cs.CV 57%

Transitive Hashing Network for Heterogeneous Multimedia Retrieval

Zhangjie Cao, Mingsheng Long, Qiang Yang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.2306 2015-04-15 cs.CV 57%

Deep Visual-Semantic Alignments for Generating Image Descriptions

Andrej Karpathy, Li Fei-Fei

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1109.4684 2015-03-19 cs.AI cs.LG 57%

Exhaustive and Efficient Constraint Propagation: A Semi-Supervised Learning Perspective and Its Applications

Zhiwu Lu, Horace H. S. Ip, Yuxin Peng

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

Comments The short version of this paper appears as oral paper in ECCV 2010

Journal ref International Journal of Computer Vision (IJCV), 2012

详情

展开后加载摘要…

URL PDF HTML 收藏
1410.4470 2014-10-20 cs.CV cs.LG 57%

MKL-RT: Multiple Kernel Learning for Ratio-trace Problems via Convex Optimization

Raviteja Vemulapalli, Vinay Praneeth Boda, Rama Chellappa

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1312.5479 2014-02-18 cs.CV cs.DS 57%

Sparse similarity-preserving hashing

Jonathan Masci, Alex M. Bronstein, Michael M. Bronstein, Pablo Sprechmann, Guillermo Sapiro

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1204.1185 2012-04-06 cs.DB cs.IR cs.MM 57%

Query Language for Complex Similarity Queries

Petra Budikova, Michal Batko, Pavel Zezula

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
0905.4627 2009-12-01 cs.MM cs.IR 57%

CoPhIR: a Test Collection for Content-Based Image Retrieval

Paolo Bolettieri, Andrea Esuli, Fabrizio Falchi, Claudio Lucchese, Raffaele Perego, Tommaso Piccioli, Fausto Rabitti

专题命中 跨模态检索 :audio-visual(abstract);分类 cs.MM

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10655 2025-10-14 q-bio.OT 56%

Isotropy and Geometry of Pretrained Protein LMs

Sheikh Azizul Hakim, Kowshic Roy, M Saifur Rahman

专题命中 跨模态检索 :multi-modal(abstract,comments)

Comments Published in the Proceedings of the ICML 2025 Workshop on Multi-modal Foun- dation Models and Large Language Models for Life Sciences, Vancouver, Canada. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
0709.0426 2009-12-01 cs.HC 56%

Do oral messages help visual search?

Noëlle Carbonell, Suzanne Kieffer

专题命中 跨模态检索 :multimodal(abstract,journal_ref)

Comments 26 pages

Journal ref Advances in Natural Multimodal Dialogue Systems, Dordrecht (NL) Springer (Ed.) (2005) pp. 131-157

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25625 2026-08-27 cs.IR 新提交 50%

RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval

RetrievalRouter:面向文档检索的联合模态与架构选择

Emre Kuru, Mehmet Onur Keskin, Reza Farahbakhsh, Noel Crespi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 RetrievalRouter是一种轻量级查询感知路由模型,仅从查询文本为每个文档检索任务匹配合适流程,在金融、科学语料库基准测试中,其准确率较最佳静态基准高2.5%、速度快12.4倍,且优于现有自适应策略选择方法。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23688 2026-08-26 astro-ph.SR astro-ph.IM 新提交 50%

Agentic Active Learning Meets Visual Embeddings: Finding Anomalies among 370 000 Variable Stars from ASAS-SN

智能体主动学习结合视觉嵌入:从ASAS-SN的370000颗变星中发现异常天体

Milan Pesta, Yuan-Sen Ting

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究提出结合多模态大语言模型智能体的主动学习框架,从ASAS-SN的37万余颗变星中高效发现异常天体,仅用约3小时、约40美元成本便得到含24个新异常的星表,验证了该方法的可行性。

Comments 24 pages, 12 figures, 6 tables. Submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12295 2026-08-26 cs.IR 50%

Consistency Regularization for Complementary Clothing Recommendations

Shuiying Liao, P. Y. Mok, Li Li

专题命中 跨模态检索 :multi-modal(abstract)

Journal ref Volume 195, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21411 2026-08-25 cs.RO 新提交 50%

Social Graph Mamba: Forecasting Pedestrian Movements Based on Social Context

社交图Mamba:基于社交上下文的行人运动预测

Hong-Son Nguyen, Yen-Chen Liu

机构 * National Cheng Kung University(成功大学)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本研究提出Social Graph Mamba(SGM),用选择性状态空间模型(SSMs)结合动态交互图与社区感知模块,以线性复杂度实现行人运动预测,在基准测试和物理机器人实验中验证了其有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22073 2026-08-21 cs.IR 版本更新 50%

BRIDGE: Behavior-Guided Residual Integration with Dual-Frequency Graph Evidence

基于行为的候选校准用于多模态推荐

Zesheng Li, Chengchang Pan, Honggang Qi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出了一种基于行为的候选校准方法,通过将训练-only的共用户重叠转换为带符号的候选证据,并仅应用于多模态骨干网络生成的短名单,以提高多模态推荐系统的性能。

Comments 12 pages, 3 figures. Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026). Project page: https://lizesheng13.github.io/bridge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17144 2026-08-19 cs.HC 新提交 50%

Health Inquiry with AI: How Empathetic Expression and Conversational Contexts Shape Users' Communicative Acts

AI辅助健康咨询:共情表达与对话语境如何影响用户的沟通行为

Xi Zheng, Xuyu Yang, Can Liu, Yuhan Luo

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究通过2×2×3被试内实验,发现对话语境对用户沟通行为的影响远大于共情表达模态,为构建语境感知的AI健康咨询系统提供设计依据。

Comments 5 pages, 2 figures. To appear in UbiComp Companion 2026 (October 11-15, 2026, Shanghai, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28895 2026-08-19 cs.IR 版本更新 50%

LLM-Based Generative Retrieval for Snapchat Content Recommendation

基于大语言模型的生成式检索用于Snapchat内容推荐

Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14627 2026-08-18 eess.SP 新提交 50%

AI-Native 6G for Distributed Intelligence: Traffic Characteristics, Awareness, and AI Grid

面向分布式智能的AI原生6G:流量特性、感知与AI网格

Lopamudra Kundu, Xingqin Lin, Shuvo Chowdhury, Sree Sankar

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对AI原生6G的流量特性等问题,提出AI Grid分布式AI基础设施平台,结合AI感知连接使6G成为分布式智能平台。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16407 2026-08-18 cs.IR cs.LG 新提交 50%

POI Recommendation with LLM-Augmented Multi-Graph Learning and Contrastive Alignment

结合大语言模型增强多图学习与对比对齐的兴趣点推荐

Burak Tamer, Wolfram Höpken, Zehui Wang

机构 * Institute for Digital Transformation - University of Applied Sciences Ravensburg-Weingarten(拉芬斯堡-魏恩加腾应用科学大学数字转型研究所)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对POI推荐的物品冷启动问题,提出LLM-MGCL模型,结合语义、地理与交互多图及对比学习,在Yelp数据集上显著优于基线模型,缓解了冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15741 2026-08-18 cs.RO 新提交 50%

Some Modifications to Our End-to-End UAV Planner

对我们的端到端无人机规划器的若干改进

Junjie Lu, Bailing Tian

机构 * TJU-Aerial-Robotics(TJU空中机器人实验室)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究针对端到端无人机规划器YOPO的缺陷,通过采用MINCO参数化、扩展多模态预测、添加动态约束及替换损失函数等改进,提升了轨迹质量与避障安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15624 2026-08-18 cs.IR 新提交 50%

Can Retrievers Find the Same Paper from Different Aspects? A Multi-Aspect Full-Paper Scientific Retrieval Benchmark

检索器能否从不同方面找到同一篇论文?一个多方面全论文科学检索基准

Yiyang Wei, Fang Guo, Qiji Zhou, Zhizhang Fu, Mengru Ding, Kai Yang, Yue Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究推出多方面全论文科学检索基准MAPLE及查询生成流程MAPLE-Synth,发现现有检索器在从单一方面与多方面检索论文间存在显著差距,为相关检索器研发提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11973 2026-08-14 cs.IR 版本更新 50%

Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

Sci-Surf:通过人类反馈与智能摘要实现科学文献发现

Fang Guo, Qi Zhu, Rongcan Pei, Shuqi He, Hui Chen, Yue Zhang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 针对现有学术发现平台支持不足的问题,提出以意图为中心的Sci-Surf系统,结合反馈驱动推荐与多模态论文消化,经评估推荐质量和消化质量有可测量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08880 2026-08-11 cs.SE 新提交 50%

Fusing UI Structure & Semantics for Feature-Oriented App Screen Retrieval & Clustering

融合UI结构与语义的面向特征的应用屏幕检索与聚类

Arun Krishna Vajjala, Yanfu Yan, Ajay Krishna Vajjala, Shrunal Pothagoni, Denys Poshyvanyk, Kevin Moran

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究针对UI编程中代码与图形表示的抽象鸿沟,提出多模态神经符号嵌入技术FRAME,在三项基准测试中提升了屏幕检索与聚类的性能,可增强自动化UI设计与测试工具。

Comments 12 pages, 8 figures, 6 tables. Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04489 2026-08-06 quant-ph physics.app-ph physics.chem-ph 新提交 50%

Engineering Nanodiamonds for Quantum Sensing: Material Constraints at the Nanoscale

用于量子传感的纳米金刚石工程:纳米尺度下的材料约束

Ashutosh Rathi, Keisuke Oshimi, Kento Sasaki, Kensuke Kobayashi, Yutaka Shikano, Oliver Benson, Tim Schröder, Shery L. Y. Chang, Masazumi Fujiwara

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究聚焦纳米金刚石中氮-空位中心的材料约束机制,提出缓解策略,推动其作为移动量子传感器在生物传感与纳米尺度科学中的可靠应用。

Comments Published in ACS Nano under CC-BY 4.0

Journal ref ACS Nano 20, 17143 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01526 2026-08-04 cs.NI 新提交 50%

An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age

面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界

Siddhant Ray, Nick Feamster, Junchen Jiang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00966 2026-08-04 cs.SE 新提交 50%

AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

AgenTag:基于行为指纹的AI编码智能体归因

Taher A. Ghaleb

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。

详情

展开后加载摘要…

URL PDF HTML 收藏