TRAK: Attributing Model Behavior at Scale
专题命中 其他VLM :vision-language model(abstract);分类 cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision-language model(abstract);分类 cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments EMNLP 2022
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments 22 pages, 14 figures, 2 tables, fixed figure 3
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Preprint
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:2201.11307
Journal ref WACV2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments cvpr2022
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Under Submission
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments SIGGRAPH 2022; Project Page https://hongfz16.github.io/projects/AvatarCLIP.html Codes available at https://github.com/hongfz16/AvatarCLIP
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments ECCV 2020 accepted spotlight paper
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
MER 2026:从判别性情感识别到生成性情感理解
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 MER2026延续系列挑战趋势,包含四个赛道,聚焦双人交互、细粒度识别、偏好预测和生理信号情感识别。
JW-SSD:用于细粒度太阳黑子分类的多模态基准数据集
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 该研究提出用于太阳黑子细粒度磁型分类的多模态基准数据集JW-SSD,经质量控制后含36553对图像,可用于训练多种模型,包括取得高准确率的JW-SunSpot。
Comments 15 pages, 3 figures
为房间脉冲响应生成适应文本到音频模型
专题命中 其他VLM :vision-language model(abstract)
AI总结 本文提出利用预训练文本到音频模型生成房间脉冲响应,通过视觉语言模型提取声学描述解决数据稀缺问题,验证大规模生成音频先验在该任务中的有效性。
Comments Accepted to IWAENC 2026
VizRAG:通过超图可视化增强检索增强生成
机构 * Southern University of Science and Technology(南方科技大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Huawei Research(华为研究院) ; Beihang University(北京航空航天大学)
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 研究旨在增强检索增强生成,核心方法是通过视觉线索将超图感知整合到RAG系统中,引入VizRAG支持视觉超图结构感知,实验证明该方法显著优于基线,验证了超图可视化用于RAG系统的潜力。
B-repLer:CAD模型的语言引导编辑
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 研究语言引导的CAD编辑问题,提出B-repLer框架直接连接自然语言与CAD模型编辑,绕过构建历史,还引入数据集,展示其自动生成等方法,能对复杂CAD形状准确执行复杂编辑。
Comments Accepted by SIGGRAPH 2026; Project page at https://yilinliu77.github.io/brepler.github.io Code at https://github.com/yilinliu77/Brepler
你如何通过提问来获取信息:审核TikTok搜索中的乳腺癌错误信息
专题命中 其他VLM :vision-language model(abstract)
AI总结 研究TikTok搜索中用户查询框架对乳腺癌错误信息曝光的影响,通过受控实验发现查询框架与错误信息曝光紧密相关,替代医学查询错误信息返回率高,医学信息查询也有错误信息,强调审核查询驱动搜索系统的重要性。
突破15%的障碍:一个由用户非语言线索触发的、用于主动社交机器人的真实世界数据驱动系统
机构 * Kyushu Institute of Technology(九州工业大学) ; CyberAgent(CyberAgent公司) ; The University of Osaka(大阪大学)
专题命中 其他VLM :vision-language model(abstract)
AI总结 研究零售商店中服务机器人交互,发现非语言行为触发机器人话语占比15.3%。通过分析客户行为定义非语言线索,开发识别器和对话框架,能基于非语言线索实现主动机器人响应,还进行了离线评估和展示在线原型。
Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)
用于双足四足运动操纵的小腿集成手臂
机构 * University College London(伦敦大学学院)
专题命中 其他VLM :vision-language model(abstract)
AI总结 研究双足四足运动操纵设计权衡问题,核心方法是将特定操纵器集成到前小腿,实现双手地面操纵且四足着地、基座可行走,借助视觉语言模型排序技能,模拟中完成三项双手任务。
Comments 6 pages, 6 figures
我关心的音乐:对(几乎)任何音乐的大语言模型音乐感知技能进行自动化多模态基准测试
机构 * Charles University(查尔斯大学) ; Brno University of Technology(布拉格技术大学)
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 针对当前音乐基准测试的局限,引入MusICA-MetaBench框架,利用结构化符号表示和预定义模板生成按需基准测试,通过ChoraleBricks数据集展示并确定规模,经与基线比较证明能测音乐感知,推动了大语言模型音乐感知跨模态评估。
Comments 9 pages, 4 figures, 4 tables
网络物理系统软件工程的基础模型:未来之路
专题命中 其他VLM :vision-language model(abstract)
AI总结 探讨基础模型在网络物理系统软件工程中的应用,指出除语言模型外其他模型潜力大。通过文献等得出前瞻性研究路线图,突出挑战与机会,还讨论了应用模型的常见挑战,为研究和实践提供指导。
Comments 3 figures, 20 tables, 53 pages
SocialPersona: 基于多模态社交媒体上下文的个性化画像与回复基准测试
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 提出SocialPersona基准,评估多模态大语言模型从社交媒体时间线推断用户偏好并用于对话的能力,实验表明模型在细粒度与近期偏好上表现不足。
使用机器辅助理论集成标注建模品牌和组织TikTok视频的参与度
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 利用多模态大语言模型标注77个理论驱动的结构变量,分析约1万个TikTok视频,以预测参与度并探索短视频文化差异。
多通道光学视觉模型
专题命中 其他VLM :vision-language model(abstract)
AI总结 本文利用光学神经网络中的空间复用,将通道作为可训练表示坐标,通过在线物理前向/代理反向训练,在图像分类和回归任务中实现多通道功能,并构建了混合光电视觉语言模型。
Comments 24 pages, 4 figures
LangRetrieval: 基于CSI驱动奖励的语言引导自进化卫星到雷达检索
专题命中 其他VLM :vision-language model(abstract)
AI总结 提出LangRetrieval框架,通过语言引导的条件流匹配和自进化语义优化,利用多阈值CSI奖励提升卫星到雷达降水检索精度。
Comments 17 pages, 9 figures. Submitted to IEEE Transactions on Image Processing
图像数据语义过滤器的选择性估计
专题命中 其他VLM :vision-language model(abstract)
AI总结 针对图像数据上的语义过滤器,提出基于共享嵌入空间的语义直方图方法,通过估计查询特异性来绕过传统在线采样,实现高效选择性估计,将查询优化与执行的端到端运行时开销降低高达86%。
解决分布式多模态训练中的变量异构性问题:Entrain
专题命中 其他VLM :MLLM(abstract)
AI总结 提出Entrain框架,通过宏观批次的静态模型并行配置和层次化微批次分配算法,解决多模态大语言模型训练中的数据异构性和变量波动,提升吞吐量达1.40倍。
模仿学习的仪器化:增强衣架插入训练数据集
机构 * AI and Robotics Lab (IDLab-AIRO)(人工智能与机器人实验室(IDLab-AIRO)) ; Ghent University—imec(根特大学—imec)
专题命中 其他VLM :vision language model(abstract)
AI总结 本文通过仪器化(在物体中集成传感器)提供状态信息,训练扩散策略进行衣架插入任务,实验表明仪器化策略比纯视觉策略成功率提高14-25%,且黑箱模仿学习能自动优先使用仪器信号。
Comments Accepted for presentation at ICRA2026
生成基础模型的可信度:指南、评估与视角
专题命中 其他VLM :vision-language model(abstract)
AI总结 本文提出生成基础模型的可信度框架,通过多学科协作制定指导原则,引入动态评估平台TrustGen,揭示可信度进展与挑战,并探讨未来研究方向。
通过Maestro加速复合大语言模型训练工作负载
专题命中 其他VLM :MLLM(abstract)
AI总结 本文提出Maestro框架,针对复合LLM训练中的静态异构性和动态不规则性,通过分段图重构和波前调度算法提升硬件利用率,减少40%的GPU消耗。