arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2505.18823 2026-04-23 cs.CV 50%

MSLAU-Net: A Hybrid CNN-Transformer Network for Medical Image Segmentation

MSLAU-Net:一种用于医学图像分割的混合CNN-Transformer网络

Libin Lan, Yanxin Li, Xiaojuan Liu, Juan Zhou, Jianxun Zhang, Nannan Huang, Yudong Zhang

机构 * College of Computer Science and Engineering(计算机科学与工程学院) College of Artificial Intelligence(人工智能学院) Department of Pharmacy(药学部) Department of Prosthodontics(修复学部) Chongqing Key Laboratory of Oral Diseases(重庆口腔疾病重点实验室) Chongqing Municipal Key Laboratory of Oral Biomedical Engineering of Higher Education(重庆市口腔生物医学工程高等教育重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Southeast University(东南大学)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出MSLAU-Net,结合CNN和Transformer的优势,通过多尺度线性注意力和自上而下特征聚合机制,提升医学图像分割的精度与效率。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20705 2026-04-23 cs.CV 50%

SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

SSL-R1: 多模态大语言模型的自监督视觉强化后训练

Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) VIA Research Center(VIA研究中心) Google(谷歌)

专题命中 推理评测 :reasoning(abstract)

AI总结 SSL-R1通过自监督学习生成可验证奖励,提升多模态大语言模型的推理能力,无需人工或外部监督,有效增强视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19042 2026-04-22 cs.IR 50%

STK-Adapter: Incorporating Evolving Graph and Event Chain for Temporal Knowledge Graph Extrapolation

STK-Adapter:融合演进图与事件链以实现时序知识图谱外推

Shuyuan Zhao, Wei Chen, Weijie Zhang, Xinrui Hou, Junfeng Shen, Boyan Shi, Shengnan Guo, Youfang Lin, Huaiyu Wan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出STK-Adapter,通过融合演进图与事件链,解决时序知识图谱外推中空间-时间信息丢失和特征稀释问题,提升模型推理能力与泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18957 2026-04-22 cs.CV 50%

Bridging Foundation Models and ASTM Metallurgical Standards for Automated Grain Size Estimation from Microscopy Images

弥合基础模型与ASTM冶金标准以实现显微图像中的晶粒尺寸自动估计

Abdul Mueez, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种结合Cellpose-SAM和ASTM E112 Jeffries平面模块的自动化管道,用于显微图像中的密集实例分割和晶粒尺寸估计,通过拓扑感知梯度追踪和适应性提示生成,实现高精度的冶金评估。

Comments Accepted at the 11th IEEE Workshop on Computer Vision for Multimodal Microscopy Image Analysis (CVMI), CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18740 2026-04-22 cs.CV 50%

Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control

自主骨骼标志点定位以实现智能C臂控制

Jay Jung, Ahmad Arrabi, Jax Luo, Scott Raymond, Safwan Wshah

机构 * University of Vermont(佛蒙特大学) Cleveland Clinic(克利夫兰诊所)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了利用多模态大语言模型实现C臂控制中骨骼标志点的自主定位,通过实验验证了其在准确性和推理能力上的优势,为智能C臂控制提供了新方法。

Comments Accepted at IJCARS: IPCAI 2026. Int J CARS (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17072 2026-04-22 cs.MA 50%

CogGen: A Cognitively Inspired Recursive Framework for Deep Research Report Generation

CogGen:一种受认知启发的递归框架用于深度研究报告生成

Kuo Tian, Pengfei Sun, Zhen Wu, Junran Ding, Xinyu Dai

专题命中 推理评测 :planning(abstract)

AI总结 CogGen通过递归架构模拟认知写作,实现灵活规划与全局重构,引入抽象视觉表示和认知负荷评估框架,提升多模态内容生成质量。

Comments 28 pages, 3 figures, Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18134 2026-04-21 cs.CV 50%

Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?

LLM生成文本能否增强外科视觉-语言预训练?

Chengan Che, Chao Wang, Jiayuan Huang, Xinyue Chen, Luis C. Garcia-Peraza-Herrera

机构 * Visual Understanding Research Group, Department of Informatics, King’s College London, UK(视觉理解研究组,信息学院,伦敦国王学院,英国)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SurgLIME框架,利用LLM生成的文本进行多模态预训练,以解决标注成本高的问题,通过LoRA适配和自适应置信度估计机制提升模型鲁棒性。

Comments Accepted at CVPRW 2026 (AI4RWC Oral presentationn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17873 2026-04-21 cs.CV 50%

Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

时空趋炎附势:基于否定的欺骗性在视频大语言模型中的表现

Ziyao Tang, Pengkun Jiao, Bin Zhu, Huiyan Qi, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University Shanghai Key Laboratory of Multimodal Embodied AI(可信具身人工智能研究所,复旦大学上海多模态具身人工智能重点实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究视频大语言模型在面对否定性欺骗时的脆弱性,揭示其在时空推理中的错误修正机制,并提出GasVideo-1000基准测试集以评估模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07143 2026-04-21 cs.CV 50%

Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods

我们是否在使用正确的基准:视觉令牌压缩方法的评估框架

Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) MBZUAI

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过实验证明现有基准含大量无关样本, downsampling能有效过滤样本,提出VTC-Bench框架以更公平评估视觉令牌压缩方法。

Comments Accepted by ACL2026 Main. Code: https://github.com/Chenfei-Liao/VTC-Bench; Project Page: https://chenfei-liao.github.io/VTC-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17318 2026-04-21 cs.CV 50%

When Background Matters: Breaking Medical Vision Language Models by Transferable Attack

背景的重要性:通过可转移攻击打破医疗视觉语言模型

Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen

机构 * Indian Institute of Technology Patna(印度理工学院帕纳分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) MBZUAI(穆桑大学人工智能研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MedFocusLeak攻击方法,通过在非诊断背景区域注入协调扰动并利用注意力分散机制,使模型产生看似合理但错误的诊断,揭示了现代临床VLMs推理能力的弱点。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16884 2026-04-21 cs.CV 50%

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

具有偏见约束的多模态智能用于公平且可靠的临床AI

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院放射科) Department of Urology, South China Hospital, Medical School, Shenzhen University(深圳大学南方医院泌尿科) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出BiasCareVL框架,通过在模型设计中直接引入偏见控制,解决医疗影像与文本整合中公平性和可靠性问题,展示了其在多任务和基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14122 2026-04-21 cs.CV 50%

EgoSound: Benchmarking Sound Understanding in Egocentric Videos

EgoSound:评估egocentric视频中声音理解的基准测试

Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) KAUST(卡塔尔大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05405 2026-04-21 cs.CV 50%

A VLM-based Method for Visual Anomaly Detection in Robotic Scientific Laboratories

基于VLM的方法用于机器人科学实验室中的视觉异常检测

Shiwei Lin, Chenxu Wang, Xiaozhen Ding, Yi Wang, Boyuan Du, Lei Song, Chenggang Wang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Physics and Electronic Information, Yantai University(烟台大学物理与电子信息学院) School of Computer and Big Data, Fuzhou University(福州大学计算机与大数据学院) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于VLM的视觉推理方法,通过四个逐步信息提示配置实现多级监督,构建了专用视觉基准以评估其在科学流程异常检测中的有效性,实验表明提供更多上下文信息可提升检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16198 2026-04-20 cs.SE 50%

Bridging the Gap between User Intent and LLM: A Requirement Alignment Approach for Code Generation

弥合用户意图与大语言模型之间的鸿沟:一种用于代码生成的需求对齐方法

Jia Li, Ruiqi Bai, Yangkang Luo, Yiran Zhang, Wentao Yang, Zeyu Sun, Tiankuo Zhao, Dongming Jin, Lei Li, Zhi Jin

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出REA-Coder方法,通过需求对齐提升大语言模型的代码生成性能,实验表明其在多个编程基准测试中表现优异,平均提升率达7.93%至30.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16099 2026-04-20 cs.CV 50%

DenTab: A Dataset for Table Recognition and Visual QA on Real-World Dental Estimates

DenTab:一个用于真实世界牙科估算表识别和视觉问答的数据集

Laziz Hamdi, Amine Tamasna, Thierry Paquet

机构 * LITIS, Normandy, France(诺曼底大学LITIS实验室) Malakoff Humanis, Paris, France(巴黎Malakoff Humanis机构)

专题命中 推理评测 :reasoning(abstract)

AI总结 DenTab数据集包含2000张牙科估算表图像,用于评估表识别和视觉问答性能,包含2208个问题,涵盖检索、聚合和逻辑一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15849 2026-04-20 cs.SD 50%

TinyMU: A Compact Audio-Language Model for Music Understanding

TinyMU:一种用于音乐理解的紧凑音频-语言模型

Xiquan Li, Aurian Quelennec, Slim Essid

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI, Télécom Paris, Institut Polytechnique de Paris) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TinyMU,一种轻量级音乐语言模型,通过MusicSkills-3.5M数据集训练,实现与大规模LALMs相当的性能,同时保持高效紧凑,适用于边缘设备。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15676 2026-04-20 cs.DB 50%

EvoRAG: Making Knowledge Graph-based RAG Automatically Evolve through Feedback-driven Backpropagation

EvoRAG: 通过反馈驱动的反向传播使基于知识图谱的RAG自动进化

Zhenbo Fu, Yuanzhe Zhang, Qiange Wang, Hao Yuan, Yuehao Xu, Enze Yi, Yanfeng Zhang, Ge Yu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EvoRAG,通过反馈驱动反向传播机制自动优化知识图谱,提升推理准确性,实验显示比现有方法提升7.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14388 2026-04-20 cs.CV 50%

FoodSense: A Multisensory Food Dataset and Benchmark for Predicting Taste, Smell, Texture, and Sound from Images

FoodSense:一个多感官食物数据集和基准,用于从图像预测味觉、嗅觉、触觉和声音

Sabab Ishraq, Aarushi Aarushi, Juncai Jiang, Chen Chen

机构 * College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院) College of Business Administration, University of Central Florida(中央佛罗里达大学商学院) Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出FoodSense数据集,包含66,842个参与者的图像对,用于预测多感官体验,通过图像接地推理轨迹训练模型,展示传统评估指标在视觉感官推断中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14872 2026-04-17 cs.HC 50%

SkillDroid: Compile Once, Reuse Forever

SkillDroid: 一次编译,永久复用

Qijia Chen, Andrea Bellucci, Zhida Sun, Giulio Jacucci

专题命中 推理评测 :reasoning(abstract)

AI总结 SkillDroid通过编译成功的人工智能引导GUI轨迹为参数化技能模板,实现无需LLM调用的复用,显著提升任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14408 2026-04-17 cs.SE 50%

ToxiShield: Promoting Inclusive Developer Communication through Real-Time Toxicity Filtering

ToxiShield:通过实时毒性过滤促进包容性开发者沟通

MD Awsaf Alam Anindya, Showvik Biswas, Anindya Iqbal, Jaydeb Sarker, Amiangshu Bosu

专题命中 推理评测 :reasoning(abstract)

AI总结 ToxiShield通过实时毒性过滤工具提升软件工程团队的沟通效率,采用深度学习和大语言模型实现毒性检测、沟通指导和文本重构,验证了其在促进包容性和健康协作中的有效性。

Journal ref FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20122 2026-04-17 cs.CV 50%

MEBench: A Novel Benchmark for Understanding Mutual Exclusivity Bias in Vision-Language Models

MEBench:一种新的评估视觉-语言模型互斥偏差的基准

Anh Thai, Stefan Stojanov, Zixuan Huang, Bikram Boote, James M. Rehg

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 MEBench通过引入空间推理提升评估难度,评估视觉-语言模型对互斥偏差的处理能力,发现模型存在弱互斥偏差但能利用额外空间上下文解决歧义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13298 2026-04-16 cs.CR 50%

Can Agents Secure Hardware? Evaluating Agentic LLM-Driven Obfuscation for IP Protection

代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Veeramani Pugazhenthi, Harish Kumar Dharavath, Farshad Firouzi, Rozhin Yasaei, Pratik Satam, Soheil Salehi

专题命中 推理评测 :planning(abstract)

AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。

Comments 5 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13292 2026-04-16 cs.CV 50%

See&Say: Vision Language Guided Safe Zone Detection for Autonomous Package Delivery Drones

See&Say:基于视觉语言的自主配送无人机安全区域检测

Mahyar Ghazanfari, Peng Wei

机构 * George Washington University(乔治·华盛顿大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出See&Say框架,结合几何安全提示与语义感知,利用视觉语言模型实现迭代优化,提升无人机配送中安全区域检测的可靠性与动态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11244 2026-04-16 cs.CV 50%

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding

Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述

Tencent Hunyuan Team

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15170 2026-04-16 cs.CV 50%

Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval

多维知识谱系:基于大规模文献数据库与分层检索

Zhucun Xue, Jiangning Zhang, Juntao Jiang, Jinzhuo Liu, Haoyang He, Teng Hu, Xiaobin Hu, Yong Liu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) APRIL Lab(APRIL实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12833 2026-04-15 cs.CV 50%

Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks

用可部署的多模态语义照明攻击挑战视觉-语言模型

Yingying Zhao, Chengyin Hu, Qike Zhang, Xin Li, Xin Wang, Yiwei Wei, Jiujiang Guo, Jiahuan Long, Tingsong Jiang, Wen Yao

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MSLA攻击框架,通过可控对抗性照明攻击视觉-语言模型的多模态语义理解,揭示其在现实世界中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12329 2026-04-15 cs.CR cs.SI 50%

UniDetect: LLM-Driven Universal Fraud Detection across Heterogeneous Blockchains

UniDetect: 基于大语言模型的跨异构区块链通用欺诈检测

Shuyi Miao, Wangjie Qiu, Shengda Zhuo, Fei Shen, Dan Lin, Xingtong Yu, Chua Tat-Seng, Zhiming Zheng

专题命中 推理评测 :reasoning(abstract)

AI总结 UniDetect利用大语言模型生成跨异构区块链账户的交易摘要文本,结合两阶段交替训练策略,提升欺诈检测性能,在多个区块链上实现5.57%-7.58%的KS提升,跨链零样本检测准确率超94.58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12228 2026-04-15 cs.CR 50%

From IOCs to Regex: Automating CTI Operationalization for SOC with LLMs

从IOCs到正则表达式:利用LLMs自动化SOC中的CTI操作化

Pei-Yu Tseng, Lan Zhang, ZihDwo Yeh, Xiaoyan Sun, Xushu Dai, Peng Liu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出IOCRegex-gen系统,利用LLMs自动生成正则表达式,解决CTI操作化中的手动转换问题,通过分组机制和多阶段验证流程提升准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10073 2026-04-15 cs.CR cs.CV 50%

SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents

SecureWebArena: 一个针对基于大视觉-语言模型的Web代理的综合安全评估基准

Zonghao Ying, Yangguang Shao, Jianle Gan, Gan Xu, Wenxin Zhang, Quanchen Zou, Junzheng Shi, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学安全实验室) Institute of Information Engineering, CAS(中国科学院信息工程研究所) China University of Petroleum (East China)(中国石油大学(华东)) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Science(中国科学院大学) AI Security Lab(360人工智能安全实验室) The University of Sydney(悉尼大学) Henan University of Science and Technology(河南理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SecureWebArena,首个针对基于大视觉-语言模型的Web代理安全性的综合评估基准,通过六个真实模拟的Web环境和2970条高质量轨迹,分析代理在内部推理、行为轨迹和任务结果三个维度上的安全风险。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09249 2026-04-14 cs.CV cs.IR 50%

FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding

FashionStylist: 一个增强专家知识的多模态数据集用于时尚理解

Kaidong Feng, Zhuoxuan Huang, Huizhong Guo, Yuting Jin, Xinyu Chen, Yue Liang, Yifei Gai, Li Zhou, Yunshan Ma, Zhu Sun

机构 * Yanshan University(燕山大学) Central South University(中南大学) Zhejiang University(浙江大学) Southwest University(西南大学) Singapore Management University(新加坡管理大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出FashionStylist,一个专家标注的多任务时尚理解基准,支持服装到物品定位、服装补全和评估任务,提升多模态时尚系统的语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏