arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 599 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 124 篇

2510.06218 2026-03-03 cs.CV cs.AI 70%

EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark

EgoNight: 向夜间视角理解迈进的挑战性基准

Deheng Zhang, Yuqian Fu, Runyi Yang, Yang Miao, Tianwen Qian, Xu Zheng, Guolei Sun, Ajad Chhatkuli, Xuanjing Huang, Yu-Gang Jiang, Luc Van Gool, Danda Pani Paudel

机构 * East China Normal University(东华大学) HKUST(GZ)(香港科技大学(广州)) Nankai University(南开大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EgoNight提出首个夜间视角视觉基准,通过日夜间对齐视频和人工验证构建VQA任务,揭示低光照条件下模型性能下降问题,并引入辅助任务推动模型泛化能力提升。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00958 2026-03-03 cs.CL 70%

S-VoCAL: A Dataset and Evaluation Framework for Inferring Speaking Voice Character Attributes in Literature

S-VoCAL:用于推断文学作品中说话声音特征属性的数据集和评估框架

Abigail Berthe-Pardo, Gaspard Michel, Elena V. Epure, Christophe Cerisara

机构 * LORIA Deezer Research Idiap Research Institute

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 S-VoCAL通过引入首个专门评估声音相关虚构角色属性推断的数据集和框架,展示了RAG流程在推断年龄和性别等属性上的有效性,但在出身和身体健康等属性上存在挑战。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00938 2026-03-03 cs.CV cs.AI 70%

Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos

超越8位:HDR-UGC视频的主观和客观质量评估

Shreshth Saini, Bowen Chen, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * Laboratory for Image and Video Engineering (LIVE), UT Austin(图像与视频工程实验室(LIVE),得克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出HDR-Q,首个针对HDR-UGC视频的多模态大语言模型,通过HDR感知编码器和HAPO框架实现超越8位的高质量视频评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00590 2026-03-03 cs.AI 70%

Fair in Mind, Fair in Action? A Synchronous Benchmark for Understanding and Generation in UMLLMs

公平在心,公平在行?一个用于理解与生成的同步基准:UMLLMs的公平性评估

Yiran Zhao, Lu Zhou, Xiaogang Xu, Zhe Liu, Jiafei Wu, Liming Fang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) School of Software Technology, Zhejiang University(浙江大学软件学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 IRIS基准通过同步评估UMLLMs的理解与生成任务公平性,揭示系统性偏见现象并提供公平性优化指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00490 2026-03-03 cs.AI 70%

LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

LifeEval: 一种面向日常生活中自体视角的多模态基准,用于辅助AI

Hengjian Gao, Kaiwei Zhang, Shibo Wang, Mingjie Chen, Qihang Cao, Xianfeng Wang, Yucheng Zhu, Xiongkuo Min, Wei Sun, Dandan Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai University of Electric Power(上海电力大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LifeEval 是一个面向日常生活中自体视角的多模态基准,用于评估实时任务导向的人机协作,揭示了在动态环境中实现有效交互的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15905 2026-03-03 cs.HC cs.AI cs.CY 70%

Digital Companionship: Overlapping Uses of AI Companions and AI Assistants

数字陪伴:AI陪伴与AI助手的重叠使用

Aikaterina Manoli, Janet V. T. Pauketat, Ali Ladak, Hayoun Noh, Angel Hsing-Chi Hwang, Jacy Reese Anthis

机构 * Max Planck Institute for Human Cognitive and Brain Sciences(人类认知与脑科学研究所) Sentience Institute(意识研究所) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了AI陪伴与助手在社交和任务中的重叠使用,揭示了用户对人机关系的复杂态度及设计上的挑战。

Comments Final version with incorporated reviewer comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04080 2026-03-03 cs.CL 70%

PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity

PoLi-RL: 一种用于条件语义文本相似度的点到列表强化学习框架

Zixin Song, Bowen Zhang, Qian-Wen Zhang, Di Yin, Xing Sun, Chunping Li

机构 * Tsinghua University(清华大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PoLi-RL通过点到列表强化学习框架,解决条件语义文本相似度中的优化难题,实现Spearman相关系数达48.18,为复杂条件判断任务提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00041 2026-03-03 cs.CV cs.AI 70%

Culture In a Frame: C$^3$B as a Comic-Based Benchmark for Multimodal Culturally Awareness

文化在框架中:C$^3$B作为基于漫画的多模态文化意识基准

Yuchen Song, Andong Chen, Wenxin Zhu, Kehai Chen, Xuefeng Bai, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 C$^3$B是一个基于漫画的多模态文化意识基准,旨在评估和提升多语言、多任务和多文化环境下MLLMs的文化理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13671 2026-03-03 cs.CV cs.LG 70%

FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization

FiLo:通过细粒度描述和高质量定位实现零样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Hao Li, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所基础模型研究中心) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Objecteye Inc., Beijing, China(Objecteye公司) Central South University, Hunan, China(中南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FiLo通过细粒度描述和高质量定位实现零样本异常检测,提升检测和定位性能。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00172 2026-03-03 cs.CR cs.AI 70%

Hidden in the Metadata: Stealth Poisoning Attacks on Multimodal Retrieval-Augmented Generation

元数据中的隐藏攻击:多模态检索增强生成中的隐秘污染攻击

Kennedy Edemacu, Mohammad Mahdi Shokri

机构 * The City University of New York, CSI, Staten Island, NY 10314, USA(纽约城市大学,CSI,史泰登岛分校) The City University of New York, Graduate Center, New York, NY 10016, USA(纽约城市大学研究生中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出MM-MEPA,一种通过操纵多模态检索条目元数据来影响模型响应的隐秘污染攻击,展示了其在多模态RAG系统中的高攻击成功率和防御不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00115 2026-03-03 physics.soc-ph cs.AI cs.CV 70%

Multimodal Modular Chain of Thoughts in Energy Performance Certificate Assessment

多模态模块化思维链在能源性能证书评估中的应用

Zhen Peng, Peter J. Bentley

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模态模块化思维链的低成本EPC预评估方法,通过结构化提示实现对EPC评分的序数结构捕捉,实验表明其在数据稀缺环境下具有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01564 2026-03-03 cs.CR 67%

From Secure Agentic AI to Secure Agentic Web: Challenges, Threats, and Future Directions

从安全代理AI到安全代理网络:挑战、威胁与未来方向

Zhihang Deng, Jiaping Gui, Weinan Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文探讨了从安全代理AI到安全代理网络的过渡,分析了代理系统在开放网络环境中的安全挑战与威胁,并提出了应对策略和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01417 2026-03-03 cs.IR 67%

ReFeed: Retrieval Feedback-Guided Dataset Construction for Style-Aware Query Rewriting

ReFeed: 基于检索反馈的领域感知查询重写数据集构建

Jiyoon Myung, Jungki Son, Kyungro Lee, Jihyeon Park, Joohyung Han

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ReFeed通过检索反馈驱动数据集构建,提升查询重写模型对文档风格的感知能力,改进领域特定场景下的检索效果。

Comments Accepted at the Workshop on New Frontiers in Information Retrieval (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01082 2026-03-03 cs.CV cs.IR 67%

Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval

超越全局相似性:面向细粒度、多条件多模态检索

Xuan Lu, Kangle Li, Haohang Huang, Rui Meng, Wenjun Zeng, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19424 2026-03-03 cs.CV 67%

Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images

Hepato-LLaVA:一种基于稀疏拓扑包注意力机制的专家多模态大语言模型,用于肝细胞病理分析的整张图像

Yuxuan Yang, Zhonghao Yan, Yi Zhang, Bo Yun, Muxi Diao, Guowei Zhao, Kongming Liang, Wenbin Li, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) Department of Pathology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(pathology department, 国家癌症中心/国家癌症临床研究中心/癌症医院, 中国医学科学院和北京协和医学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Hepato-LLaVA通过稀疏拓扑包注意力机制和HepatoPathoVQA数据集,实现肝细胞病理分析的高精度诊断与描述。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01938 2026-03-03 cs.AI cs.CL cs.CY cs.LG 67%

EigenBench: A Comparative Behavioral Measure of Value Alignment

EigenBench: 一种价值对齐的比较行为度量

Jonathn Chang, Leonhard Piff, Suvadip Sana, Jasmine X. Li, Lionel Levine

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EigenBench通过黑盒方法比较语言模型的价值对齐,利用人类判断验证其在无真实标签情况下评估主观价值观的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00649 2026-03-03 cs.SE 67%

Historian: Reducing Manual Validation in APR Benchmarking via Evidence-Based Assessment

Historian: 通过基于证据的评估减少APR基准测试中的手动验证

Sahand Moslemi, Mayasah Lami, Anil Koyuncu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Historian通过基于证据的多参考比较,提高自动化程序修复评估的准确性与覆盖率,减少手动验证需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00595 2026-03-03 cs.CV 67%

UNICBench: UNIfied Counting Benchmark for MLLM

UNICBench: 多模态多层级计数基准与评估工具包

Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao

机构 * Northwestern Polytechnical University(北华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Sun Yat-sen University(中山大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24711 2026-03-03 cs.CV 67%

Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance

MoE中的路由问题:通过显式路由指导扩展扩散Transformer

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Yujin Han, Zhekai Chen, Jiayu Wang, Difan Zou, Xihui Liu, Yingya Zhang, Yu Liu, Hongming Shan

机构 * Fudan University(复旦大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) MMLab Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science, Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, and State Key Laboratory of Brain Function and Disorders, Fudan University(脑启发智能科学技术研究院、MOE前沿脑科学中心、计算神经科学与脑启发智能重点实验室、脑功能与疾病国家重点实验室,复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ProMoE通过显式路由指导提升视觉MoE性能,结合两步路由策略和原型路由机制,在ImageNet基准上优于现有方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22339 2026-03-03 cs.CV 67%

CircuitSense: A Hierarchical MLLM Benchmark Bridging Visual Comprehension and Symbolic Reasoning in Engineering Design Process

CircuitSense: 一种层次化的MLLM基准,连接视觉理解和符号推理在工程设计过程

Arman Akbari, Jian Gao, Yifei Zou, Mei Yang, Jinru Duan, Dmitrii Torbunov, Yanzhi Wang, Yihui Ren, Xuan Zhang

机构 * Northeastern University(东北大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CircuitSense提出一个层次化基准,评估工程设计中视觉理解与符号推理的能力,揭示闭源模型在符号推导上的不足,强调数学理解对电路综合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21950 2026-03-03 cs.CV 67%

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

为MLLMs定制视觉情绪评估:一种开放词汇、多维且可扩展的方法

Daiqing Wu, Dongbao Yang, Sicheng Zhao, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出一种开放词汇、多维且可扩展的方法,用于定制MLLMs的视觉情绪评估,通过情绪陈述判断任务和自动化流程,评估现有模型在情绪识别和上下文判断中的表现,并揭示其局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01912 2026-03-03 cs.CL cs.AI 62%

Demonstrating ViviDoc: Generating Interactive Documents through Human-Agent Collaboration

展示ViviDoc:通过人机协作生成交互式文档

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Wei Chen

机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) HKUST(GZ)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 ViviDoc通过人机协作生成交互式教育文档,采用多代理流水线和文档规范提升生成质量和编辑体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18182 2026-03-03 cs.LG cs.AI 62%

Capabilities Ain't All You Need: Measuring Propensities in AI

能力并非全部所需:测量AI倾向性

Daniel Romero-Alvarado, Fernando Martínez-Plumed, Lorenzo Pacchiardi, Hugo Save, Siddhesh Milind Pawar, Behzad Mehrbakhsh, Pablo Antonio Moreno Casares, Ben Slater, Paolo Bova, Peter Romero, Zachary R. Tidler, Jonathan Prunty, Luning Sun, Jose Hernandez-Orallo

机构 * Valencian Research Institute of Artificial Intelligence, Universitat Politècnica de València, Valencia, Spain University of Copenhagen, Denmark work done while at University of Cambridge Existential Risk Observatory, Amsterdam, Netherlands Leverhulme Centre for the Future of Intelligence, University of Cambridge The Psychometrics Centre, University of Cambridge Department of Computing \& Games, University of Teesside Georgia Institute of Technology University of Cambridge

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个测量AI倾向性的正式框架,通过双逻辑模型评估模型倾向性对任务性能的影响,并展示结合倾向性和能力可提升预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02386 2026-03-03 cs.CR cs.AI cs.LG 62%

On The Fragility of Benchmark Contamination Detection in Reasoning Models

在推理模型中基准污染检测的脆弱性

Han Wang, Haoyu Li, Brian Ko, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学)

专题命中 评测与基准 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 研究发现LRMs在基准污染检测中存在脆弱性,通过简单方法可轻易污染模型以提升排行榜表现,威胁评估公平性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05639 2026-03-03 cs.CL cs.LG 62%

FictionalQA: A Dataset for Studying Memorization and Knowledge Acquisition

FictionalQA: 一个用于研究记忆与知识获取的数据集

John Kirchenbauer, Janny Mongkolsupawan, Yuxin Wen, Tom Goldstein, Daphne Ippolito

机构 * University of Maryland(马里兰大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 FictionalQA数据集旨在研究语言模型在记忆事实和序列时的双重过程,通过合成的虚构事件文档和问题-答案对,探索不同形式的记忆机制及构建挑战。

Comments 10 pages and 8 figures in the main body. Published at ICLR 2026. Dataset is available at https://huggingface.co/datasets/jwkirchenbauer/fictionalqa, and code at https://github.com/jwkirchenbauer/fictionalqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05296 2026-03-03 cs.AI cs.LG 62%

Control Tax: The Price of Keeping AI in Check

控制税:保持AI受控的成本

Mikhail Terekhov, Zhen Ning David Liu, Caglar Gulcehre, Samuel Albanie

机构 * EPFL(瑞士联邦理工学院) MATS

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出控制税概念,通过理论框架量化控制成本,评估语言模型在对抗性环境下的安全性,并开发优化的监控策略以平衡安全与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16612 2026-03-03 cs.CL cs.AI cs.CV 62%

MemeIntel: Explainable Detection of Propagandistic and Hateful Memes

MemeIntel: 可解释性地检测宣传性及仇恨言论的迷因

Mohamed Bayan Kmainasi, Abul Hasnat, Md Arid Hasan, Ali Ezzat Shahroor, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究 institute)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 MemeIntel通过多阶段优化方法和视觉-语言模型,提升了阿拉伯语宣传性迷因和英语仇恨言论的检测与解释生成性能,准确率提升显著。

Comments disinformation, misinformation, factuality, harmfulness, fake news, propaganda, hateful meme, multimodality, text, images

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02176 2026-03-03 cs.CL 57%

Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale

在生态系统层面组织、协调和基准测试代理技能

Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出AgentSkillOS框架,通过树状检索和DAG协调提升大规模技能生态系统的管理和任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23589 2026-03-03 cs.CV cs.AI 57%

Pseudo Contrastive Learning for Diagram Comprehension in Multimodal Models

伪对比学习用于多模态模型中的图表理解

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究机构有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出伪对比学习方法,通过生成合成图表增强多模态模型对图表的理解能力,实验表明在图像-文本匹配和视觉问答任务中优于传统CLIP方法。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16110 2026-03-03 cs.CV cs.AI 57%

OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis

OmniCT:迈向统一的切片-体积LVLM以实现全面的CT分析

Tianwei Lin, Zhongwei Qiu, Wenqiao Zhang, Jiang Liu, Yihan Xie, Mingjian Gao, Zhenxuan Fan, Zhaocheng Li, Sijing Li, Zhongle Xie, Peng LU, Yueting Zhuang, Ling Zhang, Beng Chin Ooi, Yingda Xia

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云学术院) Hupan Lab(虎派实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 OmniCT提出了一种统一的切片-体积LVLM,通过空间一致性增强、器官级语义增强和MedEval-CT数据集,实现了全面的CT分析。

详情

展开后加载摘要…

URL PDF HTML 收藏