DatBench: Discriminative, Faithful, and Efficient VLM Evaluations
DatBench:具有辨别性、忠实性和效率的视觉语言模型评估
专题命中 效率与部署 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG
AI总结 DatBench通过转换和过滤现有基准,提升视觉语言模型评估的忠实性和效率,实现13倍加速并保持辨别性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
DatBench:具有辨别性、忠实性和效率的视觉语言模型评估
专题命中 效率与部署 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG
AI总结 DatBench通过转换和过滤现有基准,提升视觉语言模型评估的忠实性和效率,实现13倍加速并保持辨别性。
马蹄混合专家(HS-MoE)模型
机构 * Booth School of Business University of Chicago(芝加哥大学商学院) ; Volgenau School of Engineering, George Mason University(乔治·马歇尔大学工程学院) ; Department of Systems Engineering and Operations Research George Mason University(乔治·马歇尔大学系统工程与运营管理系)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 HS-MoE模型通过结合马蹄先验和输入依赖门控,实现数据自适应的稀疏专家选择,并提出粒子学习算法用于顺序推断。
大型语言模型编码框架语义了吗?来自框架识别的证据
机构 * University of Cincinnati(辛辛那提大学) ; University of Oklahoma(俄克拉荷马大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究通过框架识别任务验证大型语言模型对框架语义的编码能力,发现模型在无监督情况下能有效识别框架并生成语义连贯的定义。
看清更多,存储更少:视频时刻检索的内存高效解决方案
机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学) ; Electronics and Telecommunications Research Institute (ETRI)(电子与电信研究院)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 SMORE通过查询引导的描述和自适应压缩技术,在视频时刻检索中实现高信息分辨率与内存效率的平衡。
利用低维误差反馈训练大型神经网络
专题命中 效率与部署 :prompting(abstract);分类 cs.LG
AI总结 本文提出了一种基于反馈对齐的新型局部学习规则,利用低维误差信号高效训练大型神经网络,证明低维误差信号可媲美传统反向传播。
SkinFlow: 通过动态视觉编码和分阶段强化学习实现开放性皮肤病诊断的高效信息传输
机构 * Baichuan Inc.(百川公司) ; Department of Dermatology Peking University First Hospital(北京大学第一医院皮肤科) ; Beijing Key Laboratory of Molecular Diagnosis on Dermatoses(北京分子皮肤病诊断重点实验室) ; National Clinical Research Center for Skin and Sexually Transmitted Diseases(国家皮肤及性传播疾病临床医学研究中心) ; NMPA Key Laboratory for Quality Control and Evaluation of Cosmetics(国家药监局化妆品质量控制与评价重点实验室) ; School of Biomedical Engineering Tsinghua University(清华大学生物医学工程学院) ; University of Hong Kong(香港大学)
专题命中 效率与部署 :language model(abstract);分类 cs.AI
AI总结 SkinFlow通过动态视觉编码和分阶段强化学习提升皮肤病诊断效率,实现比通用模型更优的准确率
SRT:通过树结构缓存的推测式回滚加速强化学习
机构 * Cornell University(康奈尔大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; ByteDance(字节跳动)
专题命中 效率与部署 :language model(abstract);分类 cs.LG
AI总结 SRT通过树结构缓存的推测式回滚方法,有效加速语言模型的在线强化学习,提升生成效率并降低推理成本。
轻量客户端,全精度:混合零阶和一阶分裂联邦学习
机构 * Charles L. Brown Department of Electrical and Computer Engineering, University of Virginia(弗吉尼亚大学电气与计算机工程系查尔斯·L·布朗部门)
专题命中 效率与部署 :language model(abstract);分类 cs.LG
AI总结 HERON-SFL通过结合零阶和一阶优化,实现高效客户端计算和减少通信开销,提升边缘设备模型训练效率。
可推广的几何先验与递归脉冲特征学习用于双足机器人操作
机构 * School of Computer Science, School of Robotics, Institute of Technological Sciences, Wuhan University(计算机学院、机器人学院、技术科学研究院、武汉大学)
专题命中 效率与部署 :language model(abstract);分类 cs.AI
AI总结 本文提出RGMP-S方法,通过几何先验和递归脉冲网络提升双足机器人操作的泛化能力与数据效率。
通过流形约束优化压缩地理空间迁移学习中的视觉变换器
机构 * Yale University(耶鲁大学) ; Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI
AI总结 本文提出通过流形约束优化框架DLRT压缩地理空间迁移学习中的视觉变换器,实现参数减少的同时保持任务精度。
当单智能体与技能取代多智能体系统以及何时会失败
机构 * Trusted and Efficient AI (TEA) Lab(可信高效人工智能实验室) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; CIFAR AI Chair(CIFAR人工智能 chair)
专题命中 效率与部署 :LLM(abstract);分类 cs.AI
AI总结 研究探讨单智能体通过技能库替代多智能体系统在复杂推理中的有效性及局限性,提出基于认知科学的技能选择有限容量理论,并通过层次路由验证其可行性。
Comments 25 pages, technical report
人机协同的多物种珊瑚图像分割
机构 * QUT Centre for Robotics(QUT机器人中心) ; Image Analytics(图像分析) ; CSIRO Data61(CSIRO数据61)
专题命中 效率与部署 :foundation model(abstract);分类 cs.LG
AI总结 本文提出利用DINOv2特征和KNN实现高效珊瑚图像分割,仅用5个点标签即可在mIoU上提升13.5%。
Comments IEEE Journal of Oceanic Engineering accepted preprint of extended paper, 36 pages, 14 figures. Original conference paper (v2) accepted at the CVPR 2024 3rd Workshop on Learning with Limited Labelled Data for Image and Video Understanding (L3D-IVU)
CrowdLLM: 构建基于大语言模型的数字人群并整合生成模型
机构 * Department of Industrial and Systems Engineering, University of Washington(华盛顿大学工业与系统工程系) ; Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)
专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 CrowdLLM通过整合预训练大语言模型和生成模型,提升数字人群的多样性和保真度,适用于社交模拟、众包等多领域应用。
多LLM系统的自适应信任度量:在受监管行业中的可靠性增强
机构 * Independent Researcher(独立研究者)
专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出了一种用于多LLM系统的自适应信任度量框架,通过分析系统行为和不确定性评估,提升受监管行业中的AI可靠性与安全性。
Comments 8 pages, 8 figures
医疗图像分析中的公平基础模型:挑战与展望
机构 * Federal University of São Paulo(巴西圣保罗联邦大学) ; Federal Institute of Goiás(哥亚斯联邦理工学院) ; Idiap Research Institute(Idiap研究机构)
专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了医疗图像分析中公平基础模型的挑战与前景,强调通过系统性干预和政策参与实现公平性,以推动医疗技术的普及。
通过模块化参数定位实现能力迁移与恢复
机构 * University of California San Diego(加州大学圣地亚哥分校)
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ACT通过激活差异局部化能力相关通道,实现能力迁移与恢复,提升多语言数学和科学推理性能。
PrivLEX:通过视觉-语言模型检测图像中的法律概念
机构 * EPFL(苏黎世联邦理工学院) ; Idiap Research Institute(Idiap研究机构)
专题命中 领域大模型 :language model(title,abstract)
AI总结 PrivLEX通过视觉-语言模型实现图像中法律概念的检测,无需显式标签即可进行可解释的隐私分类。
关于LLM生成测试在工业和开源数据库管理系统中的不稳定性
专题命中 领域大模型 :LLM(title,abstract)
AI总结 研究发现LLM生成的测试在工业和开源数据库管理系统中存在不稳定性问题,主要源于对不确定顺序的依赖,并强调了为LLM提供定制上下文的重要性。
Comments 12 pages, 5 tables, 3 figures, accepted at the 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE SEIP 2026)
在百亿级数据规模下扩展遥感基础模型:在百亿级数据规模下的领域权衡
机构 * The MITRE Corporation(MITRE公司)
专题命中 领域大模型 :foundation model(title,abstract)
AI总结 研究探讨了在百亿级数据规模下扩展遥感基础模型的挑战与权衡,通过训练更大规模的视觉Transformer主干,揭示了数据受限与模型参数受限之间的关系,并提出了优化数据收集和计算资源的策略。
SpectraQuery: 一种用于电池科学的混合检索增强型对话助手
机构 * Mechanical Engineering, Stanford University(斯坦福大学机械工程系) ; Applied Energy Division, SLAC National Accelerator Laboratory(SLAC国家加速器实验室应用能源部门) ; Institute of Computational and Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所)
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 SpectraQuery通过结合结构化数据库和文献语料库,为电池科学提供检索增强型对话助手,有效整合数值证据与机理解释,提升科学推理效率。
Comments 11 pages, 8 figures, appendix included
ReGraM:面向医疗问答的区域优先知识图谱推理
机构 * Department of Software, Soongsil University(软件系,顺斯大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 ReGraM通过区域优先的知识图谱推理框架,提升医疗问答的准确性和一致性。
Comments 18 pages, 2 figures. Preprint
基于多种外部表征的个性化反馈:策略配置与高中物理学习中的学习
机构 * Chair of Physics Education, Faculty of Physics, Ludwig-Maximilians-Universität München (LMU Munich)(物理教育系主任,物理学院,慕尼黑路易斯-马克西姆利安大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文研究了多种外部表征与个性化反馈在高中物理学习中的整合效果,发现详细多表征反馈对学习成绩有积极影响,且学习者根据表征能力选择不同反馈策略。
Comments Keywords: Adaptive Feedback, Multimodal Learning, Multiple External Representations, Physics Education, Science Education, Representational Competences, Intelligent Tutoring Systems
ART:面向医疗AI代理的基于动作的推理任务基准测试
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 ART通过挖掘真实EHR数据创建挑战性任务,评估医疗AI代理在阈值评估、时间聚合和条件逻辑方面的表现,揭示其推理弱点,推动更可靠的临床决策支持系统发展。
DiSCo:在智能摘要界面中使缺失内容可见
机构 * University of Haifa(海法大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 DiSCo通过对比领域期望揭示摘要中的缺失内容,提升智能摘要界面的透明度和决策支持能力。
迈向临床试验高效患者招募:基于提示学习模型的应用
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究提出基于提示学习模型的高效患者招募方法,利用SNOMED CT本体实现医疗文本的精准分类,提升了临床试验招募效率。
Journal ref 2025;31(4):367-377
导航构想空间:分解的概念表示用于定位科学思想
机构 * Virginia Tech(弗吉尼亚理工大学) ; University of California, Davis(加州大学戴维斯分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 领域大模型 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出构想空间,通过分解科学知识的三个维度,实现科学思想的定位与评估,提升文献检索和创新性判断的效率与准确性。
Comments 21 pages, 6 tables
基于评分标准的LLM评分:对齐、不确定性与鲁棒性
机构 * Purdue University(普渡大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了基于评分标准的LLM评分的对齐性、不确定性与鲁棒性,发现评分标准粒度增加时对齐性下降,通过信任曲线分析发现过滤低置信度预测可提升准确性,同时模型对同义词替换敏感。
大型语言模型条款的监管灰色区域
机构 * University of Bath(巴斯大学) ; Bath Spa University(巴斯斯巴大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文分析了五家主要LLM提供商的条款,揭示了使用限制的差异及监管灰色区域,提供了公开资源以帮助用户和研究人员应对这一挑战。
通过结构化知识发现方法提升语言模型生成的可解释性
机构 * City University of Hong Kong(香港城市大学) ; City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院) ; Tencent AI Lab(腾讯AI实验室)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种任务无关的结构化知识猎手,通过结合语言模型的生成能力与知识猎手的高保真度,提升语言模型生成文本的可解释性,并在多个数据集上验证了其有效性。
大规模模态不变基础模型用于脑MRI分析:应用于病变分割
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种大规模模态不变基础模型,用于提升脑MRI中病变分割的性能,通过自监督学习预训练并保留细粒度模态特定特征。
Comments Submitted to IEEE ISBI 2026