arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7596 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7596 篇

2608.08772 2026-08-11 cs.CL eess.AS 新提交 79%

Multilingual Emotion Neurons in Large Audio-Language Models

大型音频语言模型中的多语言情感神经元

Xiutian Zhao, Philipp Koehn, Björn Schuller, Berrak Sisman

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过首个神经元层面可解释性研究,提出多语言情感神经元(MLENs)定义及一致性正则化融合(CR-Fusion)方法,证实其在零样本和低资源场景下情感控制更精准,为LALMs跨语言情感编码提供因果解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07857 2026-08-11 cs.CV cs.AI 新提交 79%

Distilling CT Foundation Models into Editable Concept Bottlenecks for Lung Nodule Malignancy Prediction

将CT基础模型蒸馏为可编辑概念瓶颈用于肺结节恶性程度预测

Fakrul Islam Tushar, Stephen Adamo, Geoffrey D. Rubin

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究将CT基础模型蒸馏为可编辑概念瓶颈模型,在肺结节恶性程度预测任务中,其判别力与仅用结节大小相当,且支持概念干预以实现透明可解释的预测。

Comments Submitted to SPIE Medical Imaging 2027 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07562 2026-08-11 cs.CV cs.LG 新提交 79%

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调

Nafis Fuad, Xiaodong Qian, Dongxiao Zhu

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。

Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03115 2026-08-11 cs.CL eess.AS 版本更新 79%

Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language Models

在大型音频-语言模型中发现并因果验证情绪敏感神经元

Xiutian Zhao, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP)(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学) Group on Language, Audio & Music (GLAM)(语言、音频与音乐小组) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过神经元层面的干预验证了大型音频-语言模型中情绪敏感神经元的存在,并揭示了情绪识别的因果机制。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06054 2026-08-10 cs.CV cs.AI 版本更新 79%

Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving

探测轻量视觉语言模型中视觉概念以用于自动驾驶

Nikos Theodoridis, Reenu Mohandas, Ganesh Sistu, Anthony Scanlan, Ciarán Eising, Tim Brophy

机构 * University of Limerick(利默里克大学) Valeo Vision Systems, Ireland(爱尔兰瓦莱欧视觉系统) Department of Electronic and Computer Engineering(电子与计算机工程系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本研究探讨了轻量视觉语言模型在自动驾驶中的视觉概念编码问题,发现某些概念显式编码而其他隐式编码,并识别出感知和认知两种失败模式。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06259 2026-08-07 cs.LG 新提交 79%

RxnCLF: Contrastive Transformation-Aware Reaction Foundation Model for Improved Reactivity Prediction

RxnCLF:用于改进反应性预测的感知变换的反应基础模型

Yiting Zheng, Cheng Fang, Anthony Donofrio, Haote Li

机构 * Discovery Chemistry, Merck & Co., Inc.(默克公司发现化学部门)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究提出RxnCLF,一种基于凝聚反应图的自监督对比反应基础模型,经170万Pistachio反应预训练后,在多类产率预测基准上均优于基线模型,展现出良好泛化潜力。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03690 2026-08-05 cs.LG 新提交 79%

LAEF: A Lead-Agnostic ECG Foundation Model Towards Point-of-Care Diagnostics

LAEF:面向即时诊断的导联无关心电图基础模型

Edoardo Coppola, Stefano Fiorini, Pietro Liò, Mattia Savardi, Alberto Signoroni

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究提出LAEF,一种7M参数的导联无关心电图基础模型,预训练于9.2M份12导联心电图,在18个下游数据集的1-2导联即时诊断场景下,性能优于零填充替代方案,与更大规模的12导联基线相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02602 2026-08-04 cs.CL 新提交 79%

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

AURORA-LM:用于连续潜在扩散语言建模的统一表示自动编码

Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 AURORA-LM是一种分离文本表示构建与分布建模的连续潜在扩散语言模型,通过特定技术优化后,在OpenWebText自由生成和XSum摘要任务中性能优于同类模型。

Comments 40 pages, 17tables, project page: https://aurora-lm-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00033 2026-08-04 cs.AI 新提交 79%

SIRIN: A Unified Toolkit for Detecting Contextual Hallucinations in Retrieval-Augmented and Memory-Grounded LLM Systems

SIRIN:用于检测检索增强与记忆基大型语言模型系统中上下文幻觉的统一工具包

Julia Belikova, Rauf Parchiev, Mikhail Filimonov, Konstantin Polev, Andrey Savchenko, Maksim Makarenko

机构 * Sber AI Lab(Sber AI实验室)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出SIRIN工具包,整合三类检测器范式与查询可回答性任务,支持多设置下的幻觉检测,可作为长期记忆系统的忠实性门控,源代码公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27092 2026-07-30 cs.LG 新提交 79%

Sky sphere representation in language models

语言模型中的天球表示

Aleksandr Berdnikov, Yevgeny Liokumovich

机构 * Fields Institute(菲尔兹研究所) Principles of Intelligence(智能原理机构) University of Toronto(多伦多大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 研究约1000亿参数的语言模型是否存在可从残差流解码的夜空图表示,发现多数开源模型具备该表示,其性能指标优异且为首个弯曲高维不可约特征流形实例,相关代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00807 2026-07-30 cs.AI 版本更新 79%

BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models

BioPro: 关于差分意识的性别公平性在视觉-语言模型中

Yujie Lin, Jiayao Ma, Qingguo Hu, Wenbo Li, Genji Li, Derek Wong, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25228 2026-07-29 cs.CL 新提交 79%

Interpretable Column Annotation with LLM-Symbolized Decision Process Materialization

基于大语言模型符号化决策过程实现的可解释列注释

Mengqi Wang, Jianwei Wang, Qing Liu, Xiwei Xu, Zhenchang Xing, Michael Bain, Liming Zhu, Wenjie Zhang

机构 * Data61, CSIRO(数据61,联邦科学与工业研究组织)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对列注释方法存在的问题,提出SymCA框架,通过大语言模型赋能,将其实现为全局到局部的符号决策过程,含全局骨架归纳和局部基质演化两组件,实验证明该框架准确、稳健且可解释,性能优于基线。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25164 2026-07-29 cs.CV cs.AI 新提交 79%

OrganLens: Organ-Specific Representation Learning for CT Foundation Models

OrganLens:用于CT基础模型的器官特异性表征学习

Zhixuan Ge, Anqi Li, Sadeer Al-Kindi, Hanwen Xu, Wei Qiu

机构 * Rice University(莱斯大学) University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对CT检查中特定器官表征需求,提出OrganLens通过自监督学习,用器官标识调节共享编码器,经器官特异性蒸馏等方法获取器官特异性表征,在多数据集评估中提升指标,提供了可扩展方法和 reusable 框架。

Comments 16 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22712 2026-07-29 cs.CV cs.AI physics.optics 版本更新 79%

scMIR: a vision-language foundation model for single-cell light microscopy image representation

scMIR:用于单细胞光学显微镜图像表示的视觉语言基础模型

Yifan Shang, Jiahui Tan, Xiangxiang Zeng, Renjie Zhou

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对单细胞光学显微镜图像分析难题,提出scMIR模型,通过自监督图像重建与文本引导跨模态对齐,在多图像文本对上预训练,在多种复杂任务中表现出色,优于现有方法,具备强泛化能力,能推动高通量表型分析工作流程标准化和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22570 2026-07-28 cs.AI 新提交 79%

Reference Feature Atlases for Mechanistic Auditing of Language Models

用于语言模型机制审计的参考特征图谱

Rui Wu, Tong Che

机构 * Rutgers University(罗格斯大学) NVIDIA Research(英伟达研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 该研究提出参考特征图谱用于语言模型审计,通过拟合线性解码器实现,有图谱和残差两个互补通道。在多模型上训练并审计米斯特拉尔和文心一言目标,残差通道能控制植入机制,还揭示文心一言相关集群,为模型审计提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07407 2026-07-28 cs.LG 版本更新 79%

Emergent Symbolic Structure in Health Foundation Models: Extraction, Alignment, and Cross-Modal Transfer

健康基础模型中的涌现符号结构:提取、对齐与跨模态迁移

Gajendra Katuwal, Advait Koparkar, Salar Abbaspourazad, Anshuman Mishra, Sarvesh Kirthivasan

机构 * Apple(苹果公司)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种训练后框架,通过分解冻结嵌入以提取可解释的符号,用于对齐嵌入空间。在PPG和加速度计数据上验证,发现符号能选择性关联健康状况和生理属性,并支持跨模态迁移。

Comments 8 pages, Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, 4 main figures

Journal ref Mechanistic Interpretability Workshop at the 43 rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22864 2026-07-23 cs.LG 版本更新 79%

Reading Calibrated Uncertainty from Language Model Trajectories

从语言模型轨迹中读取校准的不确定性

Aliai Eusebi, Alexander Herzog, Xiaoyu Liang, Marie Vasek, Enrico Mariconti, Lorenzo Cavallaro

机构 * University College London, London, United Kingdom(伦敦大学学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文通过提取层间MLP更新的尺度不变几何特征,使用稀疏线性探针从语言模型内部激活轨迹中校准不确定性,在选择性弃权任务中优于最大softmax概率,最高提升21 AURC点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15175 2026-07-17 cs.CL 新提交 79%

Linear representations of grammaticality in neural language models

神经语言模型中语法性的线性表示

Jane Li, Najoung Kim

机构 * Johns Hopkins University(约翰·霍普金斯大学) Boston University(波士顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 探讨神经语言模型能否基于语法性区分字符串,通过质量均值探测研究语法性是否编码在其内部表示中,结果表明语法性在多种预训练模型中有力编码,为相关争论提供新证据及评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14791 2026-07-17 cs.AI 新提交 79%

Transcoders for Investigating Deception in Language Models

用于研究语言模型中欺骗行为的转码器

Darius Lim, Nathan Leow, Xin Wei Chia

机构 * Home Team Science & Technology Agency (HTX)(新加坡内政部科技局)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究用转码器分析语言模型欺骗行为,通过预训练转码器的Qwen3 - 4B模型构建归因图,经特征引导和电路分析识别相关特征字典,发现欺骗源于模型内部机制,凸显转码器在监测及检测语言模型安全漏洞方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11920 2026-07-15 econ.EM cs.AI stat.ME 新提交 79%

Sensitivity to Subjective Expected Utility Maximization: A Methodological Study, with an Illustrative Application to LLM Decision-Making

对主观预期效用最大化的敏感性:一项方法学研究,并应用于大语言模型决策

Jeff Helzner

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 研究在标记结果稀缺等情况下评估不确定性决策的难题,通过含敏感性参数α的softmax选择模型得出相关可识别性结果,应用于大语言模型决策,检测到结构化比较α效应。

Comments 64 pages, 5 figures. Code and data archived at Zenodo: https://doi.org/10.5281/zenodo.21250951

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10387 2026-07-14 eess.AS cs.CL 新提交 79%

GigaChat Audio: Time-aware Large Audio Language Model

GigaChat音频:时间感知大型音频语言模型

Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov, Alexandr Maximenko, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

机构 * SaluteDevices, Russia(SaluteDevices)

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract);分类 cs.CL

AI总结 研究音频条件语言模型长录音时间定位难题,提出时间感知音频语言模型,利用合成监督交织时间标记与音频令牌,在多基准测试中实现高精度,支持相关描述与总结,通过消融实验明确多因素影响,并发布模型权重和数据集。

Comments Accepted to Interspeech 2026. Model and dataset: https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09998 2026-07-14 cs.LG q-bio.BM 新提交 79%

Vilya-1: An all-atom foundation model for macrocycle structure prediction and design

Vilya-1:用于大环结构预测与设计的全原子基础模型

Vilya Research, :, Pascal Sturmfels, Milad Salem, Naozumi Hiranuma, Stephen Rettie, Xiaoliang Pan, Benjamin D. Sellers, Adam P. Moyer, Patrick J. Salveson, Ivan Anishchanka

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对现有大环肽结构和性质建模方法的局限,提出全原子深度学习模型Vilya-1,可跨化学结构采样及预测属性,在异构数据集训练,提高几何精度且覆盖小分子,支持生成应用,为大环治疗药物开发加速。

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22042 2026-07-14 cs.CV cs.AI 版本更新 79%

Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

基于部分-整体语义代表性与不确定性引导的组合对齐超几何视觉语言模型

Hayeon Kim, Ji Ha Jang, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电子与计算机工程系) INMC & IPAI(INMC与IPAI) Seoul National University(首尔国立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出UNCHA方法,通过超几何不确定性建模部分-整体语义代表性,提升超几何VLM对多物体场景的组合结构理解能力,实现零样本分类等任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07507 2026-07-09 cs.CV cs.AI 新提交 79%

HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

HIVE:理解视觉语言模型中的幻觉后推理

Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) Meta AI Kent State University(肯特州立大学) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06224 2026-07-08 cs.LG 新提交 79%

Canopy: A Heterograph Foundation Model for Metabolic Engineering

Canopy:用于代谢工程的异构图基础模型

Jake Bowden, Laurence Legon, Satnam Surae

机构 * an in-house laboratory information management system (LIMS)(一个内部实验室信息管理系统(LIMS))

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 代谢工程中设计高产微生物菌株有挑战,Canopy异构图基础模型集成多数据源成知识图谱,用特定模型编码特征,经自监督目标预训练,在发酵滴度预测任务中表现优于基线。

Comments Accepted at ICML GenBio Workshop 2026 https://openreview.net/forum?id=H8bvgKoT7j

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04593 2026-07-07 cs.CV cs.AI 新提交 79%

TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

TORINO:通过视觉语言模型中可解释的概念重叠进行令牌减少

Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda, Alaa Eddine Mazouz, Van-Tam Nguyen

机构 * University of Turin, Italy(意大利都灵大学) Eindhoven University of Technology, The Netherlands(荷兰埃因霍温理工大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型计算成本高问题,提出TORINO框架,利用稀疏自动编码器将视觉令牌投影到可解释潜在空间,通过概念重叠分组并减少令牌,兼顾效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04163 2026-07-07 cs.CV cs.AI 新提交 79%

SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering

SeeMe:通过有效的视觉令牌工程减轻大型视觉语言模型中的幻觉

Kai Tang, Jinhao You, Bohua Zhang, Yichen Guo, Yiding Sun, Dongxu Zhang, Chenxi Li, Xiande Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) University of Pennsylvania(宾夕法尼亚大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) De Artificial Intelligence Lab(德人工智能实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究大型视觉语言模型易产生幻觉问题,提出无训练框架SeeMe,引入传统机器学习特征工程概念,经三阶段令牌工程重组视觉令牌抑制幻觉源,实验证明其能减轻幻觉并提高输出一致性。

Comments 12 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20237 2026-07-03 cs.CL 79%

Investigating the Representation of Backchannels and Fillers in Fine-tuned Language Models

探讨在微调语言模型中回话用语和填充词的表示

Yu Wang, Leyi Lao, Langchu Huang, Gabriel Skantze, Yang Xu, Hendrik Buschmeier

机构 * Bielefeld University(比勒菲尔德大学) Southern University of Science and Technology(南方科技大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文通过三种微调策略研究回话用语和填充词在语言模型中的表示,发现微调能提升模型区分语义差异的能力,使生成的对话更接近人类语言。

Comments Accepted at ACL 2026 main

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers, ACL 2026), pp. 5319-5348

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31976 2026-07-01 cs.AI cs.MA 新提交 79%

TreeAgent: A Generalizable Multi-Agent Framework for Automated Bias Labeling in Forestry via Compiled Expert Rules and Vision-Language Models

TreeAgent: 一种基于编译专家规则和视觉语言模型的通用多智能体框架,用于林业自动化偏差标注

Shiyi Chen, Nicholas Saban, Collin Hargreaves, Huiqi Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 提出TreeAgent多智能体框架,结合专家决策树与视觉语言模型,通过解耦声明式决策实现零修改泛化,在树木偏差分类中超越监督学习基线并降低标注成本。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31577 2026-07-01 cs.CV cs.LG 新提交 79%

Localized Conformal Prediction for Image Classification with Vision-Language Models

基于视觉语言模型的图像分类局部化共形预测

Clément Fuchs, Tim Bary, Benoît Macq

机构 * CÉCI F.R.S.-FNRS(比利时国家科学研究基金会) Walloon Region(瓦隆大区)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 针对图像分类中局部化共形预测未充分探索的问题,提出一种简单的余弦相似度非线性变换,在保持边际覆盖保证的同时显著降低平均集大小。

Comments 7 pages, 2 figures, 3 tables, code availables, accepted to EUVIP 2025

Journal ref 2025 13th European Workshop on Visual Information Processing (EUVIP)

详情

展开后加载摘要…

URL PDF HTML 收藏