arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 461 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 461 篇

2604.28061 2026-07-21 cs.DL cs.CL 版本更新 81%

Measuring research data reuse in scholarly publications using generative artificial intelligence: Open Science Indicator development and preliminary results

利用生成式人工智能测量学术出版物中的研究数据重用:开放科学指标开发与初步结果

Lauren Cadwallader, Iain Hrynaszkiewicz, parth sarin, Tim Vines

机构 * PLOS DataSeer

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文开发了基于LLM的开放科学指标,发现研究数据重用率高达43%,高于传统文献计量方法,展示了生成式AI在大规模测量数据重用方面的潜力。

Comments v2: 12 pages. Revised and accepted following feedback from review process of 30th Annual International Conference on Science and Technology Indicators. Revisions are the addition of 1) information on the definition of "data reuse" and 2) discussion of prevalent errors identified in the model. V1: 12 pages. Submitted to 30th Annual International Conference on Science and Technology Indicators

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05353 2026-07-21 cs.LG cs.IT math.IT 版本更新 81%

GlyRAG: Context-Aware Retrieval-Augmented Framework for Blood Glucose Forecasting

GlyRAG:用于血糖预测的上下文感知检索增强框架

Shovito Barua Soumma, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究旨在利用连续血糖监测数据进行准确血糖预测,开发了GlyRAG框架,结合大语言模型提取上下文信息并通过检索增强预测,在OhioT1DM和AZT1D数据集上评估,显著提高长期预测的均方根误差,多数预测落在临床可接受区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26614 2026-07-20 cs.HC cs.AI cs.GR 版本更新 81%

HiLSVA: Design and Evaluation of a Human-in-the-Loop Agentic System for Scientific Visualization

HiLSVA:用于科学可视化的人机协同智能系统设计与评估

Kuangshi Ai, Patrick Phuoc Do, Chaoli Wang

机构 * Department of Computer Science and Engineering, University of Notre Dame(Notre Dame 大学计算机科学与工程系)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出HiLSVA,一种人机协同智能系统,通过计划优先的多智能体架构、显式人类监督和逐步溯源,支持混合主动的科学可视化工作流,增强而非替代人类分析推理。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28533 2026-07-14 cs.IR cs.AI 版本更新 81%

CMSL: Constructive Multi-Sequence Learning for Recommendation Systems

CMSL:面向推荐系统的建设性多序列学习

Zikun Cui, Renzhi Wu, Junjie Yang, Li Sheng, Jijie Wei, Linfeng Liu, Tai Guo, Tao Jia, Xiaodong Wang, Hong Li, Li Yu, Sri Reddy, Hong Yan

机构 * Meta MRS Meta PyTorch Meta FB Monetization

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对用户历史行为序列中多兴趣混杂导致的上下文污染问题,提出CMSL方法,通过可学习的序列构建模块在隐空间解耦出多个纯主题序列,并利用线性注意力高效建模,在Meta多个场景的排序和检索任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24050 2026-06-24 cs.SE cs.AI stat.AP 版本更新 81%

More Skills, Worse Agents? Skill Shadowing Degrades Performance When Expanding Skill Libraries

更多技能,更差智能体?扩展技能库时技能遮蔽降低性能

Hongwen Song, Song Wei

机构 * Databricks Inc.(Databricks公司)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文研究LLM智能体技能库扩展导致性能下降的现象,提出将性能下降分解为技能遮蔽和上下文开销两种效应,并通过实验证明技能遮蔽是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15952 2026-06-16 cs.AI 版本更新 81%

Protein Design with Agent Rosetta: A Case Study for Specialized Scientific Agents

基于Agent Rosetta的蛋白质设计:面向专业科学智能体的案例研究

Jacopo Teneggi, S. M. Bargeen A. Turzo, Tanya Marwah, Alberto Bietti, P. Douglas Renfrew, Vikram Khipple Mulligan, Siavash Golkar

机构 * Polymathic AI(多学科人工智能实验室) Center for Computational Biology, Flatiron Institute(计算生物学中心,Flatiron研究所) Google DeepMind(谷歌DeepMind) Center for Computational Mathematics, Flatiron Institute(计算数学中心,Flatiron研究所) New York University(纽约大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Agent Rosetta,将大语言模型与Rosetta软件环境结合,通过迭代优化实现用户定义的蛋白质设计目标,在规范氨基酸设计上匹配专家,在非规范残基设计上超越现有ML方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09105 2026-06-11 cs.AI 版本更新 81%

Graph2Idea:Retrieval-Augmented Scientific Idea Generation with Graph-Structured Contexts

Graph2Idea:基于检索增强的图结构上下文科学想法生成

Xu Li, Hanzhe Tu, Xun Han

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Graph2Idea框架,利用知识图谱将检索文献转化为结构化三元组,提取图衍生上下文,通过两阶段生成过程提高科学想法的新颖性、质量和可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04982 2026-06-08 cs.CY cs.AI cs.HC 版本更新 81%

Training for Technology: Adoption and Productive Use of Generative AI in Legal Analysis

技术培训:法律分析中生成式人工智能的采纳与生产性使用

Benjamin M. Chen, Hong Bao

机构 * University of Hong Kong Faculty of Law(香港大学法学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过随机实验发现,未经培训的法学学生使用大语言模型反而降低表现,而简短培训能显著提升采纳率和成绩,表明生成式AI的生产力需要培训支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16235 2026-08-11 cs.LG cs.AI 版本更新 81%

OpenMHC: Accelerating the Science of Wearable Foundation Models

OpenMHC:加速可穿戴基础模型科学发展

Narayan Schuetz, Yuze Bai, Lianggang Pan, Edgar Eggert, Favour Nerrise, Juan Delgado-SanMartin, Max Rosenblattl, Milana Gurbanova, Mohammad Asadi, Anders Johnson, Paul Schmiedmayer, Dennis Wang, Allan Lawrie, Daniel Seung Kim, Xin Liu, Akshay Paruchuri, Ehsan Adeli, Euan Ashley, Kelly W. Zhang

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 为加速可穿戴健康领域开放科学,发布OpenMHC这一最大最全的可穿戴健康数据集及模型开源实现,引入统一开放基准,对多种模型进行测试,通过大规模开源数据、代码和模型权重,推动可穿戴健康AI研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02632 2026-07-28 cs.LG cs.AI 版本更新 81%

QuantFlow: A Federated Mamba-Based Post-Transformer Foundation Model for Time-Series Forecasting

QuantFlow:一种基于联合曼巴的用于时间序列预测的后Transformer基础模型

Shah Nawaz Haider, Steve Austin, Arnab Barua, Sarowar Morshed Shawon, Hadaate Ullah

机构 * Department of Computer Science and Engineering, University of Science and Technology Chittagong(信息科学与工程系,查塔姆冈科技大学) Department of Electrical and Electronic Engineering, University of Science and Technology Chittagong(电气电子工程系,查塔姆冈科技大学) Faculty of Science, Engineering and Technology, University of Science and Technology Chittagong(科学、工程与技术学院,查塔姆冈科技大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对时间序列预测,提出结合多种技术的概率预测框架QuantFlow,用反向序列嵌入等进行处理,经实验验证其在多数据上效果好,且联合学习可保护隐私。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19618 2026-07-27 cs.CV cs.AI cs.LG 版本更新 81%

The pretraining domain outweighs the training objective in setting the privacy-utility trade-off of differentially private medical image analysis

自监督预训练在差分隐私医疗图像分析中的作用

Soroosh Tayebi Arasteh, Mina Farajiamiri, Mahshad Lotfinia, Behrus Hinrichs-Puladi, Jonas Bienzeisler, Mohamed Alhaskir, Mirabela Rusu, Christiane Kuhl, Sven Nebelung, Daniel Truhn

专题命中 领域大模型 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了自监督预训练在差分隐私医疗图像分析中的作用,发现DINOv3初始化在DP下优于ImageNet初始化,但不如领域特定监督预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16696 2026-06-24 cs.LG cs.AI cs.MM cs.SD 版本更新 81%

FISHER: A Foundation Model for Multi-Modal Industrial Signal Comprehensive Representation

FISHER:多模态工业信号综合表示的基础模型

Pingyi Fan, Anbai Jiang, Shuwei Zhang, Xinhu Zheng, Zhiqiang Lv, Bing Han, Wenrui Liang, Junjie Li, Wei-Qiang Zhang, Yanmin Qian, Xie Chen, Jia Liu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学智能感知与机器人研究院) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Huakong AI Plus Company Limited(华冠AIplus有限公司) Didi International Business Group(滴滴国际商务集团)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对工业信号分析中的数据异质性(M5问题),提出FISHER基础模型,采用子带建模处理多采样率问题,通过教师-学生自蒸馏预训练,在19个数据集上以较小规模超越24个SOTA编码器。

Comments Accepted by IEEE TII. FISHER open-sourced on https://github.com/jianganbai/FISHER . RMIS open-sourced on https://jianganbai.github.io/RMIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03250 2026-06-17 cs.CL cs.AI 版本更新 81%

RooseBERT: A New Deal For Political Language Modelling

RooseBERT: 政治语言建模的新协议

Deborah Dore, Elena Cabrio, Serena Villata

机构 * Université Côte d’Azur CNRS, INRIA, I3S Sophia Antipolis, France(法国尼斯大学 CNRS INRIA I3S 索菲亚Antipolis 分校)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对政治语言特殊性,提出领域预训练模型RooseBERT,在大型政治辩论语料上训练,在多项政治分析任务中优于通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07847 2026-08-18 cs.IR 版本更新 80%

From Token Generation to Item Ranking: Direct Generative Recommendation with Semantic IDs

SimGR:摆脱基于大语言模型推荐的生成解码陷阱

Yuanbo Zhao, Ruochen Liu, Senzhang Wang, Jun Yin, Yuxin Dong, Huan Gong, Hao Chen, Shirui Pan, Chengqi Zhang

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 SimGR通过在共享潜在空间中直接建模物品层面偏好分布,缓解了基于LLM推荐中生成解码的偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23053 2026-08-14 stat.OT 版本更新 80%

LLteacher: A Tool for the Integration of Generative AI into Statistics Assignments

LLteacher: 一种将生成式AI整合到统计作业中的工具

Emanuela Furfaro, Simone Mosciatti

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 LLteacher是一种利用LLM辅助统计作业学习的开源工具,通过保留学习过程和引导学生与AI互动,支持知识回忆和新概念发现。

Journal ref Technology Innovations in Statistics Education, 17(1), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15631 2026-08-04 cs.HC cs.SE 版本更新 80%

Meflex: A Multi-agent Scaffolding System for Entrepreneurial Ideation Iteration via Nonlinear Business Plan Writing

Meflex:一种基于非线性商业计划写作的多智能体支架系统,用于创业构想迭代

Lan Luo, Dongyijie Primo Pan, Junhua Zhu, Muzhi Zhou, Pan Hui

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 Meflex通过非线性商业计划写作支架系统,支持创业构想的迭代发展,提升反思与元反思能力,降低认知负担。

Comments In Proceedings of The First Reflection in Creative Experience (RiCE) Workshop (RiCE W1) arXiv:2607.24558

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16532 2026-07-01 cs.IR 版本更新 80%

Causal-Invariant Cross-Domain Out-of-Distribution Recommendation

因果不变的跨域分布外推荐

Jiajie Zhu, Yan Wang, Feng Zhu, Pengfei Ding, Hongyang Liu, Zhu Sun

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 提出CICDOR框架,通过双层级因果结构推断域特定和域共享的因果不变用户偏好,并利用LLM发现混杂因子,解决跨域和单域分布偏移导致的分布外问题,提升推荐准确性。

Comments Corrected author affiliation. Accepted by ACM TOIS for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03724 2026-06-26 cs.IR 版本更新 80%

Rank, Don't Generate: Statement-level Ranking for Explainable Recommendation

排序,而非生成:面向可解释推荐的语句级排序

Ben Kabongo, Arthur Satouf, Vincent Guigue

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出将可解释推荐形式化为语句级排序问题,通过从评论中提取解释性语句并排序,避免生成式幻觉,支持细粒度事实分析和标准化评估。

Comments 12 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17179 2026-06-16 cs.MA 版本更新 80%

Ablation Study of a Fairness Auditing Agentic System for Bias Mitigation in Early-Onset Colorectal Cancer Detection

公平性审计代理系统在早发性结直肠癌检测中缓解偏见的消融研究

Amalia Ionescu, Jose Guadalupe Hernandez, Jui-Hsuan Chang, Emily F. Wong, Paul Wang, Jason H. Moore, Tiffani J. Bright

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出双代理架构(领域专家代理+公平性顾问代理),通过消融实验比较不同配置下大语言模型在公平性审计中的表现,发现带RAG的代理系统在识别差异方面语义相似度最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09290 2026-06-10 cs.SE cs.CE cs.MA 版本更新 80%

ToolRosella: Translating Code Repositories into Standardized Tools for Scientific Agents

ToolRosella: 将代码仓库翻译为科学智能体的标准化工具

Shimin Di, Xujie Yuan, Hanghui Guo, Chaoqian Ouyang, Yongxu Liu, Ling Yue, Zhangze Chen, Libin Zheng, Jia Zhu, Shaowu Pan, Jian Yin, Yong Rui, Min-Ling Zhang

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出ToolRosella框架,通过仓库分析、工具接口构建、执行测试和迭代修复,自动将异构科学代码仓库转化为标准化、可被智能体调用的工具,在122个仓库上达到61.5%的转换成功率,下游任务成功率为84.0%。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03852 2026-06-10 physics.geo-ph 版本更新 80%

Advancing Subsurface Discovery and Geothermal Monitoring with an Agentic Artificial Intelligence Framework

基于智能体人工智能框架推进地下发现与地热监测

Randy Harsuko, Zhengfa Bi, Guodong Chen, Nori Nakata

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GAIA系统,结合大语言模型、数字孪生与检索增强生成,实现地热开发中的多学科任务自动化与智能决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15910 2026-08-21 cs.CL 版本更新 79%

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

校准的分诊,而非自主:医学视觉-语言模型的置信度估计

Reza Khanmohammadi, Kundan Thind, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL

AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14870 2026-08-20 hep-ph cs.LG 版本更新 79%

Pre-Training for Simulation-Based Science: A Study on Jet Foundation Model Training Objectives

基于模拟的科学预训练:喷注基础模型训练目标研究

Ibrahim Elsharkawy, Joschka Birk, Vinicius Mikuni, Wahid Bhimji, Gregor Kasieczka, Benjamin Nachman

机构 * Department of Physics, University of Toronto and Vector Institute(物理系,多伦多大学和向量研究所) NERSC, Lawrence Berkeley National Laboratory(NERSC,伯克利国家实验室) Institut für Experimentalphysik, Universität Hamburg(实验物理研究所,汉堡大学) Nagoya University, Kobayashi-Maskawa Institute(名古屋大学,小林昭夫研究所) Department of Particle Physics and Astrophysics, Stanford University(粒子物理与天体物理系,斯坦福大学) Fundamental Physics Directorate, SLAC National Accelerator Laboratory(基础物理局,SLAC国家加速器实验室)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 本文系统比较了高能物理中基础模型的预训练方法,发现纯分类预训练在标签充足时最优,结合自监督掩码粒子建模在低标签场景下表现突出,而流匹配生成预训练对下游分类无益,但必须包含在预训练目标中才能提升生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08941 2026-08-12 cs.LG 版本更新 79%

Predictive Entropy as a Joint Screen for Error and Paraphrase Instability in Medical Vision-Language Models

预测熵连接校准与改写敏感性在医疗视觉-语言模型中

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(纽黑文大学SAIL实验室)

专题命中 领域大模型 :language model(title,abstract);分类 cs.LG

AI总结 本文研究医疗视觉语言模型在部署中的校准和改写敏感性问题,通过预测熵方法发现决策边界接近性是共同原因,并展示单一熵阈值能有效识别不可靠和改写敏感的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25143 2026-08-12 cs.CV cs.CL 版本更新 79%

TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models

TemMed-Bench:评估视觉语言模型的时序医学图像推理能力

Junyi Zhang, Jia-Chen Gu, Wenbo Hu, Yu Zhou, Robinson Piramuthu, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL

AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12953 2026-08-05 cs.CV cs.AI cs.IR cs.MM 版本更新 79%

Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation

具备知识意识的视觉-语言基础模型用于胎儿超声解读

Xiao He, Huangxuan Zhao, Guojia Wan, Jiancheng Pan, Yanxing Liu, Yong Luo, Juhua Liu, Yongchao Xu, Wei Zhou, Dacheng Tao, Bo Du

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心,武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学)

专题命中 领域大模型 :foundation model(title);language model(abstract);分类 cs.AI

AI总结 FetalMind通过Salient Epistemic Disentanglement方法,提升胎儿超声解读的准确性和效率,实现多视图图像推理和疾病诊断的高效处理。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25726 2026-07-31 cs.AI 版本更新 79%

Nudging Sustainable Choices through LLM-Generated Recommendation Explanations

通过大语言模型生成的推荐解释推动可持续选择

Haya Halimeh, Dietmar Jannach, Oliver Müller

机构 * Paderborn University(帕德博恩大学) University of Klagenfurt(克拉根福大学)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.AI

AI总结 研究通过大语言模型生成推荐解释,探讨不同可持续性信息框架对用户选择和认知的影响。在速溶咖啡和酒店预订领域进行随机研究,发现框架构建或援引规范能增加可持续选择,虽认知与行为有差异,但为社会公益干预提供实践方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05682 2026-07-30 cs.AI 版本更新 79%

FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

FirstResearch:用于大语言模型科学发现智能体的可审计问题形成

Yufeng Wang

专题命中 领域大模型 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型科学发现智能体首个研究问题难审计的问题,提出FirstResearch框架,核心是研究问题证书,记录多种要素使问题可检查。实验表明该框架在多个主题上优于基线,以证书为中心的核心组件作用显著,支持明确推导约束可提升问题可审计性。

Comments Withdraw for further improvement and work consolidation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00435 2026-07-29 cs.CV cs.AI 版本更新 79%

Detect Before You Leap: Mirage Detection in Vision-Language Models

在跳跃前检测:视觉语言模型中的幻象检测

Sayeed Shafayet Chowdhury, Md. Shaown Miah, S. M. Taiabul Haque, Syed Ishtiaque Ahmed

机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI

AI总结 针对视觉语言模型在缺乏视觉证据时产生自信但无根据回答的幻象问题,提出文本条件层内对齐方法,通过分析视觉编码器各层补丁令牌与问题嵌入的对齐轨迹,结合像素统计、零样本域路由和结构化自评估,实现高精度预响应幻象检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27720 2026-07-29 cs.AI 版本更新 79%

Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models

对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应

Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Columbia University, New York, USA(哥伦比亚大学) University of Michigan, Ann Arbor, USA(密歇根大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI

AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏