arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-06 至 2026-08-06 共收录 345 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 52 篇

2504.01407 2026-08-06 cs.CV cs.AI 版本更新 57%

ZoomV: Temporal Zoom-in for Efficient Long Video Understanding

TimeSearch: 基于聚光灯和反射的层次视频搜索用于类人长视频理解

Yuan Zhang, Junwen Pan, Rui Zhang, Xin Wan, Qizhe Zhang, Ming Lu, Qi She, Shanghang Zhang

机构 * ByteDance(字节跳动) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 TimeSearch通过Spotlight和Reflection机制,提升长视频理解的准确性和效率

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05042 2026-08-06 cs.RO 新提交 50%

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges ByteDance Seed(字节跳动种子实验室)

专题命中 效率与部署 :language model(abstract)

AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。

Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04676 2026-08-06 cs.CV 新提交 50%

SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

SurgNarrator:面向手术视频理解的生成式检索框架

Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin, Kun Yuan, Nicolas Padoy, Daniel S. Elson, Anh Nguyen, Stamatia Giannarou, Baoru Huang

机构 * University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) University of Strasbourg(斯特拉斯堡大学) IHU Strasbourg(斯特拉斯堡大学医院研究所) Imperial College London(帝国理工学院)

专题命中 效率与部署 :language model(abstract)

AI总结 SurgNarrator是专为手术视频理解设计的生成式检索框架,通过构建手术词汇表、适配Qwen3-VL-Embedding-8B并采用分层检索策略,在零样本设置下于12个基准上实现性能提升且延迟大幅降低。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04483 2026-08-06 cs.CV 新提交 50%

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

并非所有冗余视觉标记都相同:通过标记角色分析视觉标记剪枝

Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

机构 * Maum AI Inc.(Maum AI公司)

专题命中 效率与部署 :language model(abstract)

AI总结 本研究针对视觉-语言模型(VLMs)的视觉标记剪枝问题,通过EmbedLens分析标记角色,发现代表性剪枝方法存在标记角色偏差但与下游性能无直接关联,优化角色分配后表明保留非活跃标记可维持或提升性能,为剪枝方法优化提供了新视角。

Comments Accepted to ECCV 2026 workshop, UniWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03387 2026-08-06 cs.RO 版本更新 50%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 效率与部署 :language model(abstract)

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10082 2026-08-06 cs.CV cs.MM cs.RO eess.IV 版本更新 50%

Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage Distillation

通过双阶段蒸馏实现无约束事件-图像特征匹配的无标签目标域适应

Zhonghua Yi, Hao Shi, Qi Jiang, Yufan Zhang, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) National University of Defense Technology(国防科技大学) Ant Group(蚂蚁集团)

专题命中 效率与部署 :pretraining(abstract)

AI总结 研究针对无约束事件-图像特征匹配问题,提出双阶段训练范式,先进行无标签蒸馏预训练,再引入极线引导自蒸馏框架,在新的跨模态评估基准上实验,取得领先的姿态估计性能。

Comments Accepted to ACM MM 2026. The source code and benchmark will be made publicly available at https://github.com/ZhonghuaYi/nexus2-official

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15042 2026-08-06 cs.DC cs.OS 版本更新 50%

Determinism-Preserving GPU Spatial Sharing with Vitamin-E

高效GPU空间共享中的性能隔离与语义确定性

Zhenyuan Yang, Wenxin Zheng, Mingyu Li, Haibo Chen

专题命中 效率与部署 :LLM(abstract)

AI总结 本文提出CoGPU系统,通过引入GPU协程实现逻辑到物理资源的解耦,解决GPU空间共享中的资源利用率、性能隔离与语义确定性三重矛盾,提升多租户环境下的训练吞吐量和推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01693 2026-08-06 cs.CV 版本更新 50%

From Understanding to Erasing: Towards Complete and Stable Video Object Removal

从理解到擦除:迈向完全且稳定的视频对象移除

Dingming Liu, Wenjing Wang, Chen Li, Jing Lyu, Haotian Dong

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出通过外部和内部指导机制,结合视觉基础模型与视频扩散模型,提升视频对象移除的物理和语义理解能力,实现清晰且连贯的移除效果,并建立首个真实世界基准测试。

Comments Code: https://github.com/WeChatCV/UnderEraser

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18266 2026-08-06 cs.CV 版本更新 50%

YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos

YouTube-Occ:从YouTube视频学习室内3D语义占据预测

Haoming Chen, Lichen Yuan, TianFang Sun, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对室内3D语义占据预测数据稀缺的问题,提出YouTube-Occ框架,通过自动化数据流水线与双对齐预训练策略,在NYUv2等基准上实现性能提升,代码数据将公开。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 24 篇

2608.05120 2026-08-06 cs.LG cs.CE cs.SC 新提交 92%

DASyR-LLM: Domain-Aware Symbolic Regression with LLMs for Kinetic Model Discovery

DASyR-LLM:基于大语言模型的领域感知符号回归用于动力学模型发现

Roberto Aliaga Medina, Paulina Quintanilla, Antonio del Rio Chanona

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出了DASyR-LLM框架,将LLM嵌入迭代SR算法,通过领域知识减少41.7%-79.3%的动力学模型发现迭代次数,预测性能与现有方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02567 2026-08-06 cs.SE cs.AI 版本更新 92%

Feedback Loops and Code Perturbations in LLM-based Software Engineering: A Case Study on a C-to-Rust Translation System

基于LLM的软件工程中的反馈循环与代码扰动:一种C到Rust翻译系统的案例研究

Martin Weiss, Jesko Hecking-Harbusch, Jochen Quante, Matthias Woehrle

机构 * Otto von Guericke University(奥托·冯·格里克大学) Bosch Research(博世研究)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了反馈循环、LLM选择和代码扰动对C到Rust翻译系统性能的影响,发现反馈循环可减少模型差异并提升系统鲁棒性。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04854 2026-08-06 eess.SY cs.SY 新提交 90%

Transforming Remanufacturing Automation with Large Language Models: A Forward-Looking Analysis with Case Studies

用大语言模型推动再制造自动化:前瞻性分析与案例研究

Chang Liu, Sara Behdad, Prabhakar Pagilla, Xiao Liang, Minghui Zheng

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文通过前瞻性分析与案例研究,提出ReManGPT概念框架,探讨大语言模型在再制造自动化中的应用,以应对报废产品变异性等挑战,同时分析其部署障碍与未来方向。

Journal ref Robotics and Computer-Integrated Manufacturing 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06709 2026-08-06 cs.SE 90%

Using Large Language Models to Support Automation of Failure Management in CI/CD Pipelines: A Case Study in SAP HANA

利用大型语言模型支持CI/CD流水线故障管理的自动化:SAP HANA案例研究

Duong Bui, Stefan Grintz, Alexander Berndt, Thomas Bach

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究利用大型语言模型结合历史故障数据,实现了CI/CD流水线故障管理的自动化,准确率达92.1%。

Comments Accepted for publication in the proceedings of SANER 2026

Journal ref 2026 IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER), Limassol, Cyprus, 2026, pp. 524-535

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26233 2026-08-06 cs.AI cs.CY 版本更新 88%

Assessing and Explaining the Persuadability of Large Language Models as Legal Decision Tools

说服性与大语言模型作为法律决策工具

Oisin Suttle, David Lillis

机构 * School of Law Criminology Maynooth University Maynooth Ireland School of Computer Science University College Dublin Dublin Ireland Criminology Maynooth University School of Computer Science University College Dublin

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究大语言模型在法律决策中的说服性,分析其对法律论点的响应机制及影响因素,探讨模型在法律和行政领域的应用可行性。

Comments v2 is the conference version, accepted for the Proceedings of the 21st International Conference on Artificial Intelligence and Law (ICAIL 2026), (DOI: 10.1145/3836937.3837003). v3 is a substantially extended version for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00285 2026-08-06 cs.CL 版本更新 88%

Enhancing Trustworthy Clinical Diagnosis Decision-Making in Large Language Models via Etiology-Aware Attention Supervision

通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性

Peixian Li, Yu Tian, Ruiqi Tu, Chengkai Wu, Jingjing Ren, Jingsong Li

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04307 2026-08-06 cs.CL cs.AI cs.MA 新提交 88%

MIDAS: Multi-LLM Iterative Data-Adaptive Summarization

MIDAS:多大语言模型迭代数据自适应摘要生成

Karen Lee, Dhanashree Balaram, Seojun Shon, Umair Rasheed

机构 * Volkswagen Group Innovation(大众集团创新公司)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有自动提示词优化方法无法适配多样摘要需求的问题,提出多大语言模型迭代数据自适应摘要生成框架MIDAS,在企业客户工单摘要任务中优于CriSPO等方法,还具备跨模型与跨领域泛化能力。

Comments Accepted at the 20th International Conference on Document Analysis and Recognition (ICDAR 2026). 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21084 2026-08-06 cs.CL cs.AI 版本更新 87%

MediRec: Enhancing Chinese Medication Recommendation with Explainable Clinical Reasoning

代谢性疾病出院药物推荐中的大型语言模型应用

Juntao Li, Haobin Yuan, Ling Luo, Yuanyuan Sun, Jian Wang, Hongfei Lin

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在中文代谢性疾病出院药物推荐中的应用,评估了多种LLM家族的性能,发现监督微调虽提升效果,但仍有改进空间。

Comments Accepted by NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23054 2026-08-06 cs.CL cs.AI cs.LG 版本更新 83%

DeepImagine: Clinical Trial Outcome Prediction via Stepwise Local Counterfactual Imaginations

DeepImagine: 通过连续反事实想象学习生物医学推理

Youze Zheng, Jianyou Wang, Yuhan Chen, Matthew Feng, Longtian Bao, Hanyuan Zhang, Maxim Khan, Aditya K. Sehgal, Christopher D. Rosin, Umber Dube, Ramamohan Paturi

机构 * Laboratory for Emerging Intelligence, University of California, San Diego(新兴智能实验室,加州大学圣地亚哥分校) Department of Dermatology, University of California, San Diego(皮肤科系,加州大学圣地亚哥分校) University of Chicago(芝加哥大学) Elsevier(艾尔斯特出版社)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DeepImagine框架,通过连续反事实想象训练语言模型进行生物医学推理,利用反事实对偶和强化学习提升临床试验预测性能,展示模型在生物医学领域的可解释性改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04271 2026-08-06 cs.SE cs.CL 新提交 83%

LLM-based Vulnerability Discovery in Business Process Documentation

基于大语言模型的业务流程文档漏洞发现

Ben Falchuk, Himanshu Garg, Euthimios Panagos, Sioan Zohar

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究将LLMs应用于MIRABELLE系统,通过实验测试多种LLMs在业务流程文档漏洞检测各阶段的性能,以实现从业务流程表示中识别业务逻辑漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02228 2026-08-06 cs.LG cs.CL 版本更新 82%

Unforgettable Generalization in Language Models

语言模型的不可遗忘泛化

Eric Zhang, Leshem Choshen, Jacob Andreas

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究探究语言模型通过随机标签微调遗忘技能时的行为差异,发现遗忘泛化程度与初始预测置信度和训练数据表示变异性相关,且遗忘为浅层,凸显技能移除的难度与不可预测性。

Comments 18 pages, 9 figures, published in First Conference on Language Modeling 2024

Journal ref First Conference on Language Modeling (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05134 2026-08-06 cs.HC 新提交 80%

DeepConnect: A Visual Analytics System for Bridging Interdisciplinary Research Collaborations

DeepConnect:用于搭建跨学科研究合作的可视分析系统

Yingchaojie Feng, Zekai Shao, Yiqun Sun, Yixuan Tang, Anthony K. H. Tung

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 DeepConnect是一种LLM增强的可视分析系统,可解决跨学科合作启动难的问题,通过转化合作目标、检索论文、可视化比较研究者等功能,经评估可用于互补团队组建等场景。

Comments 11 pages, 7 figures, and 1 table. Accepted at IEEE VIS 2026; to appear in IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06230 2026-08-06 cs.CL cs.AI 79%

Overview of CHIP 2025 Shared Task 2: Discharge Medication Recommendation for Metabolic Diseases Based on Chinese Electronic Health Records

Juntao Li, Haobin Yuan, Ling Luo, Tengxiao Lv, Yan Jiang, Fan Wang, Ping Zhang, Huiyi Lv, Jian Wang, Yuanyuan Sun, Hongfei Lin

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Journal ref Health Information Processing. CHIP 2025. Communications in Computer and Information Science, vol 2884

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04366 2026-08-06 cs.CR cs.AI 新提交 77%

Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework

对抗智能体系统中的知识篡改:一种拜占庭容错的安全协同RAG框架

Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对RAG系统面临的知识篡改攻击问题,提出拜占庭容错的安全协同RAG框架SecureCollaRAG,通过多源知识验证机制与动态GNN可信度评分实现攻击防护,在非IID数据下保持鲁棒性。

Journal ref Proceedings of the ACM Web Conference 2026, pages 2661-2672, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04968 2026-08-06 cs.LG 新提交 70%

EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement

EvolveNet:智能体自我改进的协作式工具链进化

Jun Nie, Yonggang Zhang, Qianshu Cai, Yiu-ming Cheung, Xinmei Tian, Bo Han

机构 * Hong Kong Baptist University(香港浸会大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 EvolveNet提出协作式工具链进化范式,通过数据本地智能体的程序适配组合实现共享工具链改进,在五类任务场景均获增益,异构工作负载下效果更显著。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04589 2026-08-06 cs.CV cs.AI 新提交 70%

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

2026年EgoVis首届EgoCross挑战赛:跨域自我中心视频问答

Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Yingcong Chen, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie, Takuya Murakawa, Toru Tamaki, Yi Wen, Zhenglin Du, Zhengyang Li, Lingling Li, Licheng Jiao, Wenping Ma

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文介绍2026年EgoVis研讨会举办的首届EgoCross跨域自我中心视频问答挑战赛,含两个赛道,共获1500余份提交,公布结果与获胜方案,资源公开以推进相关研究。

Comments 1st EgoCross challenge @ EgoVis workshop, CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02323 2026-08-06 cs.SE 版本更新 67%

ECLAIR: A Causally-Grounded AI Framework for Scientific Discovery in Empirical Software Engineering

ECLAIR:一种用于实证软件工程科学发现的因果基础AI框架

Alejandro Velasco, Daniel Rodriguez-Cardenas, Dipin Khati, David N. Palacio, Denys Poshyvanyk

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 该研究提出因果基础AI框架ECLAIR,将LLMs整合到软件工程科学过程各阶段,通过案例研究揭示提示设计对LLMs代码生成准确率的影响,为AI辅助软件工程实证研究提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13099 2026-08-06 cs.CV 版本更新 67%

Industrial Synthetic Segment Pre-training

工业合成片段预训练

Shinichi Mae, Hirokatsu Kataoka, Ryousuke Yamada, Yoshihiro Fukuhara, Risa Shinoda, Christian Rupprecht

机构 * TICO-AIST Cooperative Research Lab for Advanced Logistics, Japan(TICO-AIST先进物流联合研究实验室,日本) National Institute of Advanced Industrial Science and Technology (AIST), Japan(日本国家先进工业科学与技术研究院) Visual Geometry Group, University of Oxford, UK(牛津大学视觉几何组)

专题命中 领域大模型 :foundation model(abstract,abstract_cn)

AI总结 该研究提出基于FDSL的InsCore合成数据集,在不使用真实图像的情况下预训练的分割模型,在5个领域的表现与ImageNet-21k预训练模型相当,解决了工业分割模型对真实图像的依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04472 2026-08-06 cs.CV cs.AI cs.CL 新提交 62%

EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

EndoVLM:一种通过解剖学引导的稀疏性与渐进式对齐实现的内窥镜视觉-语言预训练模型

Zhenyu Yi, Jianwei Xu, Yue Hu, Zhongwei Qiu, Sijing Li, Liang Huang, Bin Lv, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) The First Affiliated Hospital of Zhejiang Chinese Medical University(浙江中医药大学附属第一医院) Shanghai Jiao Tong University(上海交通大学) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 领域大模型 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了EndoVLM这一内窥镜视觉-语言预训练模型,通过解剖学引导的稀疏池化、渐进式语义感知对齐等技术,在34.8万例内窥镜检查数据上预训练,其性能优于现有基础模型且具备零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04193 2026-08-06 cs.CL cs.AI 新提交 62%

Patients-like-me: A Variational LM--GNN Framework for Explainable Clinical Prediction

Patients-like-me:用于可解释临床预测的变分LM-GNN框架

Xinyu Wang, Yixuan Li, Hanwei Wu, Qincheng Lu, Chi-Kuang Yeh, Xiao-Wen Chang, Ziyang Song

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Georgia State University(佐治亚州立大学) Ohio University(俄亥俄大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Patients-like-me(PLM)这一LM-GNN统一框架,结合局部患者语义与全局队列结构,在MIMIC-III、MIMIC-IV上优于现有方法,可提供可解释的参考患者归因,且计算开销适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02491 2026-08-06 cs.AI 版本更新 57%

Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions

长期测量:迈向对人机交互的纵向理解

Nicole Mitchell, Dhruv Agarwal, Maty Bohacek, Remi Denton, Roma Patel

机构 * Google Research(谷歌研究院) Cornell University(康奈尔大学) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本研究针对语言模型融入生活引发的长期人机交互风险,结合社会科学测量与NLP计算方法,提出通过长期测量建模人类行为变化,实现问题行为在线检测以缓解用户长期风险。

详情

展开后加载摘要…

URL PDF HTML 收藏