arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 713 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 173 篇

2607.25379 2026-08-04 cs.AI 版本更新 57%

Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response

具备网络能力的人工智能代理:漏洞、评估遏制与防御响应

Abu Bakar Siddik

机构 * Rajshahi University of Engineering & Technology(拉杰沙希工程技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究具备网络能力的人工智能代理的漏洞等问题,综合五类漏洞,以特定事件为案例研究,探讨遏制等控制措施,确定评估网络能力及其运行环境安全性的实际优先事项。

Comments 27 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05915 2026-08-04 cs.AI 版本更新 57%

PCBWorld: A Benchmark Environment for Engine-Grounded PCB Design Automation

PCBWorld:用于基于引擎的PCB设计自动化的基准环境

Hyungseok Song, Junseok Park, Won-Seok Choi, Seohui Bae, Han-Seul Jeong, Youngjoon Park, Soonyoung Lee

机构 * LG AI Research(LG人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究旨在改进PCB布线,介绍基于KiCad EDA引擎的开源环境PCBWorld及数据集PCBWorld-Bench,支持多种智能体。实验表明其中智能体性能优于基线,仅在合成板训练的强化学习策略可零样本迁移到真实板,有望提升布线能力。

Comments Accepted to the KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI (non-archival). Main text with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17020 2026-08-04 cs.CV cs.AI 版本更新 57%

FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning

FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Dingyi Lu, Chengyin Hu, Luwei Yang, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) University of Electronic Science and Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06055 2026-08-04 cs.AI 版本更新 57%

HUSH-Bench: Measuring Memory-Use Boundaries for Sensitive History in Conversational Agents

记忆何时应保持沉默:衡量记忆增强型对话代理的记忆使用边界

Lingxiang Xu, Jiaoyun Yang, Min Hu, Ning An

机构 * Hefei University of Technology(合肥工业大学) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出RBI-Eval框架,通过探针集比较模型在有/无敏感记忆时的行为差异,发现当前检索增强生成系统无法避免敏感记忆的不当整合,需在检索和生成阶段同时进行记忆感知决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17920 2026-08-04 cs.LG 版本更新 57%

SingLEM: Single-Channel Large EEG Model

SingLEM:单通道脑电大模型

Jamiyan Sukhbaatar, Satoshi Imamura, Ibuki Inoue, Shoya Murakami, Kazi Mahmudul Hassan, Seungwoo Han, Ingon Chanpornpakdi, Toshihisa Tanaka

机构 * Department of Electronic and Information Engineering, Tokyo University of Agriculture and Technology(电子信息工程系,东京农业科技大学) Department of Electronics and Communication Engineering, National University of Mongolia(电子与通信工程系,蒙古国立大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 SingLEM是一种自监督单通道EEG基础模型,通过71个公开EEG数据集预训练,在6项任务的严格评估中表现优于对比方法,支持灵活的EEG特征提取与空间分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02561 2026-08-04 cs.CV 新提交 50%

ReMiX-MAE: Learning Missing-Channel Cross-Modal Representations from RGB-Only Clinical Facial Videos for Sympathetic-Mediated Pain Assessment

ReMiX-MAE:从仅含RGB的临床面部视频中学习缺失通道跨模态表征以用于交感介导的疼痛评估

Nan Bi, Taoyue Wang, Lijun Yin, Vandana Sharma

机构 * School of Computing, Binghamton University(宾汉姆顿大学计算学院) SUNY Upstate Medical University(纽约州立大学上州医科大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出ReMiX-MAE框架,构建SMP数据集,在仅用RGB的疼痛评估任务中,其性能优于仅用RGB的基线,且在数据有限的临床场景中迁移能力更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02315 2026-08-04 cs.CV 新提交 50%

GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation

GEOID-Flood:用于洪水分割的大规模多模态基准数据集

Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo, Claudio Rossi, Edoardo Arnaudo

机构 * Fondazione LINKS(LINKS基金会) Politecnico di Torino(都灵理工大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究推出GEOID-Flood大规模多模态洪水分割基准数据集,评估发现基础模型优势适度,光学-SAR融合微调效果最佳,该数据集训练的模型迁移性更优。

Comments Accepted at ECCV 2026 - Terrabytes II Workshop, 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02001 2026-08-04 cs.SE 新提交 50%

VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection

VulnGym:面向代码智能体的仓库级漏洞检测基准测试

Kexing Ji, Jiachen Liu, Enze Hu, Cuiyun Gao, Keke Lian, Yongheng Liu, Lei Zhang, Tian Dong, Hao Chen, Wang Bin

专题命中 评测与基准 :LLM(abstract)

AI总结 研究人员提出VulnGym基准,解决现有基准难以评估代码智能体仓库级漏洞检测能力的问题,发现当前代码智能体在该检测及支撑追踪构建上仍存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01973 2026-08-04 cs.RO cs.CV 新提交 50%

Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis

Roomer:用于3D室内布局合成的基于对象的反射式模型编辑与修复

Lingwei Dang, Ziyan Qiu, Jiajia Cheng, Shishuo Shang, Zhenhao Zhang, Yufei Zhu, Qingxin Xiao, Pan Liu, Shenghui Huang, Yun Hao, Juntong Li, Qingyao Wu

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有室内布局生成器的局部违规问题,提出Roomer框架,通过视觉语言模型规划器与确定性求解器实现基于对象的局部修复,提升布局物理有效性与可用性且可跨生成器迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01948 2026-08-04 cs.CV 新提交 50%

Event ActivityNet: A Large-Scale Simulated-Event Benchmark for Untrimmed Action Understanding

Event ActivityNet:用于未修剪动作理解的大规模模拟事件基准

Cheng-Yao Hong, Ting-Wei Lin, Yun-Chung Lai, Hua-Wei Lee, Hwann-Tzong Chen, Tyng-Luh Liu

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出大规模模拟事件基准Event ActivityNet,解决长时序事件动作理解数据集不足的问题,建立基线并验证其预训练对原生事件微调的性能提升效果。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01906 2026-08-04 cs.CV 新提交 50%

Assessing the Benefits of Combining Advanced Deep Learning Techniques for Post-Disaster Building Damage Assessment from UAV Imagery

结合先进深度学习技术的优势,从无人机影像中评估灾后建筑物损毁情况

Huy Quang Ung, Guillaume Habault, Roberto Legaspi, Hao Niu, Lian Cao, Masato Taya

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出将CV模型与LVLM结合的混合框架,在RescueNet、FloodNet基准上评估,可准确统计灾后建筑物损毁情况,性能优于单独基准模型且仅需少量标注数据,相关资源公开。

Comments Accepted at ECMLPKDD 2026, 31 pages (including appendix), 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00844 2026-08-04 cs.CY cs.HC 新提交 50%

BoilerSketch: A TA-Supervised, Diagram-First GenAI Practice for Structured Diagrams in CS1/Early CS2

BoilerSketch:面向CS1/早期CS2的TA监督、以图表为核心的生成式AI结构化图表实践

Ethan Dickey, Vivan Tiwari, Anvit Sinha, Andres Bejarano

专题命中 评测与基准 :prompting(abstract)

AI总结 BoilerSketch是面向CS1/早期CS2的TA监督式生成式AI实践,通过双面板交互模型生成结构化Mermaid图表,经21名教学人员评估,三分之二认为其对概念理解和支持任务有中等以上帮助,为入门计算课程提供了实用AI支持方案。

Comments 9 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00775 2026-08-04 cs.RO cs.CV cs.HC 新提交 50%

ORCESTRA: VLM-driven Visual Robot programming in Mixed Reality

ORCESTRA:基于视觉语言模型的混合现实视觉机器人编程系统

Ivan Snegirev, Elizaveta Semenyakina, Mikhail Konenkov, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科技学院) R&D Center, MWS(MWS研发中心)

专题命中 评测与基准 :language model(abstract)

AI总结 ORCESTRA是一款混合现实系统,通过无代码路径点示教和语言引导控制实现机器人数字孪生编程,支持多种异构机器人,其混合现实验证可作为语言引导机器人物理部署前的安全层。

Comments 4 page, 3 figures, 1 table, ISMAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00736 2026-08-04 cs.CV 新提交 50%

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations

MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试

Mridula Vijendran, Shuang Chen, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。

Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00652 2026-08-04 cs.RO 新提交 50%

Assistant Placement Aria: A Benchmark for Egocentric Placement Assistance

助手放置基准Aria:面向以自我为中心的放置辅助任务的基准

Amir Belder, Gonçalo Dias Pais, Refael Vivanti, Omri Carmi, Daniel DeTone, Oren Shrout, Ido Gattegno, Ayellet Tal

机构 * Reality Labs, Meta inc.(Meta公司现实实验室) Technion, institute of technology(以色列理工学院) Sensei

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出首个虚拟放置基准Assistant Placement Aria,涵盖三类以人为中心的放置任务,在基准上评估了多个基础模型,推动虚拟放置领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00105 2026-08-04 cs.CV q-bio.QM 新提交 50%

What Carries the Signal in Pathology Foundation-Model Atlases? A Patient-Level Controlled Benchmark in Breast Cancer

病理基础模型图谱中的信号由什么承载?乳腺癌的患者级对照基准测试

Chimdi Walter Ndubuisi

机构 * University of Missouri(密苏里大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究以乳腺癌患者为单位开展对照基准测试,发现病理基础模型的信号由嵌入而非几何机制承载,嵌入在多数基因程序预测中优于组织组成,驱动基因计数指标无显著预测性。

Comments 40 pages, 7 figures, 10 tables. Supplementary Information (16 pages) included as an ancillary file. Segmentation outputs obtained under the Aignostics Research Access Programme; OpenTME data at https://huggingface.co/datasets/Aignostics/OpenTME

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04529 2026-08-04 cs.IR 版本更新 50%

Evaluation and Explainability of Unsupervised Scholarly Collaboration Recommendations

无监督学术合作推荐的评估与可解释性

Md Asaduzzaman Noor, John W. Sheppard, Jason A. Clark

专题命中 评测与基准 :language model(abstract)

AI总结 研究无监督、基于内容的学术合作推荐,比较TF-IDF基线、主题模型和基于嵌入的检索等方法,引入受限设置评估模型,还从两视角考察可解释性,展现不同方法差异及权衡。

Comments 6 pages, 2 figures, Submitted to ICMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30514 2026-08-04 cs.CV 版本更新 50%

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

3D场景自适应轨迹可控的人体图像动画与相机运动

Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta

机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) Ministry of Education(教育部) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) University of Warwick(沃林格大学) Zhejiang Yuexiu University(浙江越秀大学) University of Surrey(萨里大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25806 2026-08-04 cs.CV 版本更新 50%

An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset?

聚焦女性安全分析:多模态数据集能否增强VAD模型?

Sangeeta ., Maddikuntla Sai Prajwal, Debi Prosad Dogra, Kamalakar Vijay Thakare, Hyungjoo Jung, Ig-Jae Kim, Heeseung Choi

机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)

专题命中 评测与基准 :LLM(abstract)

AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21930 2026-08-04 cs.SE 版本更新 50%

PITMuS: A Tool for Automated Bug Dataset Generation via Source-Level Mutant Reconstruction

PITMuS: 通过源级变异体重建实现自动化bug数据集生成工具

Tasfia Tasnim, Soneya Binta Hossain

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出PITMuS工具,通过源级变异体重建生成自动化bug数据集,解决现有工具生成的变异体难以复现和利用的问题,为bug定位和修复技术提供结构化数据支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05637 2026-08-04 cs.SE 版本更新 50%

Real Faults in Model Context Protocol (MCP) Software: a Comprehensive Taxonomy

模型上下文协议(MCP)软件中的真实故障:一种全面的分类

Mina Taraghi, Mohammad Mehdi Morovati, Foutse Khomh

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文首次提出MCP服务器故障的分类,通过实证研究识别出五个高层故障类别,揭示MCP特定故障与非MCP故障的区别,为提升AI软件系统的可靠性提供依据。

Comments Revised version following peer review. Expanded methodological details, practitioner-survey validation, statistical analyses, and discussion; main conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14546 2026-08-04 cs.RO 版本更新 50%

QuASH: Using Natural-Language Heuristics to Query Visual-Language Robotic Maps

QuASH:使用自然语言启发式方法查询视觉语言机器人地图

Matti Pekkanen, Francesco Verdoja, Ville Kyrki

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出QuASH方法,利用自然语言启发式处理查询相关的语言空间,训练分类器划分环境,提升地图和图像的可查询性,该方法与表示及编码器无关且训练量有限。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 145 篇

2603.13418 2026-08-04 cs.LG cs.AI 版本更新 94%

GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models

GPrune-LLM: 为大语言模型的通用性感知结构剪枝

Xiaoyun Liu, Divya Saxena, Jiannong Cao, Yuqing Zhao, Yiying Dong, Penghui Ruan

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong(香港理工大学计算机系) School of Artificial Intelligence and Data Science, IIT Jodhpur(IIT朱罗浦人工智能与数据科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPrune-LLM框架,通过识别神经元在不同分布下的行为差异,改进结构化剪枝方法,提升模型在分布外任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00922 2026-08-04 cs.DC 新提交 93%

From Cloud to Crowd: Democratizing LLM Service with Decentralized Edge Collaboration for RAG

从云端到人群:通过去中心化边缘协作实现面向检索增强生成(RAG)的大语言模型服务民主化

Jiaxing Li, Hengzhi Wang, Feng Wang, Chi Xu, Danyang Song, Ruixiao Zhang, Edith C. H. Ngai, Jiangchuan Liu

专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出DEFRAG系统,通过异构边缘设备的去中心化协作优化RAG的检索与生成,缩小SLM与LLM的准确率差距,大幅降低成本并提升吞吐量,助力边缘LLM服务民主化。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00481 2026-08-04 cs.AI 新提交 92%

F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models

F-WANDA:用于大语言模型可持续部署的Fisher重加权后训练剪枝方法

Himanshu Mishra

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 效率与部署 :language model(title,abstract);post-training(title,abstract);large language model(title);LLM(abstract,abstract_cn)

AI总结 F-WANDA是WANDA的改进后训练剪枝方法,通过Fisher重加权分配保留预算,在LLAMA-2-7B上实现更优MMLU指标且能耗仅为SPARSEGPT的1/3,处于性能与剪枝成本的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15622 2026-08-04 cs.CV cs.LG 版本更新 92%

AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型

Yiwei Zhao, Yi Zheng, Huapeng Su, Jieyu Lin, Stefano Ambrogio, Cijo Jose, Michael Ramamonjisoa, Patrick Labatut, Barbara De Salvo, Chiao Liu, Phillip B. Gibbons, Ziyun Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 效率与部署 :LLM(title_cn,summary_cn);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01655 2026-08-04 cs.DC 新提交 92%

PrefixPlace: Provable Prefix Key-Value Placement for Large Language Model Serving under Heterogeneous Compute and Transfer Costs

PrefixPlace:异构计算与传输成本下大语言模型服务的可证明前缀键值放置方案

Zhiyu Wang, Rajkumar Buyya

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对异构计算与传输成本下LLM前缀KV放置的次优问题,提出PrefixPlace规划器,其性能接近最优且效率高,可提升RAG等场景的成本节省效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02244 2026-08-04 cs.DC cs.SY eess.SY 新提交 91%

Efficiency and Cost Alignment in Batched LLM Serving via Resource-Fair Scheduling

通过资源公平调度实现批量大语言模型(LLM)服务的效率与成本对齐

Dayi Yao, Zijie Zhou

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文针对批量LLM服务中异构请求导致的资源分配低效问题,提出ISJL算法,实现高吞吐量的同时对齐最大驱动批次成本与token计量收入,达到3/4的竞争比下界,平衡了FCFS与LJF的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01250 2026-08-04 eess.SY cs.SY 新提交 91%

Smoothing the Ramp, Not the Peak: Scheduling-Induced Power Dynamics of LLM Inference and Their Grid-Scale Consequences

平滑斜坡而非峰值:LLM推理的调度诱导功率动态及其电网级后果

Pan Li, Yize Chen, Xia Miao, Dai Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究揭示LLM分块预填充调度可降低功率斜坡速率,随系统饱和度提升效益增大,经转化为电网调节备用采购问题后,可减少电网快速斜坡备用容量,为运营商提供无成本需求侧塑形工具。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00086 2026-08-04 cs.CV cs.AI cs.CL cs.LG 版本更新 91%

Hierarchical Pre-Training of Vision Encoders with Large Language Model

基于大语言模型的视觉编码器分层预训练

Eugene Lee, Ting-Yu Chang, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee

机构 * University of Cincinnati(辛辛那提大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。

Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏