arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-14 至 2026-08-14 共收录 320 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 81 篇

2510.03880 2026-08-14 cs.CV 版本更新 75%

Exploring Instruction Data Quality for Explainable Image Quality Assessment

探索可解释图像质量评估的指令数据质量

Yunhao Li, Sijing Wu, Jun Jia, Kang Fu, Qi Jia, Yucheng Zhu, Wei Sun, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究针对可解释图像质量评估任务,提出Q-Selector数据选择框架,仅用10%训练数据就达到全数据微调的102.1%和103.7%性能,证明指令数据存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13120 2026-08-14 cs.AI 新提交 70%

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo:基于多轮交互反馈的自更新进化梯度

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

机构 * Tencent Cloud Andon(腾讯云Andon) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交 70%

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12984 2026-08-14 cs.MA cs.CL 新提交 70%

Reconcile Once, Write Anytime: A Trust-Tiered Librarian and a Multi-Agent Writer for Drift-Free, Point-in-Time Research

一次对账,随时撰写:用于无漂移、时点研究的信任分层图书馆与多智能体撰写器

Xing Zhang, Yanwei Cui, Guanghui Wang, Peiyang He

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出双层智能体系统,通过信任分层图书馆与多智能体撰写器分离知识库与报告撰写,消除报告矛盾与漂移,实验验证其在多指标、多场景下的有效性与效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12895 2026-08-14 cs.AI cs.MA 新提交 70%

Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence

智能体行为契约II:不假设独立性的组合可靠性验证

Varun Pratap Bhardwaj, Garima Singh, Arun Pratap Bhardwaj

机构 * Qualixar

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体系统组合可靠性的独立性假设开展验证,发现组件共享模型时正相关性会高估冗余度,提出无依赖假设的有限样本验证方法并通过扩充矩函数提升验证效果,配套任意时间有效验证方法。

Comments 49 pages, 12 tables, 25 numbered definitions, 18 theorems with full proofs, six experiments, 65 references. Code, analysis scripts, and preregistration: https://github.com/qualixar/agentassert-abc

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12352 2026-08-14 cs.CY cs.AI cs.HC 新提交 70%

Why AI Governance Frameworks Are Hard to Adopt: A Role-Based Stress Test of the NIST AI RMF

为何AI治理框架难以被采用:对NIST AI RMF的基于角色的压力测试

Joseph R. Simons, David A. Broniatowski

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过对NIST AI RMF的基于角色的压力测试,发现AI治理框架的核心问题在于活动能否产生治理价值,角色、部署类型对治理价值有显著影响,仅当治理价值与结构适配性同时满足时才易实现风险降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09539 2026-08-14 cs.CL 版本更新 70%

Mawqif-XT: An Arabic Benchmark Dataset for Cross-Target Stance Detection

Mawqif-v2:面向跨目标立场检测的阿拉伯语基准数据集

Rasha Albalawi, Nuha Albadi, Hamzah Luqman, Maram Kurdi, Saad Ezzini, Asma Yamani, Ahmed Ashraf

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Mawqif-v2阿拉伯语基准数据集,含996条标注推文,用于评估跨目标立场检测的模型泛化能力,并建立基线结果以支持可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05485 2026-08-14 cs.AI 版本更新 70%

Auditable Agents

可审计代理

Yi Nian, Aojie Yuan, Haiyue Zhang, Jiate Li, Li Li, Xiyang Hu, Hua Wei, Xiongye Xiao, Chaowei Xiao, Yue Zhao

机构 * FORTIS Lab, University of Southern California(南加州大学FORTIS实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨了可审计代理系统的核心问题,提出五个可审计性维度和三种机制类别,通过实证证据证明代理系统需具备审计能力才能实现问责。

Comments 24 pages, 1 figure. Extended version. A condensed 4-page version appears in the Proceedings of the ACM AI Leadership Summit 2026 (Visionary Papers track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17449 2026-08-14 cs.CL 版本更新 70%

SLAyiNG: A Diverse and Community-validated Dataset of Queer Slang

SLAyiNG:一个经社群验证的多元酷儿俚语数据集

Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 针对酷儿语言处理偏差问题,本文提出首个经社群验证的英语酷儿俚语数据集Slaying,揭示语言模型对酷儿社群无表征偏差但存在语言偏差等发现,可提升酷儿用户NLP体验。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13441 2026-08-14 cs.CV 新提交 67%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13267 2026-08-14 cs.CL cs.AI cs.CV cs.LG 新提交 67%

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) University of Technology Nuremberg(纽伦堡工业大学) University of Southern California(南加利福尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。

Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12635 2026-08-14 cs.AR 新提交 67%

GateTruth: Auditing the Rigor of RTL Design Benchmarks via Mutation Testing

GateTruth:通过变异测试审计RTL设计基准的严谨性

Meet Bhadra

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12569 2026-08-14 cs.IR 新提交 67%

Test-Time Optimization of Query Embeddings with Ranking Aware Reward Maximization

基于排名感知奖励最大化的查询嵌入测试时优化

Tianyu Chen, Jiaxing Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究提出TTT-Embed框架,将排名奖励提炼为轻量学习向量,无需访问模型权重即可优化,在多嵌入模型和MTEB任务上显著提升测试时检索效果,且具备良好泛化性,解决了灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12549 2026-08-14 cs.CV 新提交 67%

StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos

StrAD:面向长视频音频描述生成的流式方法与基准

Julian Spravil, Sebastian Houben, Sven Behnke

机构 * Fraunhofer IAIS(弗劳恩霍夫智能分析与信息系统研究所) University of Bonn(波恩大学) University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用科学大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Robotics, University of Bonn(波恩大学机器人中心)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 针对长视频音频描述生成的需求,研究提出首个流式方法StrAD,构建了涵盖多类型全长视频的基准,其微调模型在相关任务上达到先进性能,为扩大无障碍覆盖提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13714 2026-08-14 physics.optics physics.app-ph 版本更新 67%

Precision Hamiltonian Encoding in Full-Aperture Spatial Photonic Ising Machines

高保真空间光子伊辛机通过精确波前塑形

P. S. Karavelas, D. Karanikolopoulos, L. Mouchliadis, A. K. Spiliotis, N. L. Pitanios, S. Gentilini, D. Veraldi, P. Charlesworth, D. Pierangeli, J. Sakellariou, N. G. Berloff, S. I. Tsintzos, C. Conti, P. G. Savvidis

专题命中 评测与基准 :SLM(abstract,abstract_cn)

AI总结 本文提出了一种高精度全孔径校准方案和交互归一化方法,实现了高保真度的空间光子伊辛机,突破了传统限制,实现了更大规模的光子伊辛计算。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05018 2026-08-14 cs.AI cs.LG 版本更新 62%

Short-term load forecasting under EU-AI Act Requirements in Safety-Critical Environments: Results from a 41-day live challenge on the aggregated German transmission-grid load

安全关键环境下符合欧盟AI法案要求的短期负荷预测:德国输电电网聚合负荷41天在线挑战赛结果

Thomas Bartz-Beielstein, Inalbek Akiev, Lalo Mohamad

机构 * THK-AI Research Cluster(THK-AI研究集群)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过41天在线挑战赛验证,符合欧盟AI法案要求的spotforecast2-safe短期负荷预测流程,在德国输电电网聚合负荷预测中优于ENTSO-E基线,其本地模型性能可与超1亿参数的chronos-2等大模型媲美。

Comments Version 3. 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09700 2026-08-14 cs.LG cs.AI 版本更新 62%

Cueless EEG imagined speech for subject identification: dataset and benchmarks

无提示EEG想象言语用于受试者识别:数据集与基准测试

Ali Derakhshesh, Zahra Dehghanian, Reza Ebrahimpour, Hamid R. Rabiee

机构 * Department of Computer Engineering, Sharif University of Technology(沙斐大学计算机工程系) Center for Cognitive Science, Institute for Convergence Science and Technology (ICST)(融合科学与技术研究所认知科学中心) Sharif University of Technology(沙斐大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出无提示EEG想象言语范式,通过自然选择和想象语义词实现高准确率的受试者识别,展示了其在脑机接口中的应用潜力。

Journal ref IEEE Transactions on Biometrics, Behavior, and Identity Science ( Volume: 8, Issue: 2, March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13337 2026-08-14 cs.LG 新提交 57%

Where You Measure Decides What You Measure: Position Selection in Ablation-Based SAE Evaluation

测量位置决定测量内容:基于消融的SAE评估中的位置选择

Valentin Noël

机构 * Devoteam(德孚替)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究发现基于消融的SAE评估中,测量位置的选择会影响结果,提出需统一测量位置的评估协议,修正方法仅需一行代码,且随语料库规模扩大问题更严重。

Comments 19 pages, 3 figures. Code and data: https://github.com/vcnoel/sae-artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13197 2026-08-14 cs.LG 新提交 57%

Beyond Simulated Benchmarks: Evaluating Motion Representations for Fall Detection Under Real-World Data Scarcity

超越模拟基准:真实世界数据稀缺下跌倒检测的运动表示评估

Timilehin B. Aderinola, Ilaria D'Ascanio, Luca Palmerini, Lorenzo Chiari, Jochen Klenk, Clemens Becker, Brian Caulfield, Georgiana Ifrim

机构 * University College Dublin (UCD)(都柏林大学学院) University of Bologna(博洛尼亚大学) Robert Bosch Hospital(罗伯特博世医院) Heidelberg University Hospital(海德堡大学医院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文针对真实世界数据稀缺下的跌倒检测,系统评估了不同运动表示的性能,发现高参数模型在模拟数据表现好但泛化差,增强的符号表示泛化能力最优,为可部署跌倒检测提供了关键参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12776 2026-08-14 cs.CL 新提交 57%

ViTOED: A Dataset for Target-Oriented Emotion Detection on Vietnamese Social Media Texts

ViTOED:面向越南社交媒体文本的定向情感检测数据集

Chanh Vo, Son T. Luu, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究构建了越南社交媒体定向情感检测数据集ViTOED,提出基于结构化情感图的基线方法并评估相关预训练模型,揭示了该任务的挑战及模型改进空间。

Comments Accepted for publication at 2026 International Conference on Multimedia Analysis and Pattern Recognition (MAPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12351 2026-08-14 cs.CY cs.AI 新提交 57%

Assessment Design in the GenAI Era: The X1-X2-X3 Assessment Pattern for Testing Students' AI Literacy, Learning Outcomes, and Reflection

生成式人工智能(GenAI)时代的评估设计:用于测试学生AI素养、学习成果与反思的X1-X2-X3评估模式

Riasat Islam, Thomas Roelleke

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文针对GenAI对在线评估的挑战,提出可复用的X1-X2-X3评估模式,用于测试学生AI素养等,为教师适配GenAI时代评估提供实践指导。

Comments 30 pages, 1 figure, 11 tables. Submitted to the following journal: Assessment & Evaluation in Higher Education (Taylor & Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14573 2026-08-14 cs.AI cs.SE 版本更新 57%

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

支付宝-PIBench:用于编码代理的现实支付集成基准测试

Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究旨在评估编码代理在支付宝支付集成任务中的表现,引入支付宝-PIBench基准测试,含九个产品项目和18个任务实例,分不同场景。通过评估六个编码代理模型得出评分通过率,发现有技能条件下RPR提升,为诊断模型能力和评估支付集成指导提供可控环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07820 2026-08-14 cs.RO cs.AI cs.CV cs.GR cs.SY eess.SY 版本更新 57%

SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control

SONIC:为自然人形全身体控进行超大规模运动追踪

Zhengyi Luo, Ye Yuan, Tingwu Wang, Chenran Li, Fernando Castañeda, Sirui Chen, Zi-Ang Cao, Jiefeng Li, David Minor, Qingwei Ben, Jinhyung Park, David Sami, Zi Wang, Xingye Da, Runyu Ding, Cyrus Hogg, Lina Song, Edy Lim, Eugene Jeong, Tairan He, Haoru Xue, Wenli Xiao, Simon Yuen, Jan Kautz, Yan Chang, Umar Iqbal, Linxi "Jim" Fan, Yuke Zhu

机构 * NVIDIA

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出了一种超大规模运动追踪方法,通过扩大模型容量、数据和计算资源,实现了一种能够产生自然且稳健全身体态的通用人形控制器,并展示了其在运动追踪任务中的可扩展性及在下游任务中的应用价值。

Comments Project page: https://nvlabs.github.io/SONIC/

Journal ref Science Robotics 11 (117), eaed4592 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12649 2026-08-14 cs.CY 新提交 50%

Proactive Computing

主动式计算

Joonhee Lee

专题命中 评测与基准 :foundation model(abstract)

AI总结 本综述定义主动式计算范式,区分其与相关计算类型,梳理技术使能因素与挑战,指出关键研究挑战为确定系统代表用户行动的时机、方式与可行性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 50%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 47 篇

2608.09696 2026-08-14 cs.AI 版本更新 92%

Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models

模型发现智能体:用于数据高效发现机制世界模型的大语言模型辅助贝叶斯实验设计

Kevin Murphy

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出模型发现智能体(MDA),结合LLM与贝叶斯机制,在少量干预下发现机制世界模型,在三类基准上实现数据高效模型学习与可靠干预预测的SOTA性能。

Comments v3: further improve app A (algorithm pseudocode), add new app G (further related work) - (main text unchanged)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29395 2026-08-14 cs.CV 版本更新 91%

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation

NaLA: 一种用于高质量3D场景生成的原生3D LLM布局代理

Cheng Wan, Yongsen Mao, Wenzheng Wu, Yuxuan Xie, Chucheng Xiang, Runze Wang, Xiang Zhang, Zhongyuan Liu, Rushi Dai, Yuan Liu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出NaLA,一种原生3D LLM布局代理,通过直接编码3D边界和资产到LLM中,采用粗到细预测机制,解决文本-3D模态差距导致的布局不合理问题,在生成质量和推理效率上优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://adamcwan.github.io/NaLA/. Code: https://github.com/adamcwan/NaLA-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22124 2026-08-14 cs.CL cs.DC 版本更新 91%

Toward Federated Large Language Models in Medicine: A Parameter-Efficient Framework for Privacy-Preserving, Multi-Institutional Adaptation

一种联邦学习和参数高效的大型语言模型在医学中的训练框架

Anran Li, Yuanyuan Chen, Wenjun Long, Yu Yin, Yan Hu, Hyunjae Kim, Weipeng Zhou, Yujia Zhou, Hongyi Peng, Yang Ren, Xuguang Ai, Zhenyue Qin, Ming Hu, Xiaoxiao Li, Han Yu, Yih-Chung Tham, Lucila Ohno-Machado, Hua Xu, Qingyu Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出Fed-MedLoRA框架,通过低秩适配器参数实现医学LLM的联邦学习,提升跨机构异质性下的模型收敛性和泛化能力。

Comments 41 pages, 11 tables, 3 figures; Just accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12915 2026-08-14 cs.DC cs.AI 新提交 90%

InFactPlanner: Planning Sustainable Geo-Distributed LLM Data Centers

InFactPlanner:可持续地理分布式大语言模型(LLM)数据中心规划

Nicoletta Tsiopani, Moysis Symeonides, George Pallis, Marios D. Dikaiakos

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 InFactPlanner是用于LLM推理的可持续地理分布式数据中心部署假设分析的决策支持框架,可通过多维度建模分析得出可持续性与延迟最优选择存在差异等结论。

Comments Author copy of paper published at 34th International Symposium on the Modeling, Analysis, and Simulation of Computer and Telecommunication System (MASCOTS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03089 2026-08-14 cs.LG cs.AI 版本更新 88%

Constitutional On-Policy Safe Distillation

宪法性在策略安全蒸馏

Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Yi Liu, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。

详情

展开后加载摘要…

URL PDF HTML 收藏