arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 686 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 47 篇

2604.26917 2026-08-25 cs.CV 版本更新 71%

AnimateAnyMesh++: A Flexible Feed-Forward Framework for High-Fidelity Text-Driven Mesh Animation

AnimateAnyMesh++: 一种灵活的4D基础模型用于高质量文本驱动的网格动画

Zijie Wu, Chaohui Yu, Fan Wang, Xiang Bai

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab, Hangzhou, China(湖畔实验室) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

专题命中 预训练与数据 :foundation model(title)

AI总结 本文提出AnimateAnyMesh++,通过扩展数据集、改进架构和生成能力,实现高质量文本驱动的网格动画,提升了轨迹重建和几何保真度。

Comments 15 pages, TPAMI 2026 accepted, code url: this https URL (https://github.com/JarrentWu1031/AnimateAnyMesh-pp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18689 2026-08-25 cs.CL cs.AI 版本更新 71%

Aslema at NADI 2026: Data Augmentation for Intent Recognition and Slot Filling

Aslema 参与 NADI 2026:基于少样本的 SLU 增强方法

Tajwaar Shafiq, Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI;large language model(comments);language model(comments)

AI总结 Aslema 系统参与 NADI 2026 共享任务 5,通过微调模型及合成数据增强(含文化适配语句生成与语音克隆)提升性能,在官方测试集槽填充排第1、意图识别排第4,将公开脚本与合成数据集。

Comments LLMs, Native, Arabic LLMs, Augmentation, Multilingual, Multimodal, Language Diversity, Contextual Understanding, Minority Languages, Culturally Informed, Foundation Models, Large Language Models, Audio Models, Omni Models, Slot Filling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21895 2026-08-25 cs.CR cs.AI 新提交 70%

Breaking the Assumptions: Auditing Input-Side Jailbreak Defenses Against Semantic Attacks

打破假设:针对语义攻击的输入端越狱防御审计

Aaditya Pratap, Harsh Kasyap, Somanath Tripathy

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对本地部署大语言模型的输入端越狱防御开展审计,追溯防御失效的假设根源,在6款14B至35B参数的开源权重模型上,用100条来自40余公开源的越狱提示完成13800条评估记录的测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16053 2026-08-25 cs.CL eess.AS 版本更新 70%

Agentic-DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

DuplexGen:为合成对话语音解耦内容、时序与声学

Pengcheng Wang, Sheng Li, Jiyi Li, Takahiro Shinozaki

机构 * Institute of Science Tokyo(科学东京大学) Hokkaido University(北海道大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 DuplexGen框架通过解耦对话的内容、时序与声学,生成更贴近真实对话的合成语音,构建了带多类标注的医患对话语料库,性能优于传统拼接式合成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09737 2026-08-25 cs.LG 版本更新 70%

System-Prompt Anchoring with Cross-Attention Layers

CALYREX:跨注意力层扩展变换器用于系统提示锚定

Li Lixing

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。

Comments Preprint. 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08793 2026-08-25 cs.CL cs.DB 版本更新 70%

LakeHopper: Knowledge-Aware Adaptation of Column Type Annotators across Data Lakes

LakeHopper: 通过模型适应实现跨数据湖列类型注释

Yushi Sun, Xujia Li, Nan Tang, Quanqing Xu, Chuanhui Yang, Lei Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Ant Group(蚂蚁集团) HKUST(GZ)/HKUST(香港科技大学(广州)/香港科技大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 LakeHopper通过模型适应技术,有效解决跨数据湖列类型注释问题,减少注释需求并提升适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22701 2026-08-25 cs.RO 新提交 67%

Physics Filtering Favors the Generalization of Robot Learning

物理滤波有利于机器人学习的泛化

Jindou Jia, Shixuan Han, Meng Wang, Gen Li, Zihan Yang, Sicheng Zhou, Kexin Guo, Jianfei Yang, Xiang Yu, Wei Wang, Lei Guo

机构 * Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) National University of Singapore(新加坡国立大学) Beijing Aerospace Control Instrument Research Institute(北京航天测控仪器研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 该研究提出轻量、模型无关的 PhyFilter 反馈机制,无需海量训练数据,即可提升机器人在动态不确定性下的泛化能力,在四类机器人系统上验证了其有效性。

Comments Accepted by npj Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22485 2026-08-25 cs.CV 新提交 67%

HeatTok: Enhancing Remote Sensing Image Understanding via Thermodiffusion-based Tokenization

HeatTok:基于热扩散分词的遥感图像理解增强方法

Yingying Yan, Jiaqi Tang, Wei Wei, Qianzhou Wang, Jinjian Wu, Botong Geng, Jianmin Chen, Yuyang Xia, Lei Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出HeatTok分词器,结合热扩散聚合与G-MRoPE编码,在VRSBench、EarthVQA数据集上实现遥感图像理解的最优性能,保留对象级语义完整性。

Comments 19 pages (10 pages main text + appendix), 10 figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026), Rio de Janeiro, Brazil, November 10--14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21447 2026-08-25 cs.CV 新提交 67%

BIMScript: Material-Aware Structured Scene Programs for BIM Ingestion

BIMScript:用于BIM导入的材料感知结构化场景程序

Prakash Kondibhau Naikade, Thomas B. Moeslund, Andreas Møgelmose

机构 * Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

专题命中 预训练与数据 :LLM(abstract);language model(abstract)

AI总结 本文提出BIMScript,通过扩展布局语言属性、优化解码方案、改进粒度处理,实现合成扫描数据到BIM工具的端到端自动导入,且支持大语言模型驱动的可持续性推理。

Comments Project Page: see this https URL (https://bimscriptworld.github.io/BIMScript/); to be published in ECCV 2026 TwinWorld Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23270 2026-08-25 astro-ph.IM astro-ph.HE 新提交 67%

AI-Assisted Extraction of Follow-up Observations from GCN Circulars in Astro-COLIBRI

AI辅助从Astro-COLIBRI中的GCN Circulars提取后续观测数据

Fabian Schüssler, S. Bisero, M. Cellier, A. Ciric, B. Cornejo, I. Jaroschewski, A. Kaan Alkan, W. Kiendrébéogo, A. Saint-Paul

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 该研究开发了Astro-COLIBRI的AI辅助组件,可将GCN Circulars转换为结构化后续记录,经评估准确率达99.80%,已实时处理新Circulars并发布开源解析管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10744 2026-08-25 cs.CV cs.RO 版本更新 67%

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Traj-VLN:通过自回归轨迹生成学习像素空间交互

Changfei Fu, Guangcheng Chen, Aoxiang Gu, Haoxiang Liang, Wenjun Xu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng National Laboratory(鹏城国家实验室) Guangdong University of Technology(广东工业大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00416 2026-08-25 cs.RO 版本更新 67%

Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies

在部署中学习:面向通用机器人策略的机群规模强化学习

Yi Wang, Xinchen Li, Pengwei Xie, Pu Yang, Buqing Nie, Yunuo Cai, Qinglin Zhang, Chendi Qu, Jeffrey Wu, Jianheng Song, Xinlin Ren, Jingshun Huang, Mingjie Pan, Siyuan Feng, Zhi Chen, Jianlan Luo

机构 * Shanghai Innovation Institute(上海创新研究院) AGIBOT Finch Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :pretraining(abstract);post-training(abstract)

AI总结 提出LWD框架,通过机群规模的离线到在线强化学习,结合分布式隐式价值学习与伴随匹配Q学习,持续后训练通用视觉-语言-动作策略,在16台双臂机器人上实现95%平均成功率。

Comments No

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22196 2026-08-25 eess.AS cs.CL 新提交 57%

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

基于说话人 diarization 的转录校正缓解级联多说话人自动语音识别中的说话人泄漏

Hermann Yepdjio Nkouanga, Minwei Luo, Maggie Wigness, Suresh Singh

专题命中 预训练与数据 :foundation model(abstract);分类 cs.CL

AI总结 该研究针对级联多说话人自动语音识别中的说话人泄漏问题,提出基于剪枝的校正范式,利用预训练说话人 diarization 模型剪枝转录片段,在多语料库上实现 cpW ER 最高相对降低 29%,提升了转录可靠性。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22922 2026-08-25 cs.CL 新提交 57%

HelaBERT: Enhancing Sinhala Language Understanding with Dual Pooling Classification Head

HelaBERT:采用双池化分类头增强僧伽罗语理解能力

Thisen Ekanayake, Nisansa de Silva

机构 * University of Moratuwa(莫拉图瓦大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 该研究提出两款僧伽罗语BERT模型HelaBERT-Small与HelaBERT-Large,采用定制分词器,在四项下游分类任务上评估,提出双池化分类头并发布模型以推进僧伽罗语NLP研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22452 2026-08-25 cs.CL 新提交 57%

From Exposure to Expectation: Frequency, Surprisal, and Language Across Development in Spanish

从暴露到预期:西班牙语发展中的频率、意外性与语言

Francisco Portillo López

机构 * Universidad de Navarra(纳瓦拉大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 该研究通过两项西班牙语语料库研究,发现频率可预测儿童词汇习得年龄,意外性可预测成人阅读加工难度,二者在语言发展中作用不同。

Comments 30 pages; 4 figures; 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05916 2026-08-25 eess.IV cs.AI cs.CV 版本更新 57%

SAS: Segment Anything Small for Ultrasound -- A Non-Generative Data Augmentation Technique for Robust Deep Learning in Ultrasound Imaging

SAS:用于超声的小尺寸分割模型——一种用于超声成像中鲁棒深度学习的非生成数据增强技术

Danielle L. Ferreira, Ahana Gangopadhyay, Hsi-Ming Chang, Ravi Soni, Gopal Avinash

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI

AI总结 本研究提出SAS非生成数据增强技术,通过双变换策略提升深度学习模型对超声图像中小解剖结构的分割性能,经多数据集验证可显著提升Dice分数,且计算高效、适配资源受限场景。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23000 2026-08-25 cs.RO cs.HC 新提交 50%

Free-Energy-Gated Plasticity for Real-Time Online Motor Learning in Physical Human--Robot Interaction

用于物理人机交互中实时在线运动学习的自由能门控可塑性

Hiroki Sawada, Jun Tani

机构 * Okinawa Institute of Science and Technology Graduate University(冲绳科学技术大学院大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 该研究针对物理人机交互的实时在线运动学习问题,扩展PV-RNN并提出FEGP方法,实验证实其能提升运动模式覆盖与保留能力,关键在于可塑性的时间分配而非平均幅度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 61 篇

2608.23145 2026-08-25 cs.MA physics.optics 新提交 93%

First Demonstration of Multi-Agent LLM System for Million-Scale Optical Link Management in Global Production AIDCs

面向全球生产型人工智能数据中心(AIDC)中百万级光链路管理的多智能体大语言模型(LLM)系统的首次演示

Jingyi Su, Yihao Zhang, Dianxuan Fu, Leiyan Fei, Juan Wang, Mengfan Dai, Qing Liu, Xiong Wu, Yufeng Jiang, Cheng Chen, Bowen Zhang, Peilong Wang, Xi Chen, Zonglong He, Hongchen Yu, Zhicheng Ye, Weisheng Hu, Qunbi Zhuge

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract)

AI总结 该研究首次演示了用于全球生产型AIDC百万级光链路自主故障管理的多智能体LLM系统,经SFT和记忆演化优化,在十周现场数据中F1达97.7%、故障减少超60%,性能优于SOTA LLM。

Comments 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00869 2026-08-25 cs.LG 版本更新 92%

Enhancing LLM Metacognition via Cognitive Pairwise Training

通过认知成对训练增强LLM元认知

Weitao Li, Hao Zhou, Xuanyu Lei, Fandong Meng, Yuanhang Liu, Jingyi Ren, Ante Wang, Xiaolong Wang, Yuanchi Zhang, Fuwen Luo, Guangwen Yang, Lin Gan, Weizhi Ma, Yang Liu

机构 * National Engineering Laboratory for Intelligent Information Processing, Academy of Mathematics and Physics, Chinese Academy of Sciences(智能信息处理国家工程实验室,中国科学院数学物理研究所) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 提出认知成对训练(CPT),通过成对比较推理轨迹来学习区分可靠与不可靠推理,从而提升LLM的推理与元认知权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21939 2026-08-25 cs.IR 新提交 91%

Enhancing Group Recommendation with Memory-Augmented Reasoning in LLM Agent

基于记忆增强推理的大语言模型智能体群组推荐增强方法

Qimeng Niu, Bowen Hao, Zixuan Zhang, Shuyu Qu, Hongzhi Yin

专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出基于LLM智能体的AGR模型,通过记忆模块与推理模块建模群组偏好动态演变及决策过程,在公开数据集上显著提升了群组推荐的准确率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17485 2026-08-25 cs.CR 版本更新 91%

KeyPooling: Measuring Where LLM API Relay Paths Collapse Prompt Cache Isolation

KeyPooling:测量LLM API中继路径在提示缓存隔离中的崩溃位置

Bowen Sun, Yixi Cai, Xiaogeng Liu, Zhengyue Zhao, Yinzhi Cao, Chaowei Xiao

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出KeyPooling测量方法,发现LLM API中继服务默认未将客户绑定到上游凭证,存在跨客户缓存读取漏洞,并提出防御契约及优化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24434 2026-08-25 cs.CL 版本更新 91%

LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data

LuxIT:从单语种子数据生成的卢森堡语指令微调数据集

Julian Valline, Cedric Lothritz, Siwen Guo, Jordi Cabot

机构 * Luxembourg Institute of Science and Technology(卢森堡科学技术研究院)

专题命中 指令微调 :LLM(summary_cn,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LuxIT数据集,通过合成高质量卢森堡语指令-回答对,提升低资源语言LLM性能,实验显示在语言考试和NLP任务中均取得显著提升。

Comments To appear in proceedings of LaTeLL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23475 2026-08-25 cs.AI 新提交 90%

StrategyBench: Evaluating Explicit Strategy Induction in Large Language Models

StrategyBench:评估大语言模型中的显式策略归纳能力

Jinghan Tan, Yuanzheng Wang, Lu Chen, Zijun Chen, Yuqian Wang, Maosong Sun

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出StrategyBench基准,评估大语言模型显式策略归纳能力,通过多维度分析揭示策略效用的影响因素,相关基准已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09544 2026-08-25 cs.CL cs.AI cs.LG 版本更新 90%

Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

大语言模型通过一种独特的统一机制生成有害内容

Hadas Orgad, Boyi Wei, Kaden Zheng, Martin Wattenberg, Peter Henderson, Seraphina Goldfarb-Tarrant, Yonatan Belinkov

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Princeton University(普林斯顿大学) Harvard University(哈佛大学) Cohere Technion—IIT(以色列理工学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过权重剪枝揭示大语言模型中有害生成的内部结构,发现有害内容生成依赖于一组通用且与良性能力不同的权重,表明对齐训练重塑了有害表示,解释了领域微调引发的广泛对齐偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22232 2026-08-25 cs.AI cs.CL cs.CV cs.MM 新提交 90%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22188 2026-08-25 cs.LG cs.CL cs.DC 新提交 90%

Unveiling the Depth-Performance Dilemma in Split-Federated Fine-tuning of LLMs

揭示大语言模型的拆分式联邦微调中的深度-性能困境

Hariharan Ramesh, Someshwaran Murugaiyan, Jyotikrishna Dass

机构 * Vellore Institute of Technology(韦洛尔理工学院) University of Arizona(亚利桑那大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究针对拆分式联邦微调(SFF),识别出深度-性能困境,评估多种联邦适配器聚合方法后发现其无法缓解拆分架构缺陷,归因于Transformer拓扑,为分布式LLM微调提供结构基础。

Comments 24 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21970 2026-08-25 cs.CV 新提交 89%

Retrieval-Augmented Visual Prompting: Guiding Foundation Models in Two-Photon Imaging

检索增强型视觉提示:引导基础模型用于双光子成像

Salvatore Calcagno, Marco Finocchiaro, Giovanni Bellitto, Daniela Giordano, Concetto Spampinato, Federica Proietto Salanitri

机构 * University of Catania(卡塔尼亚大学)

专题命中 指令微调 :prompting(title,abstract);foundation model(title,abstract)

AI总结 该研究提出RAVP框架,通过在推理阶段注入外部视觉记忆引导基础模型,经Allen Brain Observatory实验验证,可提升零样本神经元检测与实例分割性能,单示例提示效果优于多示例。

Comments 14 pages, 4 figures, 6 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22557 2026-08-25 cs.LG cs.AI cs.CL 新提交 88%

BLADE: Bilevel Low-rank Augmented-Lagrangian Erasure for LLM Unlearning

BLADE:用于大语言模型遗忘的双层低秩增广拉格朗日擦除方法

Md Toufikuzzaman, Ahmad Mousavi, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) American University(美利坚大学)

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 BLADE是一种受约束的双层框架,通过钳制熵遗忘损失、非对称增广拉格朗日和LoRA适配器双层结构解决LLM遗忘的鲁棒性问题,在三类基准上性能优于基线,且可应对规模扩大和连续遗忘步骤。

Comments To Appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20360 2026-08-25 cs.AI 版本更新 88%

Evaluating Large Language Models for automatic analysis of teacher simulations

评估用于教师模拟自动分析的大型语言模型

David de-Fitero-Dominguez, Mariano Albaladejo-González, Antonio Garcia-Cabot, Eva Garcia-Lopez, Antonio Moreno-Cediel, Erin Barno, Justin Reich

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究评估了DeBERTaV3、Llama 3等LLMs在教师教育数字模拟响应特征识别中的性能,发现Llama 3检测新特征更稳定,可为相关自动评估研究提供指导。

Comments Final published version in the Heliyon journal. Volume 12, Issue 14, September 2026, e45323. DOI: this https URL (https://doi.org/10.1016/j.heliyon.2026.e45323)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-25 cs.AI cs.CL 新提交 87%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 14 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏