Less Could Be Better: Parameter-efficient Fine-tuning Advances Medical Vision Foundation Models
专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract)
Comments Technical report
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract)
Comments Technical report
专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);foundation model(abstract)
Comments AAAI2024
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 19 pages, 10 figures
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract)
专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 指令微调 :language model(title,abstract);large language model(abstract);prompting(abstract)
Comments AdvML Frontiers Workshop 2023
专题命中 指令微调 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 28 pages, 9 figures
专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Dartmouth College(达特茅斯学院) ; EPFL(苏黎世联邦理工学院) ; UC Berkeley(加州大学伯克利分校) ; CUHK(香港大学) ; IBM Research(IBM研究院)
专题命中 指令微调 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Comments Project Page: https://hsiung.cc/llm-similarity-risk/
Re³Cap:基于强化学习的图像字幕增强的检索引导优化
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);分类 cs.AI
AI总结 本文提出Re³Cap方法,利用多模态检索作为推理信号,通过CRS和CQA优化图像字幕,在COCO-LN500基准上关系推理性能较GRPO提升8.64%,优于SFT。
Comments Accepted to EMNLP 2026 Main Conference
计算KJ-Ho:利用领域专用大型语言模型从大规模定性数据中提取无分析师偏差见解的框架
专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出计算KJ-Ho框架,结合领域专用LLM实现无分析师偏差的定性数据见解提取,整合三种方法论并作出五项贡献,属概念性研究。
Comments Concept paper. 38 pages, 1 figure, 2 tables
TRACE:面向多轮对抗对话评估的轨迹感知推理
机构 * Texas A&M University(德克萨斯农工大学) ; Amazon(亚马逊公司)
专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI
AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。
基于低秩适配器的近似Muon优化器
机构 * University of Bristol(布里斯托大学) ; School of Mathematics(数学学院) ; School of Engineering Mathematics and Technology(工程数学与技术学院) ; University of Bath(巴斯大学)
专题命中 指令微调 :SFT(summary_cn,abstract);pretraining(abstract);分类 cs.LG
AI总结 本文针对Muon优化器难以与LoRA结合用于低秩微调的问题,提出sMuon方法,经实验验证其在SFT和ReLoRA预训练中表现良好,可适度提升低秩微调性能。
LoRAQuant:将LoRA混合精度量化至超低比特
机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔人工智能研究所(Amii),阿尔伯塔大学) ; RBC Borealis ; Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对多LoRA适配器规模化部署的高存储成本问题,提出专为LoRA定制的混合精度后训练量化方法LoRAQuant,在LLaMA 2、Mistral模型的多任务上,以更低比特实现了相当或更优性能。
针对低资源塔吉克语文本生成的大语言模型参数高效微调基准测试:基于塔吉克网络语料库
专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL
AI总结 该研究发布塔吉克网络语料库,测试9种架构17种配置的三种微调策略,得出Mistral 7B搭配QLoRA r=8为最优方案,是首个针对塔吉克语文本生成的PEFT基准测试。
Comments LaTeLL 2026
对话式量表:用小型语言模型低负担引出日常经前症状评分
机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))
专题命中 指令微调 :language model(title);small language model(title);分类 cs.AI
AI总结 该研究将经前症状追踪转化为对话式有序标签恢复问题,用ModernBERT和Qwen2.5-1.5B-Instruct模型,实现低负担的日常经前症状评分,三簇策略效果接近固定六项策略且提问量减半。
Comments 10 pages, 4 figures, 1 table
COMEX:用于可解释美学图像裁剪的基于构图的基准测试与学习框架
机构 * ZTE Corporation(中兴通讯)
专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出基于构图的COMEX基准与SFT+GRPO两阶段框架,用于可解释美学图像裁剪,通过多组实验验证了框架的有效性与可迁移性。
数据重复胜过数据扩展在长链推理监督微调中
机构 * University of Technology Nuremberg(图恩大学) ; NVIDIA(英伟达)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本研究发现,在长链推理监督微调中,数据重复训练比数据扩展更有效,通过token准确率作为停止标准可替代昂贵的数据扩展。
从金融情感分类到收益可预测性:大型语言模型的QLoRA基准测试
专题命中 指令微调 :large language model(title);language model(title);分类 cs.LG
AI总结 该研究构建金融情感分类基准,对比TF-IDF朴素贝叶斯等模型,发现QLoRA可提升Qwen2.5性能,但分类准确率高的模型在收益预测的经济有效性上无显著优势,揭示分类准确率与可交易信号的差距。
Comments Waiting to submit to a conference (ICAIF)
长视野智能体的跨基准泛化
专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI
AI总结 本研究针对长视野智能体,通过两阶段SFT-再-RL流程后训练Qwen3.5-122B-A10B模型,在5项外部基准实现性能提升,证明长视野多工具后训练的工作方式可跨领域迁移。
Comments Accepted at the COLM 2026 Workshop on Agent Behavior. 11 pages, 4 tables
TopoTuner:大语言模型的拓扑微调
机构 * University of Central Florida(中佛罗里达大学) ; University of Manitoba(曼尼托巴大学)
专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI
AI总结 研究针对大语言模型微调成本高及LoRA不足的问题,提出TopoTuner框架,通过拓扑引导选择性冻结注意力投影矩阵,从源数据集学习可复用冻结配置文件,在多模型上效果优于LoRA且大幅减少训练时间和参数更新量。
大型语言模型(LLMs)的财务推理是否可信?针对长期财务报表的现实测试
专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 该研究针对LLMs的财务推理可信度,构建含对抗陷阱的FinIndices基准测试,发现其存在知识与结构瓶颈,监督微调可部分恢复结构化逻辑。
Comments The FinIndices dataset is publicly available at https://huggingface.co/datasets/User158072/Finindice
通过自监督语义扩散将技能像参数一样训练
机构 * Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 该研究提出受扩散模型启发的无监督自进化智能体框架,通过自监督信号更新外部文本技能库,提升了智能体在短剧剧本创作领域的生成能力。
Comments Preprint, work in progress