arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 464 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 464 篇

2508.08636 2026-08-12 cs.CL 版本更新 89%

InternAgentHarness: A Scalable Synthetic Environment for Enhancing LLM Agentic Abilities

InternBootcamp 技术报告:通过可验证的任务扩展提升大语言模型推理能力

Xiaozhe Li, Yongkang Chen, Shujian Deng, Peiji Li, Yichuan Ma, Huaxi Huang, Qiye Cai, Tianyi Lyu, Le Ma, Linyang Li, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出InternBootcamp框架,通过可验证的任务扩展方法提升大语言模型的推理能力,为基于强化学习的模型优化、合成数据生成和模型评估提供了基础设施。

Comments InternAgentHarness tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27752 2026-08-10 cs.AI 版本更新 89%

Same Answer, Different Confidence: Protocol Sensitivity in LLM Confidence Calibration

询问是不够的:LLM 置信度校准中的协议敏感性

Hankyeol Kim, Pilsung Kang

机构 * Seoul National University(首尔国立大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过改变测量协议(如条件上下文、令牌读取方式)发现,LLM 的令牌概率置信度与口头置信度之间的比较高度敏感,且口头置信度不仅反映正确性还反映答案的合理性和来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22205 2026-07-29 cs.CV cs.AI 版本更新 89%

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

推进前填充:能力差距驱动的场景专用遥感多模态大语言模型的训练后处理

Yuheng Zong, Minghua Wang, Xin Zhao, Zhi-Hui Zhan, Antonio Plaza, Jon Atli Benediktsson

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对地球观测应用中遥感多模态大语言模型因高质量数据稀缺和能力覆盖不完整难以实现细粒度场景专业化的问题,提出能力差距驱动的推进前填充(FBA)方法,经实验验证其效果优于其他方法,提升了模型在相关基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10887 2026-07-02 cs.CR cs.AI 版本更新 89%

Hey, That's My Model! Introducing Chain & Hash, An LLM Fingerprinting Technique

嘿,那是我的模型!引入链与哈希,一种大语言模型指纹识别技术

Mark Russinovich, Yanan Cai, Ahmed Salem

机构 * Microsoft(微软)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于链与哈希的LLM指纹识别框架,通过加密绑定提示与响应防止碰撞,并利用随机填充和元提示配置增强鲁棒性,实现可验证的所有权证明。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17397 2026-08-18 quant-ph cs.AI cs.LG 版本更新 88%

Quantum Large Language Models via Tensor Network Disentanglers

基于张量网络解纠缠器的量子大语言模型

Borja Aizpurua, Fernando Loren, Saeed S. Jahromi, Sukhbinder Singh, Roman Orus

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出将量子计算与预训练大语言模型融合的框架,用张量网络解纠缠器压缩模型参数,经量子处理器验证可提升性能,为量子增强语言模型提供实用方案。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00910 2026-08-03 cs.IT cs.AI cs.LG math.IT 版本更新 88%

Curvature-Weighted Capacity Allocation: A Minimum Description Length Framework for Layer-Adaptive Large Language Model Optimization

曲率加权容量分配:一种基于最小描述长度原理的层适应性大语言模型优化框架

Theophilus Amaefuna, Hitesh Vaidya, Anshuman Chhabra, Ankur Mali

机构 * Bellini College of Artificial Intelligence, Cybersecurity and Computing(人工智能与网络安全与计算学院) University of South Florida(佛罗里达州立大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最小描述长度原理的曲率加权容量分配框架,用于层适应性大语言模型优化,通过曲率调整的层增益计算,实现高效容量分配和剪枝,具有理论保证和计算效率。

Comments Accepted to UAI 2026. To be published in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02580 2026-07-28 cs.CL cs.AI 版本更新 88%

Reconstructing Item Characteristic Curves using Fine-Tuned Large Language Models

利用微调的大语言模型重建项目特征曲线

Christopher Ormerod

机构 * Cambium Assessment(坎布里乌姆评估)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用微调大语言模型生成合成项目特征曲线,以估计IRT参数,方法在评估项目数据集上表现优异,尤其在区分度建模方面效果显著。

Comments 19 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16991 2026-07-21 cs.LG cs.AI 版本更新 88%

Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models

稀疏感知低秩表示用于大型语言模型高效微调

Longteng Zhang, Sen Wu, Shuai Hou, Zhengyu Qing, Zhuo Zheng, Danning Ke, Qihong Lin, Qiang Wang, Shaohuai Shi, Xiaowen Chu

专题命中 指令微调 :language model(title,abstract);large language model(title);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 SALR 通过结合低秩适应与稀疏剪枝,实现大型语言模型的高效微调,达到 50% 稀疏度并提升推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12341 2026-07-01 cs.CL cs.AI 版本更新 88%

Learning by Surprise: Adaptive Mitigation of Model Collapse in Large Language Models

通过惊喜学习:大型语言模型中模型崩溃的自适应缓解

Daniele Gambetta, Gizem Gezici, Fosca Giannotti, Dino Pedreschi, Alistair Knott, Luca Pappalardo

机构 * University of Pisa(比萨大学) ISTI-CNR(意大利国家研究委员会信息科学与技术研究所) Scuola Normale Superiore(比萨高等师范学校) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对AI自噬导致的模型崩溃问题,提出基于困惑度的过滤策略,优先使用高惊喜文档进行微调,无需区分人写或AI生成内容,有效缓解崩溃并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02995 2026-06-15 cs.CR cs.AI cs.IR cs.LG 版本更新 88%

Patcher: Post-Hoc Patching of Backdoored Large Language Models

Patcher: 后门大型语言模型的事后修补

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(北得克萨斯大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Patcher框架,仅利用单个失败案例和模型参数,通过基于梯度的显著性定位后门触发器,并采用约束微调消除触发-响应关联,同时保持模型效用。

Comments To appear in the USENIX Security Symposium, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15723 2026-06-09 cs.LG cs.CL 版本更新 88%

Federated Large Language Models: Current Progress and Future Directions

联邦大语言模型:当前进展与未来方向

Yuhang Yao, Jianyi Zhang, Junda Wu, Chengkai Huang, Yu Xia, Tong Yu, Ruiyi Zhang, Sungchul Kim, Ryan Rossi, Ang Li, Lina Yao, Julian McAuley, Yiran Chen, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学) University of California San Diego(加州大学圣地亚哥分校) The University of New South Wales(新南威尔士大学) Adobe Research(Adobe研究) University of Maryland College Park(马里兰大学学院公园分校) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文综述联邦学习与大语言模型结合(FedLLM)的最新进展,重点分析联邦微调和联邦提示学习如何应对效率、个性化和安全挑战,并展望联邦预训练和联邦智能体等方向。

Comments Accepted by PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01206 2026-07-13 cs.CL cs.LG 版本更新 88%

RELISH: LLM REgression with a Latent Iterative State Head

基于潜在迭代状态头的大型语言模型回归

Yiheng Su, Matthew Lease

专题命中 指令微调 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.LG

AI总结 RElish通过迭代优化潜在状态实现文本回归,优于三种主流回归方法,参数效率高。

Comments Accepted to the Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15315 2026-08-19 cs.AI 版本更新 88%

ChatPlanner: A Large Language Model Framework for Personalized Public Transit Routing

ChatPlanner: 一个用于个性化公共交通路线规划的大型语言模型框架

Tingting Yang, Chenhao Xue, Jun Chen

机构 * School of Engineering and Materials Science, Queen Mary University of London(伦敦玛丽女王大学工程与材料科学学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出ChatPlanner框架,利用大型语言模型和检索增强生成技术从自然语言查询中提取用户偏好并融入路线规划算法,实验证明其能生成更符合个性化需求的可行路线方案。

Comments Under Review at Transportation Research Part C

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06854 2026-08-14 cs.CL 版本更新 88%

SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks

SEMA: 简单却有效的多轮对抗攻击学习

Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang Xu, Jianfeng Gao

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SEMA通过多阶段学习实现高效多轮对抗攻击,无需依赖现有策略,提升攻击成功率并增强安全测试能力。

Comments ICLR 2026, 37 pages, 13 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04186 2026-08-07 cs.CL 版本更新 88%

Large Language Models for Low-Resource Languages: A Conceptual Framework for an Electronic Explanatory Dictionary of the Tajik Language

用于低资源语言的大语言模型:塔吉克语电子解释词典的概念框架

Mullosharaf K. Arabov, S. S. Pirov, B. Sultonov

机构 * Kazan Federal University(喀山联邦大学) Tajik National University(塔吉克国立大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文针对低资源语言塔吉克语,提出结合LLMs与经典词典方法的电子解释词典概念架构,为相关应用NLP任务提供核心资源,适用于计算语言学等领域从业者。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13227 2026-08-07 cs.CL 版本更新 88%

PolyAlign: Conditional Human-Distribution Alignment

PolyAlign: 条件性人类分布对齐

L. D. M. S. Sai Teja, Ufaq Khan, Sathira Silva, Xiao Wu, Muhammad Haris Khan

机构 * NIT Silchar(印度国立理工学院锡尔恰尔分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 提出PolyAlign框架,通过桶感知SFT和人类分布偏好优化,实现语言模型在不同交互上下文中的条件性人类分布对齐,提升自然性和分布忠实度。

Comments 23 pages, 5 Figures, 13 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19360 2026-08-04 cs.AI 版本更新 88%

Lifted State Hypothesis in Large Language Models

语言模型中的提升表示假设

Bumjin Park, Jaesik Choi

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究大型语言模型中结构的存储、选择和修正问题,提出提升表示假设,通过多种实验评估其提升和细化情况,发现数据受嵌套规则和异常支配时模型存在问题,强调需研究数据与规则结构关系。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14340 2026-08-04 cs.CR cs.LG 版本更新 88%

Turn-Based Structural Triggers: Structure-Conditioned Backdoors in Multi-Turn LLMs

基于回合的结构性触发器:多轮LLM中的无提示后门

Yiyang Lu, Jinwen He, Yue Zhao, Kai Chen, Ruigang Liang, Cheng Hong, Yingjun Zhang

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Ant Group(蚂蚁集团)

专题命中 指令微调 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 提出一种利用对话结构(回合索引)作为触发器的后门攻击方法TST,无需用户输入即可激活,实现高攻击成功率并绕过提示中心防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01210 2026-08-04 cs.AI 版本更新 88%

Knowledge Graph Augmented Large Language Models for Disease Prediction

基于知识图谱的大型语言模型用于疾病预测

Ruiyu Wang, Tuan Vinh, Ran Xu, Yuyin Zhou, Jiaying Lu, Francisco Pasquel, Mohammed K Ali, Carl Yang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Division of Medical Sciences, Oxford University(牛津大学医学系) Department of Computer Science and Engineering, UCSC(UCSC计算机科学与工程系) Nell Hodgson Woodruff School of Nursing, Emory University(埃默里大学内尔·霍根·伍德鲁夫护理学院) School of Medicine, Emory University(埃默里大学医学院) Rollins School of Public Health, Emory University(埃默里大学罗林斯公共卫生学院)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出基于知识图谱的大型语言模型框架,用于提升疾病预测的准确性与解释性,通过构建时间一致的推理依据,在多个数据集上取得优于经典基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10913 2026-07-31 cs.CL 版本更新 88%

LLM2Vec-Gen: Generative Embeddings from Large Language Models

LLM2Vec-Gen:从大型语言模型生成嵌入向量

Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas Chapados, Marius Mosbach, Siva Reddy

机构 * McGill University(麦吉尔大学) Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ServiceNow Research(ServiceNow研究院) Cohere Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23672 2026-07-24 cs.AI 版本更新 88%

Teaching LLMs String Matching, Backtracking, and Error Recovery to Deduce Bases and Truth Tables for the Combinatorially Exploding Bit Manipulation Puzzles

教LLM字符串匹配、回溯与错误恢复:为组合爆炸的位操作谜题推导基和真值表

Prateek Agnihotri, Sanchit Jain, Prabhat Agnihotri, Aditya Prasad, Shubham Jain

机构 * NVIDIA

专题命中 指令微调 :LLM(title_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种新方法,通过字符串相似性、结构化搜索和自主错误恢复,避免复杂布尔逻辑,解决位操作谜题中的组合爆炸问题,实现96%以上验证准确率。

Comments 22 pages, 4 figures, 2 tables. 7th Place Solution for the NVIDIA Nemotron Model Reasoning Challenge (Kaggle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13817 2026-07-09 cs.LG cs.NI 版本更新 88%

What's on My Network? Using Large Language Models to Identify Real-World IoT Devices at Scale

我的网络上有什么?使用大语言模型大规模识别现实世界中的物联网设备

Rameen Mahmood, Tousif Ahmed, Sai Teja Peddinti, Danny Yuxing Huang

机构 * New York University(纽约大学) Google(谷歌)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究共享环境中物联网设备识别难题,引入语义推理管道,用大语言模型构建高保真标签并指令微调模型,在众多供应商中取得高准确率,对多种问题保持稳健,为大规模可信设备识别提供基础。

Comments 18 pages, 3 figures

Journal ref Proc. ACM Netw. 4, CoNEXT2, Article 26 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17184 2026-07-07 cs.SE cs.LG 版本更新 88%

SynthFix: Adaptive Neuro-Symbolic Code Vulnerability Repair

SynthFix:自适应神经符号代码漏洞修复

Yifan Zhang, Jieyu Li, Kexin Pei, Yu Huang, Kevin Leach

机构 * Vanderbilt University(范德比大学) University of Chicago(芝加哥大学)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SynthFix通过结合代码生成与编译器引导的符号反馈,提升LLM在漏洞修复中的性能,实验表明其在CodeBLEU/CrystalBLEU和Exact Match指标上优于传统基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02932 2026-07-07 cs.LG 版本更新 88%

PLoRA: Efficient Concurrent LoRA Training for Large Language Models

PLoRA:用于大语言模型的高效并发LoRA训练

Minghao Yan, Zhuang Wang, Zhen Jia, Shivaram Venkataraman, Yida Wang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究发现当前LoRA训练范式不能有效利用硬件资源,提出PLoRA,在给定硬件和模型约束下自动编排并发LoRA微调作业并开发高性能内核,提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12227 2026-06-17 cs.CL 版本更新 88%

A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation

结合在线优化与蒸馏以提升大语言模型的长上下文推理能力

Miguel Moura Ramos, Duarte M. Alves, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司)

专题命中 指令微调 :large language model(title);language model(title);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出dGRPO方法,结合在线优化与蒸馏,通过强教师模型提供密集指导,提升长上下文推理能力,同时保持短上下文能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03489 2026-06-16 cs.CR cs.AI 版本更新 88%

Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs

从错误中学习:面向安全代码LLM的树状自博弈

Wenqi Chen, Ziyan Zhang, Bin Wang, Lin Liu, Hengheng Zhang, Zhengsu Chen

专题命中 指令微调 :LLM(title_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出树状自博弈(TSP)框架,将安全代码生成建模为细粒度序列决策过程,通过构建决策树探索安全与脆弱路径,使模型在关键决策节点自我纠正,显著提升代码安全性并实现跨语言泛化。

Comments 18 pages, 3 figures, Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06087 2026-08-18 cs.CL cs.AI 版本更新 88%

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkill: 从上下文文本技能到LLM智能体的权重内隐技能

Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) OPPO Research Institute(OPPO研究院)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出LatentSkill框架,通过预训练超网络将文本技能转换为即插即用的LoRA适配器,将技能知识存储在权重空间而非上下文空间,从而减少预填充令牌并提升性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23171 2026-07-30 cs.CR cs.AI cs.CY cs.LG 版本更新 88%

Adaptively Robust LLM Monitoring via Activation Watermarking

通过激活水印实现语言模型的鲁棒安全监控

Toluwani Aremu, Daniil Ognev, Samuele Poppi, Nils Lukas

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过激活水印技术提升语言模型的安全监控能力,针对适应性攻击者设计改进防御策略,有效提升检测准确率。

Comments 17 pages, 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09996 2026-08-13 cs.CV 版本更新 88%

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

Omni-Persona:系统性基准测试与改进多模态个性化

Yeongtak Oh, Dongwook Lee, Sangkwon Park, Heeseung Kim, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 Omni-Persona提出首个多模态个性化基准,通过Persona Modality Graph任务组和细粒度任务,系统分析多模态个性化中的接地行为,提出Calibrated Accuracy评估方法,揭示开源模型在音频与视觉接地上的差距及SFT与RLVR的局限性。

Comments Project Page: https://github.com/oyt9306/Omni-Persona

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21629 2026-08-11 cs.PL cs.AI cs.CL cs.LG 版本更新 88%

Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis

Quokka:通过不变式合成加速程序验证

Anjiang Wei, Tianran Sun, Tarun Suresh, Haoze Wu, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amherst College(阿默斯特学院) Nanjing University(南京大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Quokka通过利用大语言模型生成有用的循环不变式,提升程序验证效率,其评价导向框架在多个模型家族中表现出色,优于现有基于LLM的验证器。

详情

展开后加载摘要…

URL PDF HTML 收藏