arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 464 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 464 篇

2607.26987 2026-08-06 cs.SE 版本更新 80%

How Developers Experience Debugging Unfamiliar Codebases with Code Tours Generated and Evaluated by Local LLMs

开发者使用本地大语言模型生成和评估的代码导航体验陌生代码库调试的研究

Martin Balfroid, Julien Albert, Dzenatan Aliti, Xavier Devroey, Benoît Vanderose

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究探讨开发者使用本地大语言模型生成评估的代码导航调试陌生代码库的体验,明确代码导航组件属性对开发者的影响,为优化代码导航生成与评估提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04510 2026-08-05 cs.CL cs.AI cs.CY cs.LG 版本更新 80%

Transplanting, inverting, and preventing a misalignment persona: method-conditional emergent misalignment in Qwen2.5

移植、反转和防止错位角色:Qwen2.5中方法条件下的突发错位

Lyndon Drake, Zandi Eberstadt

机构 * University of Oxford(牛津大学)

专题命中 指令微调 :language model(abstract);pretraining(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究Qwen2.5模型中突发错位,通过移植潜在角色方向诱导错位,消融自身方向可减少诱导,发现招募角色与方法和能力有关,还可筛查和防止其招募。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10058 2026-07-27 cs.CV 版本更新 80%

Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation

正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成

Sung-Lin Tsai, Bo-Lun Huang, Yu Ting Shen, Cheng Yu Yeo, Chiang Tseng, Bo-Kai Ruan, Wen-Sheng Lien, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。

Comments Accepted to ACM Multimedia 2025 (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06471 2026-07-22 cs.CL cs.AI cs.LG 版本更新 80%

PRISP: Privacy-Safe Few-Shot Personalization via Lightweight Adaptation

PRISP:通过轻量级适配实现隐私安全的少样本个性化

Junho Park, Dohoon Kim, Taesup Moon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) ASRI/INMC/IPAI/AIIS, Seoul National University(ASRI/INMC/IPAI/AIIS,首尔国立大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型个性化中数据、资源和隐私问题,提出PRISP框架,利用文本到LoRA超网络生成参数,结合少样本用户数据优化,减少计算开销并消除隐私风险,相比先前方法性能更强。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13636 2026-07-20 cs.CV cs.RO 版本更新 80%

MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning

MindDrive: 一种通过在线强化学习实现自动驾驶的视觉-语言-动作模型

Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MindDrive通过在线强化学习实现自动驾驶中的视觉-语言-动作模型,结合决策专家和动作专家,提升复杂场景下的驾驶决策与探索效率。

Comments Accepted by ECCV 2026; Project Page: https://xiaomi-mlab.github.io/MindDrive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23531 2026-07-16 cs.RO 版本更新 80%

BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation

BiliVLA: 基于强化学习的场景感知视觉-语言-动作模型用于自主胆道内镜导航

Jinsong Lin, Chi Kit Ng, Zhiyong Xiong, Zikang Pan, Yihan Hu, Tabassum Tamima, Ziyi Hao, Eddie Cheung, Jiewen Lai, Huxin Gao, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院) University of Cambridge(剑桥大学) University of California, Davis(加州大学戴维斯分校)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出BiliVLA框架,将胆道内镜导航建模为指令条件化的视觉运动学习问题,结合场景感知监督和两阶段训练(SFT+GRPO),在ERCP子任务中实现91.96%的动作精度和84.85%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18685 2026-07-16 cs.CV cs.RO 版本更新 80%

Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents

超越描述:为具身智能体进行细粒度动作的认知基准测试

Dayong Liu, Chao Xu, Weihong Chen, Suyu Zhang, Juncheng Wang, Jiankang Deng, Baigui Sun, Yang Liu

机构 * Zhejiang University(浙江大学) Wolf 1069 b(沃尔夫1069b) Sany Group(三一集团) The Hong Kong Polytechnic University(香港理工大学) Imperial College London(帝国理工学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CFG-Bench基准测试,旨在评估具身智能体在物理交互中的细粒度动作能力,揭示现有MLLMs在高层次推理中的不足,并通过监督微调提升其性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21495 2026-07-01 cs.LG cs.AI cs.CL 版本更新 80%

Generalizing Numerical Reasoning in Table Data through Operation Sketches and Self-Supervised Learning

通过操作草图和自监督学习推广表格数据中的数值推理

Hanjun Cho, Gahyun Yoo, Hanseong Kim, Jay-Yoon Lee

机构 * Seoul National University(首尔国立大学) Soongsil University(顺天大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TaNOS框架,通过操作草图和自监督学习提升表格数据中数值推理的泛化能力,实验显示其在FinQA数据集上表现优异,且在领域转移中鲁棒性更强。

Comments Accepted to TACL. This is a pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16271 2026-07-01 cs.CV 版本更新 80%

VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment

VIGOR: 面向视频几何的时序生成对齐奖励

Tengjiao Yin, Jinglei Shi, Heng Guo, Xi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract);post-training(abstract)

AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。

Comments Project Page: https://vigor-geometry-reward.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12478 2026-08-18 cs.CV cs.LG 版本更新 79%

Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

数据更少,收敛更快:面向多模态指令微调的目标驱动数据优化

Rujie Wu, Haozhe Zhao, Hai Ci, Yizhou Wang

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);分类 cs.LG

AI总结 本文提出目标驱动数据优化框架GDO,通过优化训练样本实现更快收敛和更高精度,适用于多模态指令微调任务。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28181 2026-08-11 cs.CL 版本更新 79%

When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models

当置信度误导时:扩散语言模型的后缀锚定与锚邻近置信度调制

Jungwon Park, Jimyeong Kim, Jungmin Ko, Nojun Kwak, Wonjong Rhee

机构 * RICS(智能研究学院) AIIS(人工智能研究所) IPAI(人工智能研究所) Department of Intelligence and Information(智能与信息系) Daegu Gyeongbuk Institute of Science and Technology(大邱庆州市科学技术院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 针对扩散语言模型中置信度误导导致生成不完整或过早解码的问题,提出后缀锚定与锚邻近置信度调制方法,无需训练即可提升完全非自回归解码性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03020 2026-08-10 cs.AI 版本更新 79%

LoCA: Forward-Only LLM Tuning after One-Shot Calibration with Local Credit Assignment

LoCA:基于局部信用分配的一次性校准后仅前向的大语言模型调优

Linhan Xia, Rui Liu, Zhaofeng Zhang, Yihao Wang, Binrui Shen, Shengxin Zhu

机构 * University of Oklahoma(俄克拉荷马大学) Imperial College London(伦敦帝国学院) University of Michigan(密歇根大学) Tencent(腾讯) University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) Beijing Normal University(北京师范大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 指令微调 :LLM(title);post-training(abstract);分类 cs.AI

AI总结 本文提出LoCA方法,通过一次性校准替换大语言模型调优的重复反向传播,在多个基准上优于LoRA,降低了GPU峰值内存、CPU稳态内存与前向传递时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04140 2026-08-06 eess.AS cs.CL 版本更新 79%

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

DELTA-TTS:将自回归模型适配为扩散语言模型以实现文本转语音

Junwon Moon, Yejin Lee, Seungbeom Kim, Hoseong Ahn, Sewoong Park, Heeseung Kim, Kyuhong Shim

机构 * Sungkyunkwan University(首尔大学) University of Seoul(首尔大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 针对自回归TTS推理慢、鲁棒性差的问题,提出基于LoRA的轻量适配框架DELTA-TTS,将预训练AR TTS转为离散扩散语言模型,推理速度提升3.3倍且性能更优。

Comments ICML 2026 SPIGM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17883 2026-08-04 cs.LG cs.CV 版本更新 79%

EEG-FM-Compass: Progress, Benchmarking, and Future Directions for EEG Foundation Models

EEG基础模型:进展、基准测试与开放问题

Dingkun Liu, Yuheng Chen, Zhu Chen, Zhenyao Cui, Yaozhi Wen, Jiayu An, Jingwei Luo, Dongrui Wu

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文研究了EEG基础模型的进展、基准测试与开放问题,通过评估12个开源模型和专用基线,发现线性探测不足,专用模型仍具竞争力,且大模型不必然提升泛化性能。

Journal ref National Science Review, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05658 2026-07-28 physics.ao-ph cs.LG physics.geo-ph 版本更新 79%

Integrating GNSS-Derived Zenith Wet Delay into a Weather Foundation Model Improves Precipitation Forecasting

将全球导航卫星系统(GNSS)导出的天顶湿延迟整合到天气基础模型中可改善降水预报

Leonardo Trentini, Fanny Lehmann, Laura Crocetti, Benedikt Soja

机构 * Weather Foundation(天气基金会)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究将GNSS导出的ZWD整合到Aurora天气基础模型中,扩展后的模型学习ZWD能力与预训练变量相当,微调时纳入ZWD可改善降水预报,增益随严重程度增加,能让降水功率谱更现实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30997 2026-07-24 cs.AI 版本更新 79%

A Three-Phase Foundation Model for Tax-Aware Personalized Portfolio Management

面向税务感知的个性化投资组合管理的三阶段基础模型

Ramin Pishehvar

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 提出三阶段深度强化学习系统,通过自监督跨资产编码器、MoE策略网络和LoRA个性化层,解决金融RL中标的锁定、单目标优化和静态用户模型三大局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18082 2026-07-21 cs.CL cs.HC 版本更新 79%

Octo-planner: On-device Language Model for Planner-Action Agents

Octo-planner:用于规划-行动智能体的设备端语言模型

Wei Chen, Zhiyuan Li, Zhen Guo, Yikang Shen

机构 * Nexa AI & Stanford(Nexa AI 与 斯坦福大学) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI 实验室)

专题命中 指令微调 :language model(title);LLM(abstract);分类 cs.CL

AI总结 研究如何让人工智能智能体有效规划行动,提出设备端规划-行动框架,分离规划与行动执行组件,用模型微调优化性能,多LoRA训练方法应对多域规划挑战,在域内测试成功率达97%,并开源模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15207 2026-07-09 cs.LG cs.MA 版本更新 79%

TeamTR: Trust-Region Fine-Tuning for Multi-Agent LLM Coordination

TeamTR: 用于多智能体大语言模型协调的信赖区域微调

Yi Xie, Siao Liu, Falong Fan, Yuanqi Yao, Yue Zhao, Bo Liu

机构 * Department of Electrical \& Computer Engineering, University of Arizona Engineering College, Soochow University INSAIT, Sofia University "St. Kliment Ohridski" Department of Electrical Computer Engineering, Stony Brook University

专题命中 指令微调 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出TeamTR,通过信赖区域框架在每个组件更新后重采样轨迹并控制每个智能体的发散度,解决多智能体系统中因上下文分布变化导致的性能下降问题,实验表明其在协调回归抑制和组件替换支持方面优于单智能体和序列基线。

Comments 9pages, Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16771 2026-07-07 cs.SE cs.AI cs.HC 版本更新 79%

EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention

EyeMulator:通过模仿人类视觉注意力改进代码语言模型

Yifan Zhang, Chen Huang, Yueke Zhang, Jiahao Zhang, Toby Jia-Jun Li, Collin McMillan, Kevin Leach, Yu Huang

机构 * Vanderbilt University(范德比大学) National University of Singapore(新加坡国立大学) University of Notre Dame(诺丁汉大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出EyeMulator,通过提取眼动数据中的扫描路径,调整代码语言模型的注意力机制,使其更符合人类视觉注意力模式,从而在翻译和摘要任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07407 2026-06-26 cs.CL 版本更新 79%

Training Language Models to Use Prolog as a Tool

训练语言模型以使用Prolog作为工具

Niklas Mellgren, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 本文探讨通过强化学习训练语言模型使用Prolog进行符号推理,发现正确性与可审计性之间存在权衡,影响模型性能与可解释性。

Comments ACL 2026 Findings (change from last version: corrected year in this comment)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01195 2026-06-26 cs.CV cs.AI 版本更新 79%

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

VisNec: 衡量和利用视觉必要性进行多模态指令微调

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu

机构 * SJTU(上海交通大学) Universiti Malaya(马来亚大学) CMU(卡内基梅隆大学) MBZUAI(穆萨台普大学人工智能研究所) KIT(卡尔斯鲁厄理工学院) KAUST(王国立阿联酋科学技术大学)

专题命中 指令微调 :instruction tuning(title,abstract);分类 cs.AI

AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。

Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17423 2026-06-25 cs.CV cs.CL 版本更新 79%

Privacy-Aware Visual Language Models

隐私感知的视觉语言模型

Laurens Samson, Nimrod Barazani, Sennay Ghebreab, Yuki M. Asano

机构 * Socially-Intelligent Artificial Systems Group, University of Amsterdam(智能社会人工智能系统组,阿姆斯特丹大学) University of Amsterdam(阿姆斯特丹大学) Fundamental AI Lab, University of Technology Nuremberg(基础人工智能实验室,纽伦堡技术大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 针对视觉语言模型隐私理解不足的问题,构建高质量基准数据集PrivBench和指令微调数据集PrivTune,通过少量样本微调显著提升隐私敏感性,性能超越GPT-4。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08245 2026-06-24 cs.CV cs.AI 版本更新 79%

When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

语言覆盖视觉:视觉语言模型中的过度对齐与几何去偏

Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu

机构 * Indian Institute of Technology Dhanbad(印度理工学院丹巴德分校) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文研究视觉语言模型中过度对齐导致的幻觉问题,提出几何去偏方法,通过投影消除文本子空间影响,减少幻觉并提升长文本生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20014 2026-06-19 cs.RO cs.AI 版本更新 79%

Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting

Bring My Cup! 使用视觉注意力提示个性化视觉-语言-动作模型

Sangoh Lee, Sangwoo Mo, Wook-Shin Han

机构 * GSAI, POSTECH(POSTECH 人工智能研究所) IME, POSTECH(POSTECH 信息媒体研究所)

专题命中 指令微调 :prompting(title,abstract);分类 cs.AI

AI总结 针对VLA模型难以处理个性化指令的问题,提出无需训练的视觉注意力提示(VAP)方法,通过参考图像作为非参数记忆,利用开放词汇检测和嵌入匹配定位个人物品,并以视觉提示注入模型,在多个仿真和真实场景中显著提升成功率和正确物体操作。

Comments ICML 2026. Project page: https://vap-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15133 2026-06-12 cs.CE cs.AI 版本更新 79%

HD-Prot: A Protein Language Model for Joint Sequence-Structure Modeling with Continuous Structure Tokens

HD-Prot:一种使用连续结构令牌进行联合序列-结构建模的蛋白质语言模型

Yi Zhou, Haohao Qu, Yunqing Liu, Shanru Lin, Le Song, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 提出HD-Prot,一种混合扩散蛋白质语言模型,通过连续结构令牌将序列pLM扩展为多模态,实现联合序列-结构建模,在多种任务上取得竞争性能。

Comments This is the long version of the corresponding paper to appear at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04351 2026-06-11 cs.CV cs.CL 版本更新 79%

Frames2LoRA: Parametric Video Internalization for Vision-Language Models

Video2LoRA: 视觉-语言模型的参数化视频内化

Manan Suri, Sarvesh Baskar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 提出Video2LoRA方法,通过感知器超网络从视频编码中直接生成LoRA适配器,实现零视觉令牌的视频查询,在保持性能的同时大幅降低计算成本。

Comments https://frames2lora.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04109 2026-06-09 cs.CL 版本更新 79%

Discourse-Role Labels as Presentation-Time Variables for Context Use in Language Models

话语角色标签作为语言模型上下文使用的呈现时间变量

Jianguo Zhu, Xiangmei Li, Wenjie Liu

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 通过固定内容探针实验,研究不同话语角色标签(如Instruction、Reference、Example)如何影响语言模型对误导信息的采纳率,发现标签可导致采纳率变化56-84个百分点,并建议上下文利用和RAG基准应报告和控制包装标签。

Comments Revised version with updated author information, added clean baselines, clarified evaluation metrics, and tightened discussion of context-augmented settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21706 2026-06-08 cs.AI 版本更新 79%

Latent-space Attacks for Refusal Evasion in Language Models

潜在空间攻击用于语言模型的拒绝规避

Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

机构 * University of Cagliari(卡利亚里大学) University of Genova(热那亚大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了如何通过潜在空间攻击来规避语言模型的拒绝行为,提出了一种受控的潜在空间攻击方法,以提高攻击成功率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16620 2026-08-19 cs.CL cs.AI 版本更新 79%

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6技术报告:一种通过锚定监督微调进行后训练的具工具使用能力的智能体模型

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

机构 * Writer AI Research, Writer, Inc.(Writer AI研究院,Writer公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 Palmyra x6是一款针对企业级智能体任务优化的大语言模型,通过锚定监督微调后训练构建,在公开基准测试及偏见安全评估中表现优异。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00310 2026-08-10 cs.LG cs.AI 版本更新 79%

CASA: Classification Augmented with Safety Attention for Robust Multimodal Alignment

通过条件解码实现鲁棒的多模态安全性

Anurag Kumar, Raghuveer Peri, Jon Burnsky, Alexandru Nelus, Rohit Paturi, Srikanth Vishnubhotla, Yanjun Qi

机构 * The Ohio State University(俄亥俄州立大学) AWS(亚马逊云服务)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CASA方法,通过内部表示预测安全令牌以提升多模态大语言模型的安全性,实验显示其在多种基准上显著降低攻击成功率,同时保持良性输入的实用性。

Comments 9 pages + Appendix section

详情

展开后加载摘要…

URL PDF HTML 收藏