arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 1045 篇

2607.11862 2026-07-14 cs.CV cs.AI 新提交 70%

Evidence-Backed Video Question Answering

有证据支持的视频问答

Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles

机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) Brown University, Providence, RI, USA(布朗大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交 70%

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09259 2026-07-13 cs.CR cs.AI 新提交 70%

Blockchain-Linked Auditable Decision Management for Telecom/IoT Fraud-Control Requests

用于电信/物联网欺诈控制请求的区块链关联可审计决策管理

Saviz Changizi, Nasibeh Mohammadzadeh, Mohammad Shojafar, Rahim Tafazolli

机构 * G Innovation Centre, Institute for Communication Systems, University of Surrey, UK(Surrey大学6G创新中心,通信系统研究所)

专题命中 指令微调 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 研究针对电信/物联网欺诈控制请求,将其重构为区块链关联可审计决策管理。采用QLoRA调整大语言模型分支及多种方法评分、决策,经实验验证不同方法效果,分析区块链遥测数据,揭示相关指标差异原因。

Comments 16 pages, 5 figures, 10 tables, IEEE Transaction Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08877 2026-07-13 cs.RO cs.LG 新提交 70%

FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space

FlowDAgger:在潜在空间中对生成式机器人策略进行人工参与的自适应调整

Michael Murray, Daphne Chen, Simran Bagaria, Dean Fortier, Tess Hellebrekers, Galen Mullins, Harshavardhan Gajarla, Oier Mees, Maya Cakmak, Andrey Kolobov

机构 * Microsoft Research(微软研究院) University of Washington(华盛顿大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 指令微调 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 研究针对预训练生成式机器人策略在实际部署中出现的问题,提出FlowDAgger方法,通过动作反转从人工干预获取监督,在模拟及现实操纵中评估,该方法优于基线且能保留预训练技能,为机器人基础模型自适应调整提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04395 2026-07-07 cs.LG 新提交 70%

NKI-Agent: Domain-Specific Fine-Tuning and Agentic Tool Use for Neuron Kernel Generation

NKI-Agent:用于神经元内核生成的特定领域微调与智能体工具使用

Junjie Tang, Jun Huan, Hao Zhou, Yuhao Zhang, Lin Wang

机构 * AWS Neuron Team(亚马逊云科技神经元团队) Amazon Web Services(亚马逊云科技)

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.LG

AI总结 针对新兴AI加速器,介绍NKI-Agent系统,结合特定领域监督微调与编译验证修复智能体循环生成NKI内核,适配框架、构建基准并评估,显示工具使用关键及不同模型表现,为强化学习奖励设计提供指导。

Comments 7 pages. Accepted at DL4C @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04242 2026-07-07 cs.AI 新提交 70%

Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning

面向进度和可靠性的智能体强化学习组策略优化

Mingxuan Fan, Peiyang Liu

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于组的强化学习,针对步级优势估计对组形成方式敏感的问题,提出ProGPO方法,通过精确前缀动作比较及结合语义扩展与逆方差融合估计势,在任务中改进了基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03530 2026-07-07 cs.AI 新提交 70%

MentalThink: Shaping Thoughts in Mental SVG World

MentalThink:在心理SVG世界中塑造思想

Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 介绍MentalThink视觉符号推理范式,核心是think-with-SVG管道,通过两阶段训练框架实例化,在空间理解和推理基准测试中性能优越,为动态视角获取等提供可视化工作区。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03478 2026-07-07 cs.AI 新提交 70%

Demonstrating Generalization Failures via Mixtures of Conditional Policies

通过条件策略混合展示泛化失败

Jou Barzdukas, Jack Peck, Julian Schulz, Paulius Rauba, Steven Basart, Lennie Wells

机构 * University of Virginia(弗吉尼亚大学) ETH Zurich(苏黎世联邦理工学院) MATS Meridian Visiting Researcher Program(子午访问研究员计划) University of Cambridge(剑桥大学)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究前沿语言模型训练后因环境分布变化导致泛化失败的问题。提出构建语言模型的方法,用监督微调基于条件策略混合数据集得到模型,经强化学习训练后出现可控泛化失败,还借此说明未来语言模型泛化失败的新方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02020 2026-07-03 cs.AI 新提交 70%

Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails

持续多模态学习中的隐藏遗忘:当准确率幸存但基础失效时

Qianyu Chen, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对持续多模态学习中模型答案准确但证据使用方式改变的问题,提出无重放依赖约束框架RCL,通过冻结旧模型、反事实干预估计证据依赖并联合优化,有效降低隐藏遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31092 2026-07-02 cs.LG 新提交 70%

Fora: From Weight-Space to Function-Space Protection in Capability-Preserving Fine-Tuning

Fora: 从权重空间到函数空间的保护在保持能力的微调中

Rui Zhou, Tianci Xie

机构 * Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出函数空间保护方法FORA,通过输入激活协方差的主方向投影,在微调中保留模型原有能力,实验表明优于权重空间投影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31207 2026-07-01 cs.AI cs.CY 新提交 70%

Towards Inclusive Mobility Modeling: Characterizing and Evaluating Elderly Trajectory Patterns in Urban Systems

迈向包容性移动建模:城市系统中老年人轨迹模式的特征化与评估

Zhengxuan Wang, Haohan He, Mengying Zhou

机构 * School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) MOE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(上海财经大学计算与经济学交叉研究教育部重点实验室) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究利用共享单车数据,通过合成轨迹生成案例,定量评估老年人出行数据缺失对移动建模的偏差影响,并对比马尔可夫链与大语言模型在不同人口训练集下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27974 2026-06-29 cs.CV cs.AI 新提交 70%

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答

ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司) The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出渐进式多模态搜索智能体ProMSA,通过迭代选择图像搜索、文本搜索或停止,在显式工具调用预算和去重机制下,结合序列级强化学习优化,提升基于知识的视觉问答的检索和端到端准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27755 2026-06-29 cs.RO cs.AI 新提交 70%

Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

丢弃-再恢复:视觉-语言-动作模型有多冗余?

Guoheng Sun, Kaixi Feng, Shwai He, Xiaochuan Gong, Yexiao He, Ziyao Wang, Zheyu Shen, Wanghao Ye, Ramana Rao Kompella, Gaowen Liu, Ang Li

机构 * University of Maryland, College Park(马里兰大学帕克分校) Cisco Research(思科研究院)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 通过提出Drop-Then-Recovery分析协议和GateProbe敏感性指标,发现VLA模型中语言骨干高度冗余,而视觉和动作路径对移除更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27721 2026-06-29 cs.LG 新提交 70%

Learning to Reason with Curriculum II: Compositional Generalization

课程学习推理 II:组合泛化

Nived Rajaraman, Audrey Huang, Miroslav Dudik, Robert Schapire, Dylan Foster, Akshay Krishnamurthy

机构 * Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 通过递归分解序列为子问题并组合解决方案,课程学习在模拟半自动机任务中实现了比亚直接方法更优的统计复杂度,显著降低了监督需求和参考模型覆盖条件。

Comments 82 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25700 2026-06-25 cs.LG cs.RO 新提交 70%

Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning

基于低秩适配的强化学习内存高效策略库

Samuel Valland Lyngset, Tor Viljen Raanaas, Gard Sveipe, Eirik Møller Nilsen, Jim Torresen, Kai Olav Ellefsen, Tobias Lømo

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究将参数高效微调方法(如LoRA)迁移至机器人强化学习,通过PPO算法微调基线模型构建多任务策略库,实现内存占用降低20-160倍,存储节省90-95%,且成功率无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24963 2026-06-25 cs.CV cs.LG 新提交 70%

Curvature-Guided Mixing for MLLM Adaptation

曲率引导混合用于MLLM适配

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

机构 * Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院与计算机科学与工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出曲率引导混合(CGM)框架,通过二阶Hessian近似推导最优软混合比,以及硬混合变体CGM†,在LLaVA-1.5和Qwen2.5VL上改善任务专化与通用知识保持的权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24947 2026-06-25 cs.LG cs.SY eess.SY 新提交 70%

Supervised Reinforcement Learning for the Coordination of Distributed Energy Resources

分布式能源协调的监督强化学习

Haoyuan Deng, Yihong Zhou, Thomas Morstyn, Yi Wang

机构 * National Natural Science Foundation of China(国家自然科学基金) Research Grants Council of the Hong Kong SAR(香港研究资助局) Advanced Research + Invention Agency (ARIA)(高级研究与发明机构) Engineering and Physical Sciences Research Council (EPSRC)(工程与物理科学研究理事会)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出监督强化学习框架,先通过监督学习预训练策略,再经离线与在线微调,实现分布式能源高效协调,显著提升成本效益。

Comments Presented at PSCC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23321 2026-06-23 cs.CL 新提交 70%

Tmax: A simple recipe for terminal agents

Tmax: 终端智能体的简单配方

Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

机构 * Allen Institute for AI(人工智能研究院) University of Washington(华盛顿大学)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL

AI总结 提出Tmax配方,通过新颖分类法生成数据并结合结果奖励的强化学习,在9B参数下达到27%的Terminal-Bench 2.0性能,超越先前更大模型。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23063 2026-06-23 cs.CV cs.AI 新提交 70%

Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs

注意力谱正则化:无回放的连续多模态大语言模型

Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出注意力谱正则化(ASR),一种无回放的连续学习框架,通过存储技能级交叉注意力原型分布并施加谱正则化约束,有效缓解多模态大语言模型在连续微调中的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21078 2026-06-23 cs.CL 新提交 70%

A Validation-Gated Mechanistic Account of Suicidality Detection in LLMs

一种验证门控机制的自杀检测在LLMs中的解释

Nafiz Ahmed, Sarah Sharif, Dingjing Shi, Mike Banad

机构 * Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Lab(智能神经形态与量子理解创新研究与工程实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) University of Oklahoma(俄克拉荷马大学) School of Psychology(心理学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出验证门控框架,通过因果分析发现Llama-3.1-8B-Instruct在自杀检测中依赖语义特征而非关键词,且该特征在多个模型和数据集中一致出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18497 2026-06-23 cs.CR cs.AI cs.DB 新提交 70%

Ghost Vectors: Soft-Deleted Embeddings Remain Reconstructible in HNSW Vector Databases

幽灵向量:HNSW向量数据库中软删除的嵌入仍然可重构

Chandranil Chakraborttii, Jackeline García Alvarado, Sitora Abdulofizova, Shivanshu Dwivedi

机构 * Trinity College, USA(美国三一学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示HNSW向量数据库的软删除机制存在安全漏洞,被标记删除的向量仍可通过存储层恢复,并提出基于加密密钥轮换的防护方案。

Comments 13 pages, 5 figures, 12 tables. Prepared for submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18286 2026-06-18 cs.LG 新提交 70%

CODEBLOCK: Learning to Supervise Code at the Right Granularity

CODEBLOCK: 学习在正确的粒度上监督代码

Zhijie Deng, Ling Li, Jinlong Pang, Kaiqin Hu, Qi Xuan, Zhaowei Zhu, Jiaheng Wei

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) UC Santa Cruz(加州大学圣克鲁兹分校) Ant Group(蚂蚁集团) BAIA, ZJUT(浙江工业大学智能信息处理实验室) D5Data.ai

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 提出CodeBlock框架,通过选择结构完整的代码块而非孤立token进行稀疏监督,在仅使用1.9%监督token的情况下,在六个代码生成基准上取得优于全token微调的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11918 2026-06-18 cs.AI 新提交 70%

The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning

提问的艺术:一致性增强空间推理中的事实性

Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov, Federico Tombari, Leonidas Guibas

机构 * The University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) Stanford University(斯坦福大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出自监督强化学习框架,通过几何与语义一致性验证器(如图像翻转、文本对象顺序交换)对齐预训练模型的内在空间推理能力,无需标注数据即可达到接近监督方法的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17043 2026-06-16 cs.RO cs.LG 新提交 70%

Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

基于层级优势加权的在线RL微调VLA策略从稀疏回合结果

Tongyan Fang, Siyuan Huang, Naiyu Fang, Ganlong Zhao, Zhongjin Luo, Jianbo Liu, Xiaogang Wang, Ying Dong, Hongsheng Li

机构 * ACE Robotics Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 提出层级优势加权行为克隆(HABC),通过分离生存性和效率目标并自适应平衡,解决稀疏二元结果下VLA策略在线微调中的信用分配问题,在三个双臂接触任务上将成功率从12-44%提升至38-92%。

Comments Website: https://acerobotics-vla.github.io/HABC-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16110 2026-06-16 cs.LG 新提交 70%

Auditing Machine Unlearning: A Systematic Research on Whether Models Truly Forget

审计机器遗忘:关于模型是否真正遗忘的系统性研究

Dayong Ye, Tianqing Zhu, Ruiding Huang, Xinbo Fu, Jiayang Li, Bo Liu, Huan Huo, Wanlei Zhou

机构 * University of Technology Sydney(悉尼科技大学) Deakin University(迪肯大学) Macquarie University(麦考瑞大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对隐私法规需求,提出首个实用通用审计框架,通过无知证明概念验证现有遗忘算法能否真正擦除指定数据影响,实验表明重训练和微调方法有效,去优化和Fisher/Hessian方法失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16047 2026-06-16 cs.CL 新提交 70%

From Argument Components to Graphs: A Multi-Agent Debate with Confidence Gating for Argument Relations

从论证组件到图:一种具有置信门控的多智能体辩论方法用于论证关系识别

Jakub Bąba, Jarosław A. Chudziak

机构 * Faculty of Electronics and Information Technology, Warsaw University of Technology(华沙理工大学电子与信息技术学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种多智能体辩论框架,通过置信门控机制仅在不确定时进行辩论,在UKP语料上达到训练无关方法最高Macro F1,并生成可读辩论记录。

Comments Accepted for publication in the proceedings of KES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15714 2026-06-16 cs.CL cs.RO 新提交 70%

Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models

超越英语:揭示视觉-语言-动作模型中的多语言差距

Hanyang Chen, Hongliang Li, Jiarui Cao, Yang Li, Yang Jiang, Haonan Wen, Kaiyu Huang, Shengnan Guo, Huaiyu Wan

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究首次系统探究VLA模型的多语言指令跟随能力,发现英语训练模型在其他语言上性能显著下降,并提出多语言主成分对齐方法缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15693 2026-06-16 cs.SE cs.AI 新提交 70%

Imperfect Visual Verification for Code Edition : A Case Study on TikZ

代码编辑的不完美视觉验证:以TikZ为例的案例研究

Charly Reux, Mathieu Acher, Djamel Eddine Khelladi, Clément Quinton, Olivier Barais

机构 * Univ Rennes, Inria, IRISA, INSA(里昂大学、Inria、IRISA、INSA) Univ Rennes, Inria, CNRS, IUF, IRISA(里昂大学、Inria、CNRS、IUF、IRISA) Univ Rennes, Inria, CNRS, IRISA(里昂大学、Inria、CNRS、IRISA) Univ. Lille, CNRS, Inria(里尔大学、CNRS、Inria) Univ. Rennes, IRISA, Inria(里昂大学、IRISA、Inria)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对TikZ等视觉代码定制任务,研究不完美验证器在迭代精炼中的有效性,发现即使不完美验证器也能适度准确判断指令是否应用,反馈对弱模型提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14176 2026-06-15 cs.AI 新提交 70%

VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

VeriGeo: 可控几何问题生成与数值和分析验证

Xiaoxian Duan, Zequn Liu, Yingce Xia

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出VeriGeo框架,通过可执行推理轨迹和三级验证流水线,实现用户约束下的可控几何问题生成,并利用验证引导的反思修复无效生成,提升数据可靠性。

Comments 32 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12649 2026-06-12 cs.CL 新提交 70%

MentalMARBERT: Domain-Adaptive Pre-training and Two-Stage Fine-Tuning for Arabic Mental Health Disorders Detection

MentalMARBERT:面向阿拉伯语心理健康障碍检测的领域自适应预训练与两阶段微调

Fatimah Almalki, Areej Alhothali, Lulwah Alharigy, Abdulrahman Aladeem

机构 * King Abdulaziz University(阿卜杜勒阿齐兹国王大学)

专题命中 指令微调 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 针对阿拉伯语社交媒体文本中心理健康障碍检测的方言差异、非正式语言、标注资源有限和类别不平衡问题,提出领域自适应预训练与两阶段微调框架,构建含5万条推文的数据集,MentalMARBERT在宏F1和准确率上分别达到0.861和0.877。

Comments 17 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏