arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-10 至 2025-12-10 共收录 139 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 9 篇

2511.03407 2025-12-10 cs.CL 83%

Overcoming the Generalization Limits of SLM Finetuning for Shape-Based Extraction of Datatype and Object Properties

超越基于形状的抽取数据类型和对象属性的SLM微调泛化限制

Célian Ringwald, Fabien Gandon, Catherine Faron, Franck Michel, Hanna Abi Akl

机构 * Univ. Côte d’Azur(里昂大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) I3S(信息科学与系统研究所)

专题命中 预训练与数据 :SLM(title);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文提出通过构建训练集确保属性出现次数超过阈值,以提升SLM在抽取数据类型和对象属性时的泛化能力。

Comments Accepted at KCAP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06335 2025-12-10 cs.CV 80%

Harnessing Object Grounding for Time-Sensitive Video Understanding

利用物体接地提升时间敏感视频理解

Tz-Ying Wu, Sharath Nittur Sridhar, Subarna Tripathi

机构 * Intel(英特尔公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出 GO-Tokenizer 以提升视频大型语言模型的时间敏感视频理解能力,通过实时编码紧凑的物体信息,提高模型性能并减少噪声影响。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08548 2025-12-10 cs.RO cs.AI 77%

Bridging Scale Discrepancies in Robotic Control via Language-Based Action Representations

通过基于语言的动作表示弥合机器人控制中的尺度差异

Yuchi Zhang, Churui Sun, Shiqi Liang, Diyuan Liu, Chao Ji, Wei-Nan Zhang, Ting Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出基于语言的动作表示方法,通过规范动作以缓解机器人控制中的尺度差异问题,提升操作任务的泛化能力和迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08764 2025-12-10 cs.CE 75%

Financial News Summarization: Can extractive methods still offer a true alternative to LLMs?

金融新闻摘要:提取方法是否仍然能为LLM提供真正的替代方案?

Nicolas Reche, Elvys Linhares-Pontes, Juan-Manuel Torres-Moreno

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究评估了提取方法与LLM在金融新闻摘要中的性能,发现LLM虽更连贯但易出错,而提取方法在短文本上更高效且可靠。

Comments 8 pages, 5 tables

Journal ref Advances in Soft Computing. MICAI 2025. Lecture Notes in Computer Science, vol 16221. Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01354 2025-12-10 cs.AI cs.CL cs.CY cs.LG q-fin.TR 67%

The Necessity of Imperfection:Reversing Model Collapse via Simulating Cognitive Boundedness

不完美之必要:通过模拟认知局限性逆转模型崩溃

Zhongjie Jiang

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过模拟认知局限性生成具有真实功能增益的合成数据,以解决模型崩溃问题。

Comments 60 pages,9 figures. v3: Major update. Added 3D topological visualization (Figure 1) and independent computational verification of the Adaptive Markets Hypothesis (AMH). Includes comprehensive Supplementary Materials (algorithmic pseudocode, system architecture, and real-time GARCH logs) for technical reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03544 2025-12-10 cs.AI cs.LG 62%

Gold-medalist Performance in Solving Olympiad Geometry with AlphaGeometry2

在解决奥数几何问题上超越金牌得主的AlphaGeometry2

Yuri Chervonyi, Trieu H. Trinh, Miroslav Olšák, Xiaomeng Yang, Hoang Nguyen, Marcelo Menegali, Junehyuk Jung, Junsu Kim, Vikas Verma, Quoc V. Le, Thang Luong

机构 * Google DeepMind(谷歌DeepMind) University of Cambridge(剑桥大学) Georgia Institute of Technology(佐治亚理工学院) Brown University(布朗大学) Seoul National University(首尔国立大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 AlphaGeometry2通过改进的语言模型和知识共享机制,显著提升了解决几何问题的能力,达到超越金牌得主的水平,并推动了自动系统在几何问题解决中的应用。

Comments 28 pages, 16 figures. V2: Clarified abstract, rewritten introduction, updated results on diagram generation, added acknowledgement section. V3: Added clarifications and a new section "Inequality rules", re-organized sections, added code link, now 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08968 2025-12-10 cs.CL cs.AI 62%

Detecting value-expressive text posts in Russian social media

在俄罗斯社交媒体中检测价值表达文本帖子

Maria Milkova, Maksim Rudnev, Lidia Okolskaya

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种在俄罗斯社交媒体VKontakte中准确检测价值表达文本帖子的模型,利用人类和AI辅助注释及主动学习方法,最终通过微调rubert-tiny2模型实现了高检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04713 2025-12-10 cs.CV 50%

Enabling Validation for Robust Few-Shot Recognition

使基于VLM微调的鲁棒少样本识别得以验证

Hanxin Wang, Tian Liu, Shu Kong

机构 * University of Macau(澳门大学) Texas A&M University(德克萨斯A&M大学) Institute of Collaborative Innovation(协同创新研究所)

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出VEST框架,通过验证启用的分阶段微调策略,解决少样本识别中验证数据不足的问题,提升模型在ID和OOD数据上的泛化能力。

Comments Project website: https://hannawang09.github.io/projects/vest/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08040 2025-12-10 cs.CV 50%

Lost in Translation, Found in Embeddings: Sign Language Translation and Alignment

迷失在翻译中,发现于嵌入:手语翻译与对齐

Youngjoon Jang, Liliane Momeni, Zifan Jiang, Joon Son Chung, Gül Varol, Andrew Zisserman

机构 * VGG, University of Oxford(Oxford大学视觉几何组) KAIST(韩国科学技术院) University of Zurich(苏黎世大学) LIGM, École des Ponts, IP Paris, UGE, CNRS(图像是巴黎理工学院的LIGM实验室、UGE、CNRS)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出统一模型实现手语翻译与对齐,通过轻量视觉主干、滑动感知映射网络和多任务训练策略,在BOBSL数据集上取得SLT和SSA的最先进结果,并展示跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 8 篇

2412.08179 2025-12-10 q-fin.ST cs.AI 87%

RAG-IT: Retrieval-Augmented Instruction Tuning for Automated Financial Analysis -- A Case Study for the Semiconductor Sector

RAG-IT:基于检索的指令微调用于自动化财务分析——半导体行业案例研究

Hai-Thien To, Tien-Cuong Bui, Van-Duc Le

机构 * University of Transport Technology(运输技术大学) Arontier Co., Ltd.(阿隆蒂尔公司)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 RAG-IT通过检索增强和指令微调,提升LLM在半导体行业财务分析中的性能,实现与商业系统相当的财务报告生成能力。

Comments We updated title, abstract and added more details in experiment section. We also updated the list of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08131 2025-12-10 cs.CL 79%

Universal Adversarial Suffixes for Language Models Using Reinforcement Learning with Calibrated Reward

语言模型中用于强化学习的通用对抗后缀

Sampriti Soor, Suklav Ghosh, Arijit Sur

机构 * Center for Intelligent Cyber Physical Systems, Indian Institute of Technology Guwahati, India(智能网络物理系统中心,印度理工学院古瓦哈提) Department of Computer Science and Engineering, Indian Institute of Technology Guwahati, India(计算机科学与工程系,印度理工学院古瓦哈提)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于强化学习的通用对抗后缀生成方法,通过校准交叉熵提升迁移性,并在多个NLP数据集上验证了其有效性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04652 2025-12-10 cs.AI cs.SE 79%

LLM Collaboration With Multi-Agent Reinforcement Learning

大语言模型与多智能体强化学习的协同

Shuo Liu, Tianle Chen, Zeyu Liang, Xueguang Lyu, Christopher Amato

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出MAGRPO算法,将大语言模型协同工作建模为多智能体强化学习问题,通过有效协同提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18321 2025-12-10 cs.CL cs.AI 79%

LLMs Can't Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions

大语言模型难以应对同伴压力:在多智能体社交互动中崩溃

Maojia Song, Tej Deep Pala, Ruiwen Zhou, Weisheng Jin, Amir Zadeh, Chuan Li, Dorien Herremans, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Lambda Labs(Lambda实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型在多智能体社交互动中的表现,提出KAIROS基准用于评估模型在复杂社交动态中的决策能力,发现模型规模和训练方法对抵抗社交影响至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08223 2025-12-10 cs.CV 75%

SOP^2: Transfer Learning with Scene-Oriented Prompt Pool on 3D Object Detection

SOP²:基于场景导向提示池的3D目标检测迁移学习

Ching-Hung Cheng, Hsiu-Fu Wu, Bing-Chen Wu, Khanh-Phong Bui, Van-Tin Luu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) Internet of Things Laboratory(物联网实验室) Chunghwa Telecom Laboratories(中华电信实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出SOP²,一种基于场景导向提示池的3D目标检测迁移学习方法,旨在提升模型在不同场景下的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07814 2025-12-10 cs.SE cs.AI cs.CR 70%

Understanding Privacy Risks in Code Models Through Training Dynamics: A Causal Approach

通过训练动态理解代码模型中的隐私风险:一种因果方法

Hua Yang, Alejandro Velasco, Sen Fang, Bowen Xu, Denys Poshyvanyk

机构 * North Carolina State University(北卡罗来纳州立大学) William & Mary(威廉与玛丽学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过因果方法分析代码模型中不同PII类型的泄露风险差异,揭示了泄露风险与可学习性之间的因果关系,并为开发类型感知的防御策略提供依据。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08763 2025-12-10 cs.LG 57%

Learning and Editing Universal Graph Prompt Tuning via Reinforcement Learning

通过强化学习学习和编辑通用图提示微调

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Yijie Li, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :prompting(abstract);分类 cs.LG

AI总结 本文提出LEAP模型,通过强化学习在保留通用图提示理论基础的同时,优化提示选择与编辑,提升图和节点任务的性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08897 2025-12-10 cs.CV 50%

UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation

UniLayDiff: 一种统一的扩散变换器用于内容感知的布局生成

Zeyang Liu, Le Wang, Sanping Zhou, Yuxuan Wu, Xiaolong Sun, Gang Hua, Haoxiang Li

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) Amazon.com, Inc.(亚马逊公司) Pixocial Technology(Pixocial技术)

专题命中 指令微调 :pretraining(abstract)

AI总结 UniLayDiff通过统一的扩散变换器框架,首次实现了内容感知布局生成任务的端到端统一生成,提升了布局质量和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 5 篇

2510.05526 2025-12-10 cs.LG cs.AI 89%

Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment

可证明地同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余

Ziyi Chen, Junyi Li, Peiran Yu, Heng Huang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RLHF-COV和DPO-COV算法,同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余问题,并通过理论证明和实验验证其有效性。

Comments Edited a few incorrect numbers in Tables 2 and 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08153 2025-12-10 cs.LG cs.AI cs.CV 81%

TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models

TreeGRPO:基于树优势的在线强化学习后训练扩散模型

Zheng Ding, Weirui Ye

机构 * UC San Diego(圣迭戈大学) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 TreeGRPO通过树结构提升扩散模型后训练效率,实现2.4倍加速并优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17923 2025-12-10 cs.LG cs.AI 73%

Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning

奖励旅程,而非仅终点:一种复合路径和答案自评分奖励机制用于测试时强化学习

Jingyu Xing, Chenwei Tang, Xinyu Liu, Deng Xiong, Shudong Huang, Wei Ju, Jiancheng Lv, Ziyue Qiao

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Great Bay University(大湾大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 COMPASS通过自评分机制提升测试时强化学习的推理能力,增强模型分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08449 2025-12-10 cs.AI 57%

From Accuracy to Impact: The Impact-Driven AI Framework (IDAIF) for Aligning Engineering Architecture with Theory of Change

从准确度到影响:用于对齐工程架构与影响理论的影响力驱动AI框架(IDAIF)

Yong-Woon Kim

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 IDAIF通过整合影响理论与AI架构,提供了一种以影响为中心的AI开发框架,旨在提升AI系统的伦理性和社会价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08129 2025-12-10 cs.LG 57%

Improving the Sensitivity of Backdoor Detectors via Class Subspace Orthogonalization

通过类别子空间正交化提高后门检测器的灵敏度

Guangmingmei Yang, David J. Miller, George Kesidis

机构 * School of EECS, Penn State(EECS学院,宾夕法尼亚州立大学) Anomalee Inc.(Anomalee公司) University Park, PA, USA(宾夕法尼亚州大学公园分校) State College, PA, USA(宾夕法尼亚州州立大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出通过抑制类别内在特征并正交化以提高后门检测器灵敏度,针对混合标签和自适应攻击进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 4 篇

2510.16809 2025-12-10 cs.SE cs.AI cs.CL cs.PL 90%

When Many-Shot Prompting Fails: An Empirical Study of LLM Code Translation

当多示例提示失效:对LLM代码翻译的实证研究

Amirkia Rafiei Oskooei, Kaan Baturalp Cosdan, Husamettin Isiktas, Mehmet S. Aktas

机构 * Yildiz Technical University, Department of Computer Engineering(Yildiz技术大学计算机工程系)

专题命中 长上下文与记忆 :prompting(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本研究发现代码翻译中少量精心挑选的示例比大量示例更有效,挑战了ICL中'更多更好'的普遍假设。

Comments Accepted to ICSE 2026 (RECODE workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08242 2025-12-10 cs.DC cs.AR 85%

Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency

Chopper:一个多级GPU特性工具及对LLM训练低效性的衍生见解

Marco Kurzynski, Shaizeen Aga, Di Wu

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Chopper通过多级GPU特性分析揭示LLM训练低效原因,发现频率开销是性能差距的主要因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07850 2025-12-10 cs.LG cs.AI 81%

SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents

SABER: 小动作,大误差 -- 保护LLM代理中的突变步骤

Alejandro Cuadron, Pengfei Yu, Yang Liu, Arpit Gupta

机构 * Amazon AGI Foundations(亚马逊人工智能基础研究)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 SABER通过分析LLM代理中的突变步骤,提出针对性保护措施,提升长周期任务的稳定性。

Comments submitted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08143 2025-12-10 cs.CL cs.AI 79%

Compactor: Calibrated Query-Agnostic KV Cache Compression with Approximate Leverage Scores

Compactor: 基于近似杠杆分数的校准查询无关KV缓存压缩

Vivek Chari, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Compactor通过近似杠杆分数实现查询无关的KV缓存压缩,减少内存占用并提升性能,适用于多种语言模型部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 25 篇

2511.10384 2025-12-10 cs.SI cs.AI cs.CL cs.CY 90%

Simulating Misinformation Propagation in Social Networks using Large Language Models

利用大语言模型模拟社交媒体上的虚假信息传播

Raj Gaurav Maurya, Vaibhav Shukla, Raj Abhijit Dandekar, Rajat Dandekar, Sreedath Panat

机构 * Vizuara AI Labs(Vizuara AI实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大语言模型模拟社交媒体虚假信息传播,通过构建人格代理网络研究虚假信息演变机制,揭示身份和意识形态驱动的人格加速虚假信息扩散,专家驱动人格则保持事实稳定。

Comments Accepted to CIKM 2025 Workshop LASS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15365 2025-12-10 cs.HC cs.AI cs.CL cs.CY 90%

Identifying Features that Shape Perceived Consciousness in Large Language Model-based AI: A Quantitative Study of Human Responses

识别塑造大语言模型基AI中感知意识的特征:人类反应的定量研究

Bongsu Kang, Jundong Kim, Tae-Rim Yun, Hyojin Bae, Chang-Eop Kim

机构 * Department of Physiology Gachon University College of Korean Medicine(生理学系高丽大学医学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析人类对AI意识感知的特征,揭示了元认知自我反思和情绪表达对意识感知的影响,同时指出知识过度强调会降低感知意识。

Comments 11 pages, 3 figures, 4 tables

Journal ref Computers in Human Behavior Reports, Volume 21 (2026) 100901

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08145 2025-12-10 cs.RO cs.AI 89%

Chat with UAV -- Human-UAV Interaction Based on Large Language Models

与无人机对话——基于大语言模型的人机交互

Haoran Wang, Zhuohang Chen, Guang Li, Bo Ma, Chuanghuang Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的双智能体HUI框架,通过任务规划和执行智能体提升无人机交互的个性化和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08480 2025-12-10 cs.CL 88%

Soft Inductive Bias Approach via Explicit Reasoning Perspectives in Inappropriate Utterance Detection Using Large Language Models

通过显式推理视角的软归纳偏见方法用于大型语言模型中的不当言论检测

Ju-Young Kim, Ji-Hong Park, Se-Yeon Lee, Sujin Park, Gun-Woo Kim

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出一种通过显式推理视角的软归纳偏见方法,用于提升大型语言模型在不当言论检测中的准确性和一致性。

Comments in Korean language, Published in the Proceedings of the 37th Annual Conference on Human and Language Technology, 2025, pp. 714-719. (English translation assisted by GPT)

Journal ref Proceedings of the 37th Annual Conference on Human and Language Technology, 2025, pp. 714-719

详情

展开后加载摘要…

URL PDF HTML 收藏