arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-12 至 2026-01-12 共收录 159 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 5 篇

2601.05776 2026-01-12 cs.CL 88%

One Script Instead of Hundreds? On Pretraining Romanized Encoder Language Models

一个脚本而不是数百个?关于预训练罗马化编码语言模型

Benedikt Ebing, Lennart Keller, Goran Glavaš

机构 * Center for Artificial Intelligence and Data Science(人工智能与数据科学中心) University of Würzburg(乌尔姆大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 研究通过预训练罗马化和原始文本,探讨罗马化在多语言模型中的有效性,发现分段脚本语言性能损失小,而形态音节脚本语言需更高保真度罗马化以缓解退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-01-12 cs.CL cs.AI 79%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05641 2026-01-12 cs.CL cs.LG 79%

Multilingual Amnesia: On the Transferability of Unlearning in Multilingual LLMs

多语言失忆:多语言大语言模型中卸载的可转移性研究

Alireza Dehghanpour Farashah, Aditi Khandelwal, Marylou Fauchard, Zhuan Shi, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Google Research(谷歌研究)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨多语言大语言模型中卸载的可转移性,通过实验发现语法相似性是预测跨语言卸载行为的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05385 2026-01-12 cs.SE 71%

DafnyPro: LLM-Assisted Automated Verification for Dafny Programs

DafnyPro:基于LLM的自动验证框架用于Dafny程序

Debangshu Banerjee, Olivier Bouissou, Stefan Zetzsche

专题命中 预训练与数据 :LLM(title)

AI总结 DafnyPro通过增强LLM生成验证注释的能力,提升了Dafny程序的自动验证效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05397 2026-01-12 cs.CV 50%

Neural-Driven Image Editing

神经驱动的图像编辑

Pengfei Zhou, Jie Xia, Xiaopeng Peng, Wangbo Zhao, Zilong Ye, Zekai Li, Suorong Yang, Jiadong Pan, Yuanxiang Chen, Ziqiao Wang, Kai Wang, Qian Zheng, Hao Jin, Xiaojun Chang, Gang Pan, Shurong Dong, Kaipeng Zhang, Yang You

机构 * NUS(国立新加坡大学) ZJU(浙江大学) RIT(罗切斯特理工学院) NJU(南京大学) USTC(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) SII(上海信息所) Hangzhou RongNao Tech(杭州融纳科技)

专题命中 预训练与数据 :prompting(abstract)

AI总结 LoongX通过多模态神经信号驱动图像编辑,结合扩散模型和对比学习实现高性能图像编辑任务。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 8 篇

2601.05874 2026-01-12 cs.CL cs.AI 91%

Continual-learning for Modelling Low-Resource Languages from Large Language Models

连续学习用于从大语言模型中建模低资源语言

Santosh Srinath K, Mudit Somani, Varun Reddy Padala, Prajna Devi Upadhyay, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Sciences, Pilani, India(机器智能组,计算机科学与信息系,比拉理工学院和科学学院,印度帕利尼)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

AI总结 本文提出利用基于词性的代码切换和重放适配器策略,解决从大语言模型构建小语言模型时的灾难性遗忘问题,并在视觉语言任务中验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05970 2026-01-12 cs.CL cs.AI 90%

Let's Put Ourselves in Sally's Shoes: Shoes-of-Others Prefilling Improves Theory of Mind in Large Language Models

让我们站在莎莉身上:他人之鞋预填法提升大语言模型的理论心智能力

Kazutoshi Shinoda, Nobukatsu Hojo, Kyosuke Nishida, Yoshihiro Yamazaki, Keita Suzuki, Hiroaki Sugiyama, Kuniko Saito

机构 * NTT, Inc.(日本电报电话公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 通过'他人之鞋预填'方法提升大语言模型的理论心智能力,该方法通过引导模型站在目标角色视角来增强其心理状态理解能力。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05501 2026-01-12 cs.LG cs.CL 86%

Hi-ZFO: Hierarchical Zeroth- and First-Order LLM Fine-Tuning via Importance-Guided Tensor Selection

Hi-ZFO:通过重要性引导的张量选择实现层次化零阶和一阶LLM微调

Feihu Jin, Ying Tan

机构 * School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Hi-ZFO通过结合一阶和零阶优化,提升LLM微调的精度与探索能力,有效解决训练中的局部极小值问题。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11741 2026-01-12 cs.AI cs.CL cs.LG 85%

Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?

攀登推理的阶梯:在SFT之后,大语言模型能解决什么问题?

Yiyou Sun, Georgia Zhou, Haoyue Bai, Hao Wang, Dacheng Li, Nouha Dziri, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of Wisconsin, Madison(威斯康星大学麦迪逊分校) Allen Institute for AI(人工智能研究院)

专题命中 指令微调 :SFT(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析AIME24数据集,揭示了大语言模型在数学推理任务中不同难度层级的进阶要求,发现SFT对提升推理能力有限,而扩大数据规模更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12281 2026-01-12 cs.CL cs.LG 82%

Cmprsr: Abstractive Token-Level Question-Agnostic Prompt Compressor

Cmprsr: 基于抽象的token级问题无关提示压缩器

Ivan Zakazov, Berke Argin, Oussama Gabouj, Kamel Charaf, Alexander Sharipov, Alexi Semiz, Lorenzo Drudi, Nicolas Baldwin, Robert West

机构 * Compresr Inc.(Compresr公司) EPFL(瑞士联邦理工学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Cmprsr通过优化压缩元提示和微调技术,在多种压缩率下实现高效且高质量的提示压缩,适用于不同输入长度和领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05637 2026-01-12 cs.AI cs.LG cs.SY eess.SY 73%

GenCtrl -- A Formal Controllability Toolkit for Generative Models

GenCtrl -- 生成模型的正式可控性工具包

Emily Cheng, Carmen Amo Alonso, Federico Danieli, Arno Blaas, Luca Zappella, Pau Rodriguez, Xavier Suau

机构 * Apple(苹果公司) Universitat Pompeu Fabra(庞培法布拉大学) Stanford(斯坦福大学)

专题命中 指令微调 :language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 GenCtrl 提出了一种理论框架,用于评估生成模型的可控性,并通过实验展示了可控性在不同任务中的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12409 2026-01-12 cs.CV 71%

Branch, or Layer? Zeroth-Order Optimization for Continual Learning of Vision-Language Models

分支还是层?零阶优化用于视觉-语言模型的持续学习

Ziwei Liu, Borui Kang, Wei Li, Hangjie Yuan, Yanbing Yang, Wenbin Li, Yifan Zhu, Tao Feng, Jun Luo

专题命中 指令微调 :language model(title)

AI总结 本文提出一种基于零阶优化的视觉-语言模型持续学习方法,通过模态感知策略提升模型逃避局部极小值的能力,实验表明在四个基准测试中取得最佳性能。

Comments Published in the Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05258 2026-01-12 cs.IR cs.AI cs.HC 57%

From Events to Trending: A Multi-Stage Hotspots Detection Method Based on Generative Query Indexing

从事件到趋势:一种基于生成查询索引的多阶段热点检测方法

Kaichun Wang, Yanguang Chen, Ting Zhang, Mengyao Bao, Keyu Chen, Xu Hu, Yongliang Wang, Jingsheng Yang, Jinsong Zhang, Fei Lu

机构 * Bytedance Shanghai China(字节跳动上海中国)

专题命中 指令微调 :LLM(abstract);分类 cs.AI

AI总结 本文提出了一种基于生成查询索引的多阶段热点检测方法,通过离线生成和在线识别相结合,提升对话系统中趋势查询的检测效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 5 篇

2601.05607 2026-01-12 cs.LG 70%

Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR

协调标记与序列:动态混合策略优化用于RLVR

Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05688 2026-01-12 cs.CV 67%

SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More

SketchVL:通过细粒度信用分配进行政策优化以实现图表理解和更多

Muye Huang, Lingling Zhang, Yifei Li, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University, China(计算机科学与技术学院,西安交通大学) MOE KLINNS Lab, Xi’an Jiaotong University, China(教育部KLINNS实验室,西安交通大学) Zhongguancun Academy, Beijing, China(中关村学院,北京)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 SketchVL通过细粒度信用分配优化,提升多模态大语言模型在图表理解和多领域推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV 67%

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06021 2026-01-12 cs.CL 57%

Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards

证据链的构建:基于引用感知的鲁棒深度搜索代理强化学习

Jiajie Zhang, Xin Lv, Ling Feng, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 本文提出引用感知评分框架和组相对策略优化方法,用于提升深度搜索代理的鲁棒性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02151 2026-01-12 cs.CV 50%

AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models

AttriCtrl: 细粒度控制扩散模型中的审美属性强度

Die Chen, Zhongjie Duan, Zhiwen Li, Cen Chen, Daoyuan Chen, Yaliang Li, Yingda Chen

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 AttriCtrl通过轻量级框架实现扩散模型中审美属性的细粒度连续控制,提升生成图像的个性化与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 7 篇

2601.05262 2026-01-12 cs.IR cs.AI cs.CL 88%

LLM2IR: simple unsupervised contrastive learning makes long-context LLM great retriever

LLM2IR: 简单的无监督对比学习使长上下文LLM成为强大的检索器

Xiaocong Yang

机构 * Computer Science(计算机科学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 LLM2IR通过简单无监督对比学习将长上下文LLM转化为高效检索器,验证了上下文长度与检索能力的关系。

Comments MS Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05589 2026-01-12 cs.CL cs.AI 73%

ACR: Adaptive Context Refactoring via Context Refactoring Operators for Multi-Turn Dialogue

ACR: 通过上下文重构运算符进行多轮对话的自适应上下文重构

Jiawei Shen, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Qingyu Niu, Guoqing Ma, Yidan Liang, Jingjiang Liu, Yiling Wang, Shimin Di, Jiajie Xu

机构 * Zhejiang Normal University(浙江师范大学) Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Southeast University(东南大学) Soochow University(苏州大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ACR通过动态上下文重构运算符和教师指导的自我进化训练范式,有效缓解多轮对话中的上下文惯性和状态漂移问题,提升对话性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02163 2026-01-12 cs.AI cs.CL 73%

EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning

EverMemOS:一种用于结构化长时程推理的自组织记忆操作系统

Chuanrui Hu, Xingze Gao, Zuyi Zhou, Dannong Xu, Yi Bai, Xintong Li, Hui Zhang, Tong Li, Chong Zhang, Lidong Bing, Yafeng Deng

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EverMemOS通过自组织记忆系统提升长时程推理能力,实现事件轨迹捕捉、语义整合与重构性回忆,有效增强记忆增强推理任务的性能。

Comments 16 pages, 7 figures, 12 tables. Code available at https://github.com/EverMind-AI/EverMemOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01739 2026-01-12 cs.CL cs.AI 73%

K-EXAONE Technical Report

K-EXAONE 技术报告

Eunbi Choi, Kibong Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Hyunjik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Jiwon Ham, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Yonghwan Jo, Jiyeon Jung, Naeun Kang, Dohoon Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Hyunseo Kim, Jieun Kim, Minu Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, YoungJin Kim, Chaeeun Lee, Chaeyoon Lee, Changhun Lee, Dahm Lee, Edward Hwayoung Lee, Honglak Lee, Jinsang Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Solji Lim, Woohyung Lim, Chanwoo Moon, Jaewoo Park, Jinho Park, Yongmin Park, Hyerin Seo, Wooseok Seo, Yongwoo Song, Sejong Yang, Sihoon Yang, Chang En Yea, Sihyuk Yi, Chansik Yoon, Dongkeun Yoon, Sangyeon Yoon, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究所)

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 K-EXAONE是一款由LG AI Research开发的大型多语言语言模型,基于专家混合架构,支持256K-token上下文窗口,具备多语言能力,其性能与同类开源模型相当,适用于多种工业和研究应用。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06994 2026-01-12 cs.SE cs.PL 67%

Phaedrus: Predicting Dynamic Application Behavior with Lightweight Generative Models and LLMs

Phaedrus:利用轻量级生成模型和大语言模型预测动态应用程序行为

Bodhisatwa Chatterjee, Neeraj Jadhav, Santosh Pande

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 Phaedrus通过轻量级生成模型和大语言模型预测动态应用程序行为,实现无需执行的高效编译器优化。

Journal ref OOPSLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05215 2026-01-12 cs.AI 57%

MineNPC-Task: Task Suite for Memory-Aware Minecraft Agents

MineNPC-Task: 用于记忆感知Minecraft代理的任务套件

Tamil Sudaravan Mohan Doss, Michael Xu, Sudha Rao, Andrew D. Wilson, Balasaravanan Thoravi Kumaravel

机构 * Microsoft(微软) Microsoft Research(微软研究院) Microsoft Research United States(微软研究院美国)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 MineNPC-Task通过与专家玩家共同游戏生成任务,评估记忆感知Minecraft代理在开放世界中的表现,发现代码执行等任务中的崩溃模式,并提出改进内存持久性的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14376 2026-01-12 cs.CL 57%

Graph-Guided Passage Retrieval for Author-Centric Structured Feedback

基于图的论文检索用于作者导向的结构化反馈

Maitreya Prafulla Chitale, Ketaki Mangesh Shetye, Harshit Gupta, Manav Chaudhary, Manish Shrivastava, Vasudeva Varma

机构 * IIIT Hyderabad(IIIT海得拉尔学院) Microsoft, India(微软公司) Sentisum(Sentisum公司)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 AutoRev通过基于图的检索增强生成框架,为作者提供结构化反馈,提升预提交阶段的高质量指导生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 38 篇

2601.05632 2026-01-12 eess.SY cs.SY 91%

LLM-DMD: Large Language Model-based Power System Dynamic Model Discovery

基于大语言模型的电力系统动态模型发现:LLM-DMD

Chao Shen, Zihan Guo, Ke Zuo, Wenqi Huang, Mingyang Sun

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 LLM-DMD通过结合大语言模型的推理和代码生成能力,利用两个循环发现电力系统动态方程并强制代数约束,从而实现高保真动态模型的构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05445 2026-01-12 cs.CR cs.LG 89%

Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models

基于知识的多轮对抗攻击大语言模型

Songze Li, Ruishi He, Xiaojun Jia, Jun Wang, Zhihui Fu

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) OPPO Research Institute(OPPO研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 Mastermind通过动态知识库和分层规划架构,实现对大语言模型的高效多轮对抗攻击,显著提升攻击效果和防御韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09896 2026-01-12 cs.CR 89%

ChatIoT: Large Language Model-based Security Assistant for Internet of Things with Retrieval-Augmented Generation

ChatIoT: 基于大语言模型的物联网安全助手与检索增强生成

Ye Dong, Yan Lin Aung, Sudipta Chattopadhyay, Jianying Zhou

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 ChatIoT是一种基于大语言模型的物联网安全助手,通过检索增强生成技术整合安全信息,提升用户在物联网安全实践中的指导与响应能力。

Comments preprint, under revision, 19 pages, 13 figures, 8 tables

Journal ref ACNS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08098 2026-01-12 cs.CL cs.AI 88%

The Price of Thought: A Multilingual Analysis of Reasoning, Performance, and Cost of Negotiation in Large Language Models

思考的成本:多语言下大型语言模型谈判能力、表现与成本的分析

Sherzod Hakimov, Roland Bernard, Tim Leiber, Karl Osswald, Kristina Richert, Ruilin Yang, Raffaella Bernardi, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(波恩-博兹恩大学语言学系) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)) Free University of Bozen-Bolzano(博兹恩-博尔扎诺自由大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了多语言环境下大型语言模型谈判能力的表现与成本,发现启用推理能提升谈判效果但增加计算成本,且开源模型在多语言谈判中倾向于使用英语推理。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09993 2026-01-12 cs.AI 86%

SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models

SPAN:大型语言模型跨日历时间推理的基准测试与改进

Zhongjian Miao, Hao Fu, Chen Wei

机构 * Li Auto(利亚特)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 SPAN通过开发时间代理提升大型语言模型跨日历时间推理能力,实验显示其准确率高达95.31%

Comments Accepted at the AAAI 2026 conference. This version includes the supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏