arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-15 至 2026-01-15 共收录 173 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 24 篇

2507.20977 2026-01-15 cs.SE cs.CR cs.LG 77%

Repairing vulnerabilities without invisible hands. A differentiated replication study on LLMs

修补漏洞而无需隐形之手。对LLMs的差异化复制研究

Maria Camporese, Fabio Massacci

机构 * University of Trento(特伦托大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过受控实验研究LLM在漏洞修复中的表现,发现其修复能力可能受隐藏因素影响,通过偏移故障位置验证模型是否能复现记忆中的修复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09609 2026-01-15 cs.CL cs.AI 73%

DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing

DPWriter: 基于多样化规划分支的强化学习用于创造性写作

Qian Cao, Yahui Liu, Wei Bi, Yi Zhao, Ruihua Song, Xiting Wang, Ruiming Tang, Guorui Zhou, Han Li

机构 * Renmin University of China(中国人民大学) Kuaishou Technology(快手科技)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DPWriter通过多样化规划分支方法提升创造性写作的输出多样性,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09049 2026-01-15 cs.CL cs.AI 73%

Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers

Grokking是否值得?Transformer中泛化电路的功能分析与可迁移性

Kaiyu He, Zhang Mian, Peilin Wu, Xinya Du, Zhiyu Chen

机构 * Department of Computer Science University of Texas at Dallas(计算机科学系 德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了Transformer中泛化电路的功能与可迁移性,发现grokking过程是整合记忆事实到自然推理路径,而非突然获得新范式,且其在迁移新知识时存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09281 2026-01-15 cs.AI 70%

STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models

STaR:用于大推理模型中去学习的敏感轨迹调节

Jingjing Zhou, Gaoxiang Cong, Li Su, Liang Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 STaR通过敏感轨迹调节方法,实现了大推理模型中高效且稳定的隐私保护去学习,减少隐私泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09430 2026-01-15 cs.CV 67%

Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs

Video-MSR: 多跳空间推理能力的MLLMs基准测试

Rui Zhu, Xin Shen, Shuchen Wu, Chenxi Miao, Xin Yu, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanjing University(南京大学) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Video-MSR通过四个任务评估MLLMs的多跳空间推理能力,发现模型在复杂推理中存在显著不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09088 2026-01-15 cs.LG cs.CL 62%

Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning

面向优越长链推理的分布对齐序列蒸馏

Shaotian Yan, Kaiyuan Liu, Chen Shen, Bing Wang, Sinan Fan, Jun Zhang, Yue Wu, Zheng Wang, Jieping Ye

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DASD-4B-Thinking模型,通过改进序列蒸馏方法,实现高效推理性能,仅用448K样本达到SOTA效果。

Comments Project Page: https://github.com/D2I-ai/dasd-thinking

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08834 2026-01-15 cs.CV cs.AI cs.CL 62%

Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR

阅读还是推理?面向文档OCR的格式解耦强化学习

Yufeng Zhong, Lei Chen, Zhixiong Zeng, Xuanle Zhao, Deyang Jiang, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Siqi Yang, Lin Ma

机构 * Meituan(美团)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出格式解耦强化学习方法,通过高熵模式优化提升文档OCR性能,在OmniDocBench上取得新记录。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 31 篇

2510.08942 2026-01-15 cs.CL 89%

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

SOP-Maze:在复杂业务标准操作规程上评估大语言模型

Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

机构 * Meituan M17(美团M17) Georgia Institute of Technology(佐治亚理工学院) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 SOP-Maze通过评估大语言模型在复杂业务标准操作规程中的表现,揭示了模型在遵循规程、对话处理和计算推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16685 2026-01-15 cs.CL 88%

Structured yet Bounded Temporal Understanding in Large Language Models

结构化但有界的大型语言模型时间理解

Damin Zhang, Julia Rayz

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过对比指示性与顺序性时间框架,揭示了大型语言模型在不同时间参考结构下对时间表示的组织方式及影响其时间理解的关键因素。

Comments Under review. Results on larger dataset. Correct a theoretical error. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08183 2026-01-15 cs.CV cs.AI 88%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08312 2026-01-15 cs.HC cs.CL 88%

Word Synchronization Challenge: A Benchmark for Word Association Responses for Large Language Models

词同步挑战:一种用于大型语言模型词关联响应的基准测试

Tanguy Cazalets, Joni Dambre

机构 * Ghent University(根特大学) Airo lab(Airo实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出词同步挑战基准测试,用于评估大型语言模型在模拟人类认知过程中的词关联能力,揭示模型复杂性对社交互动性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09626 2026-01-15 cs.LG cs.AI cs.SY eess.SY 87%

From Prompt to Protocol: Fast Charging Batteries with Large Language Models

从提示到协议:利用大语言模型实现快速充电电池

Ge Lei, Ferran Brosa Planella, Sterling G. Baird, Samuel J. Cooper

机构 * Dyson School of Design Engineering, Imperial College London(帝国理工学院伦敦设计工程学院) University of Warwick(沃里克大学) Acceleration Consortium, University of Toronto(多伦多大学加速联盟)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 利用大语言模型设计快速充电电池协议,通过Prompt-to-Optimizer和Prompt-to-Protocol方法提升充电效率和电池健康状态

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05984 2026-01-15 cs.AI cs.CL cs.HC 86%

Development and Evaluation of HopeBot: an LLM-based chatbot for structured and interactive PHQ-9 depression screening

HopeBot的开发与评估:一种基于大语言模型的聊天机器人,用于结构化和互动的PHQ-9抑郁筛查

Zhijun Guo, Alvina Lai, Julia Ive, Alexandru Petcu, Yutong Wang, Luyuan Qi, Johan H Thygesen, Kezhi Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HopeBot利用大语言模型实现结构化和互动的PHQ-9抑郁筛查,展示出作为可扩展筛查工具的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08835 2026-01-15 cs.CL cs.AI 86%

DeliberationBench: When Do More Voices Hurt? A Controlled Study of Multi-LLM Deliberation Protocols

DeliberationBench: 当更多声音有害时?多LLM协商协议的受控研究

Vaarunay Kaushal, Taranveer Singh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeliberationBench研究发现,多LLM协商协议在性能上远低于简单基线,挑战了复杂性提升质量的假设。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09250 2026-01-15 cs.CL 85%

When to Invoke: Refining LLM Fairness with Toxicity Assessment

何时触发:通过毒性评估提升LLM公平性

Jing Ren, Bowen Li, Ziqi Xu, Renqiang Luo, Shuo Yu, Xin Ye, Haytham Fayek, Xiaodong Li, Feng Xia

机构 * RMIT University(拉筹纳斯大学) Jilin University(吉林大学) Dalian University of Technology(大连理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FairToT通过推理时的提示引导毒性评估,提升LLM在不同群体间的公平性,减少群体差异并保持预测稳定性。

Comments Accepted by Findings of WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06821 2026-01-15 cs.CL cs.AI cs.SE 82%

Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems

LLMs能否生成可靠的测试用例生成器?对竞赛级编程问题的研究

Yuhan Cao, Zian Chen, Kun Quan, Ziliang Zhang, Yu Wang, Xiaoning Dong, Yeqi Feng, Guanzhong He, Jingcheng Huang, Jianhao Li, Yixuan Tan, Jiafu Tang, Yilin Tang, Junlei Wu, Qianyu Xiao, Can Zheng, Shouchen Zhou, Yuxiang Zhu, Yiming Huang, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海启智研究院) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) Fuzhou University(福州大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanjing University(南京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLMs在生成竞赛级编程问题测试用例生成器方面的能力,提出TCGBench基准测试,并通过实验发现LLMs在生成针对性测试用例以暴露代码缺陷方面存在不足。

Comments 37 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03471 2026-01-15 cs.CL cs.CY cs.LG 82%

Template-Based Probes Are Imperfect Lenses for Counterfactual Bias Evaluation in LLMs

基于模板的探测器在评估大语言模型中的反事实偏见时是不完美的透镜

Farnaz Kohankhaki, D. B. Emerson, Jacob-Junqi Tian, Laleh Seyyed-Kalantari, Faiza Khan Khattak

机构 * Vector Institute(向量研究所) York University(约克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究发现基于模板的探测器在评估大语言模型中的反事实偏见时存在系统性扭曲,需更严谨的方法以区分真实偏见与语言惯例影响。

Comments 22 Pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09367 2026-01-15 cs.CL 81%

Relation Extraction Capabilities of LLMs on Clinical Text: A Bilingual Evaluation for English and Turkish

大型语言模型在临床文本中关系抽取能力的评估:英语和土耳其语的双语评估

Aidana Aidynkyzy, Oğuz Dikenelli, Oylum Alatlı, Şebnem Bora

机构 * Department of Computer Engineering, Astana IT University(阿斯塔纳IT大学计算机工程系) Department of Computer Engineering, Ege University(埃兹尔大学计算机工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过双语评估揭示了LLM在临床文本关系抽取中的能力,提出Relation-Aware Retrieval方法,展示其在英语和土耳其语中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09387 2026-01-15 cs.CL cs.AI cs.CY 79%

Truth Knows No Language: Evaluating Truthfulness Beyond English

真理无语言:超越英语的真理性评估

Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

机构 * HiTZ Center - Ixa, University of the Basque Country, UPV/EHU(希茨中心-ixa,巴斯克大学,UPV/EHU) Elhuyar(埃尔胡亚尔) Centro de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela(智能技术研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学) Departament de Traducció i Ciències del Llenguatge, Universitat Pompeu Fabra(翻译与语言科学部门,庞培法布拉大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过专业翻译扩展TruthfulQA基准,评估多语言大型语言模型的真理性,发现机器翻译可作为替代方案,且通用知识问题在多语言中表现更佳。

Comments 14 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13291 2026-01-15 cs.CL cs.AI 79%

Higher Satisfaction, Lower Cost: A Technical Report on How LLMs Revolutionize Meituan's Intelligent Interaction Systems

更高满意度,更低成本:关于LLMs如何革新美团智能交互系统的技术报告

Xuxin Cheng, Ke Zeng, Zhiquan Cao, Linyi Dai, Wenxuan Gao, Fei Han, Ai Jian, Feng Hong, Wenxing Hu, Zihe Huang, Dejian Kong, Jia Leng, Zhuoyuan Liao, Pei Liu, Jiaye Lin, Xing Ma, Jingqing Ruan, Jiaxing Song, Xiaoyu Tan, Ruixuan Xiao, Wenhui Yu, Wenyu Zhan, Haoxing Zhang, Chao Zhou, Hao Zhou, Shaodong Zheng, Ruinian Chen, Siyuan Chen, Ziyang Chen, Yiwen Dong, Yaoyou Fan, Yangyi Fang, Yang Gan, Shiguang Guo, Qi He, Chaowen Hu, Binghui Li, Dailin Li, Xiangyu Li, Yan Li, Chengjian Liu, Xiangfeng Liu, Jiahui Lv, Qiao Ma, Jiang Pan, Cong Qin, Chenxing Sun, Wen Sun, Zhonghui Wang, Abudukelimu Wuerkaixi, Xin Yang, Fangyi Yuan, Yawen Zhu, Tianyi Zhai, Jie Zhang, Runlai Zhang, Yao Xu, Yiran Zhao, Yifan Wang, Xunliang Cai, Yangen Hu, Cao Liu, Lu Pan, Xiaoli Wang, Bo Xiao, Wenyuan Yao, Qianlin Zhou, Benchang Zhu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 美团通过WOWService技术报告,利用LLMs和多智能体架构提升智能交互系统,实现用户满意度提升和成本降低。

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07234 2026-01-15 cs.HC cs.IR stat.AP 78%

Making Absence Visible: The Roles of Reference and Prompting in Recognizing Missing Information

使缺失信息可见:参考和提示在识别缺失信息中的作用

Hagit Ben Shoshan, Joel Lanir, Pavel Goldstein, Osnat Mokryn

专题命中 评测与基准 :prompting(title,abstract)

AI总结 研究探讨了参考框架和提示如何影响用户识别数据中预期但缺失信息的能力,发现基于样本的参考和提示能提升缺失检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09029 2026-01-15 cs.CR cs.AI 77%

Proactively Detecting Threats: A Novel Approach Using LLMs

主动检测威胁:一种利用大语言模型的新方法

Aniesh Chawla, Udbhav Prasad

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型主动识别网络威胁,通过评估多个模型在提取指标 compromises 方面的性能,展示Gemini 1.5 Pro在精度和特异性上的优越表现。

Comments 2025 International Conference on Cyber-Enabled Distributed Computing and Knowledge Discovery (CyberC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09382 2026-01-15 cs.AI cs.CL 73%

Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments

长期任务导向代理:动态环境中主动的长期意图维护

Qinglong Shi, Donghai Wang, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种主动任务导向代理,通过意图条件监控和事件触发跟进,提升动态环境中长期意图维护的能力,并通过ChronosBench验证了其有效性。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09089 2026-01-15 cs.CL cs.AI 73%

SubTokenTest: A Practical Benchmark for Real-World Sub-token Understanding

SubTokenTest: 一个用于现实世界子token理解的实用基准

Shuyang Hou, Yi Hu, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SubTokenTest通过实用任务评估大语言模型在子token理解上的能力,揭示分词过程对性能的影响,并分析字符级信息的编码方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08892 2026-01-15 cs.CL cs.AI 73%

Evaluating Role-Consistency in LLMs for Counselor Training

评估LLM在辅导培训中的角色一致性

Eric Rudolph, Natalie Engert, Jens Albrecht

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(图林根应用技术大学纽伦堡乔治·西蒙·奥姆学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入对抗性数据集评估LLM在辅导培训中的角色一致性,比较了Vicuna与其他开源模型的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20224 2026-01-15 cs.CL 72%

Can Editing LLMs Inject Harm?

能否通过编辑LLM注入危害?

Canyu Chen, Baixiang Huang, Zekun Li, Zhaorun Chen, Shiyang Lai, Xiongxiao Xu, Jia-Chen Gu, Jindong Gu, Huaxiu Yao, Chaowei Xiao, Xifeng Yan, William Yang Wang, Philip Torr, Dawn Song, Kai Shu

机构 * Northwestern University(西北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL;LLM(comments)

AI总结 本文提出编辑攻击作为LLM安全威胁,揭示了通过编辑注入虚假信息和偏见的风险及高隐蔽性。

Comments Accepted to Proceedings of AAAI 2026. The first two authors contributed equally. 7 pages for main paper, 31 pages including appendix. The code, results, dataset for this paper and more resources are on the project website: https://llm-editing.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09613 2026-01-15 cs.CV cs.AI 70%

CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems

CogRail: 对智能铁路运输系统中认知入侵感知的视觉语言模型进行基准测试

Yonglin Tian, Qiyao Zhang, Wei Xu, Yutong Wang, Yihao Wu, Xinyi Li, Xingyuan Dai, Hui Zhang, Zhiyong Cui, Baoqing Guo, Zujun Yu, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院) Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 CogRail提出一个用于评估视觉语言模型在认知入侵感知任务中性能的基准,通过联合微调框架提升模型在时空推理和威胁分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09017 2026-01-15 cs.CL 70%

Multicultural Spyfall: Assessing LLMs through Dynamic Multilingual Social Deduction Game

多文化间谍迷局:通过动态多语言社交推理解谜游戏评估LLM

Haryo Akbarianto Wibowo, Alaa Elsetohy, Qinrong Cui, Alham Fikri Aji

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过动态多语言社交推理解谜游戏Spyfall评估LLM的多语言和多文化能力,发现非英语环境下模型表现较弱,提供了一种更稳健的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08849 2026-01-15 cs.CL 70%

Gaming the Answer Matcher: Examining the Impact of Text Manipulation on Automated Judgment

利用答案匹配器:考察文本操纵对自动判断的影响

Manas Khatore, Sumana Sridharan, Kevork Sulahian, Benjamin J. Smith, Shi Feng

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 研究通过测试文本操纵对自动答案匹配的影响,发现其对模型评分鲁棒,且在有参考答案时可作为替代评估方法。

Comments Accepted to the AAAI 2026 Workshop on AI Governance (AIGOV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08676 2026-01-15 cs.AI 70%

Advancing ESG Intelligence: An Expert-level Agent and Comprehensive Benchmark for Sustainable Finance

推进ESG智能:一个专家级代理和全面的可持续金融基准

Yilei Zhao, Wentao Zhang, Lei Xiao, Yandan Zheng, Mengpu Liu, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ESGAgent多代理系统及三级基准,通过高准确率在原子问题回答和专业报告生成中超越现有LLMs,为可持续金融领域提供关键评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏