arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-09 至 2026-01-09 共收录 225 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 48 篇

2601.05059 2026-01-09 cs.CV cs.LG 79%

From Understanding to Engagement: Personalized pharmacy Video Clips via Vision Language Models (VLMs)

从理解到参与:通过视觉语言模型(VLMs)生成个性化药学视频片段

Suyash Mishra, Qiang Li, Srikanth Patil, Anubhav Girdhar

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出基于视觉语言模型和音频语言模型的个性化药学视频片段生成方法,通过剪切合并算法和个性化机制提升生成效率与质量,实现制药行业内容处理的高效自动化。

Comments Contributed original research to top tier conference in VLM; currently undergoing peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04252 2026-01-09 cs.SE cs.CL 79%

Sphinx: Benchmarking and Modeling for LLM-Driven Pull Request Review

Sphinx:基于LLM的拉取请求审查的基准测试与建模

Daoan Zhang, Shuo Zhang, Zijian Jin, Jiebo Luo, Shengyu Fu, Elsie Nallipogu

机构 * University of Rochester(罗切斯特大学) Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 Sphinx通过结构化数据生成、检查表评估基准和CRPO训练范式,提升LLM在拉取请求审查中的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01513 2026-01-09 cs.CL 79%

Evaluation and Facilitation of Online Discussions in the LLM Era: A Survey

在大语言模型时代评估和促进在线讨论:一篇综述

Katerina Korre, Dimitris Tsirmpas, Nikos Gkoumas, Emma Cabalé, Danai Myrtzani, Theodoros Evgeniou, Ion Androutsopoulos, John Pavlopoulos

机构 * Archimedes, Athena Research Center(阿希米德研究中心) Athens University of Economics and Business(雅典经济与商业大学) École Normale Supérieure Paris-Saclay(巴黎萨克雷高等师范学校) INSEAD

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文综述了大语言模型时代在线讨论评估与促进方法,提出新的评估分类、干预策略及未来研究方向。

Comments To appear in EMNLP 2025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05111 2026-01-09 cs.CL cs.AI 79%

Agent-as-a-Judge

代理作为裁判

Runyang You, Hongru Cai, Caiqi Zhang, Qiancheng Xu, Meng Liu, Tiezheng Yu, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Cambridge(剑桥大学) Shandong Jianzhu University(山东建筑大学) Huawei Technologies(华为技术)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于代理的评估框架,通过规划、工具验证和多代理协作提升评估的鲁棒性和可验证性,并提供了该领域的发展分类和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM 79%

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04632 2026-01-09 cs.CL cs.AI 79%

From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset

从国家课程到文化意识:构建开放性文化特定问答数据集

Haneul Yoo, Won Ik Cho, Geunhye Kim, Jiyoon Han

机构 * KAIST AI Center(韩国国立科学技术院人工智能中心) Samsung Electronics(三星电子) Hankuk University of Foreign Studies(韩国外语大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CuCu框架,利用国家课程构建文化特定的开放性问答数据集KCaQA,以提升语言模型在文化对齐方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04201 2026-01-09 cs.CL cs.AI cs.CY cs.HC 79%

Collective Narrative Grounding: Community-Coordinated Data Contributions to Improve Local AI Systems

集体叙事 grounding:社区协调的数据贡献以改进本地 AI 系统

Zihan Gao, Mohsin Y. K. Yousufi, Jacob Thebault-Spieker

机构 * Information Science University of Wisconsin-Madison(信息科学大学威斯康星大学麦迪逊分校) Digital Media Georgia Tech(数字媒体佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出集体叙事 grounding 协议,通过社区协调的数据贡献,改进本地 AI 系统,解决社区特定查询的问答问题。

Comments 9 pages, 2 figures, Presented at the NeurIPS 2025 ACA Workshop accepted-papers.html" target="_blank" rel="noopener">https://acaworkshop.github.io/accepted-papers.html,

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09487 2026-01-09 cs.CE 78%

Benchmarking Time Series Foundation Models for Short-Term Household Electricity Load Forecasting

对短期家庭用电负荷预测的时间序列基础模型进行基准测试

Marcel Meyer, David Zapata, Sascha Kaltenpoth, Oliver Müller

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文比较了时序基础模型与从头开始训练的Transformer方法在短期家庭用电负荷预测中的性能,发现某些基础模型在输入增加时表现更优,且训练成本更低。

Comments This article has been accepted for publication in IEEE Access

Journal ref IEEE Access, vol. 13, pp. 218141-218153, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11399 2026-01-09 cs.CL cs.CV 77%

Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction

最短片段,最大显著性:通过关键时刻提取实现长视频摘要

Galann Pennec, Zhengyuan Liu, Nicholas Asher, Philippe Muller, Nancy F. Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种通过关键时刻提取实现长视频多模态摘要的方法,利用轻量级模型和大型语言模型实现高效摘要生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07505 2026-01-09 cs.LG 77%

PEAR: Planner-Executor Agent Robustness Benchmark

PEAR:规划-执行代理鲁棒性基准

Shen Dong, Mingxuan Zhang, Pengfei He, Li Ma, Bhavani Thuraisingham, Hui Liu, Yue Xing

机构 * Michigan State University(密歇根州立大学) Purdue University(普渡大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PEAR基准通过评估规划-执行多智能体系统的鲁棒性,揭示了规划器弱点对任务性能的影响及鲁棒性与性能的权衡。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10991 2026-01-09 cs.CR cs.AI 77%

MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI

MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全

Wenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26699 2026-01-09 cs.SE 75%

Using Copilot Agent Mode to Automate Library Migration: A Quantitative Assessment

使用 Copilot Agent 模式自动化库迁移:一项定量评估

Aylton Almeida, Laerte Xavier, Marco Tulio Valente

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过 Copilot Agent 模式评估了 SQLAlchemy 库迁移的自动化效果,发现其在功能迁移上表现良好但应用功能维护不足。

Comments Accepted at 1st International Workshop on Agentic Engineering (AGENT 2026, colocated with ICSE), pages 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04554 2026-01-09 cs.IR 75%

Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing

探索推荐系统评估:一种用于A/B测试的多模态用户代理框架

Wenlin Zhang, Xiangyang Li, Qiyuan Ge, Kuicai Dong, Pengyue Jia, Xiaopeng Li, Zijian Zhang, Maolin Wang, Yichao Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种多模态用户代理框架,用于替代传统A/B测试,通过模拟真实用户行为提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06842 2026-01-09 cs.CL cs.AI 73%

PCoT: Persuasion-Augmented Chain of Thought for Detecting Fake News and Social Media Disinformation

PCoT:增强说服力的推理链用于检测虚假新闻和社会媒体谣言

Arkadiusz Modzelewski, Witold Sosnowski, Tiziano Labruna, Adam Wierzbicki, Giovanni Da San Martino

机构 * University of Padua(帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PCoT通过整合说服知识提升零样本虚假信息检测性能,实验表明其在五个LLM和五个数据集上平均提升15%。

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04790 2026-01-09 cs.CL cs.AI 73%

Belief in Authority: Impact of Authority in Multi-Agent Evaluation Framework

权威信念:权威在多智能体评估框架中的影响

Junhyuk Choi, Jeongyoun Kwon, Heeju Kim, Haeun Cho, Hayeong Jung, Sehee Min, Bugeun Kim

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了权威角色在多智能体评估中的影响,发现专家和参照角色比合法角色更具影响力,并揭示了权威偏见的产生机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04469 2026-01-09 cs.CL cs.IR cs.LG 73%

SampoNLP: A Self-Referential Toolkit for Morphological Analysis of Subword Tokenizers

SampoNLP:一种用于子词分词形态分析的自指工具包

Iaroslav Chelombitko, Ekaterina Chelombitko, Aleksey Komissarov

机构 * DataSpike Neapolis University(内apolis大学) aglabx

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 SampoNLP通过自指原子性评分创建形态词典,评估BPE分词器在不同词汇量下的性能,提出IPS指标并提供最优词汇量推荐。

Comments Accepted to the 10th International Workshop on Computational Linguistics for Uralic Languages (IWCLUL 2025), pp. 57-67

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05103 2026-01-09 cs.DL cs.CL 70%

Semantically Orthogonal Framework for Citation Classification: Disentangling Intent and Content

引文分类的语义正交框架:分离意图与内容

Changxu Duan, Zhiyin Tan

机构 * Technische Universität Darmstadt, Darmstadt, Germany(德累斯顿技术大学) L3S Research Center, Leibniz University Hannover, Hannover, Germany(汉诺威莱布尼茨大学L3S研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SOFT通过分离引文意图与内容类型,提升引文分类的准确性和跨领域泛化能力。

Comments Accepted at the 29th International Conference on Theory and Practice of Digital Libraries (TPDL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05101 2026-01-09 cs.AI 70%

Arabic Prompts with English Tools: A Benchmark

阿拉伯提示与英语工具:一个基准

Konstantin Kubrak, Ahmed El-Moselhy, Ammar Alsulami, Remaz Altuwaim, Hassan Ismail Fawaz, Faisal Alsaby

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出首个阿拉伯语言LLMs工具调用能力评估基准,揭示阿拉伯语交互环境下工具调用准确率下降5-10%的显著差距。

Comments 10 pages, 10 figures, LLMs, Big Data, and Multilinguality for All (LLMs4All) Workshop at IEEE BigData 2025 Conference, Macau, December 10, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05099 2026-01-09 cs.DL cs.CL cs.IR 70%

Multi-Disciplinary Dataset Discovery from Citation-Verified Literature Contexts

从引用验证的文献上下文中发现多学科数据集

Zhiyin Tan, Changxu Duan

机构 * L3S Research Center(L3S研究所以)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于文献引用上下文的数据集发现方法,通过结合大规模引用提取、模式引导识别和大型语言模型,实现了比现有搜索引擎更高的召回率,并揭示了额外高实用性的数据集。

Comments Accepted at the 25th ACM/IEEE Joint Conference on Digital Libraries (JCDL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04879 2026-01-09 cs.CL 70%

Mind2Report: A Cognitive Deep Research Agent for Expert-Level Commercial Report Synthesis

Mind2Report: 一种用于专家级商业报告综合的认知深度研究代理

Mingyue Cheng, Daoyu Wang, Qi Liu, Shuo Yu, Xiaoyu Tao, Yuqian Wang, Chengzhong Chu, Yu Duan, Mingkang Long, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Engineering Institute, iFLYTEK Co., Ltd(人工智能工程院,iFLYTEK公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Mind2Report是一种通过动态内存增强大语言模型,实现专家级商业报告综合的认知深度研究代理,优于现有基线模型。

Comments 26 Pages, 9 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17722 2026-01-09 cs.CV cs.AI 70%

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

MT-Video-Bench: 一个多轮对话中评估多模态大语言模型的综合视频理解基准

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu

机构 * Fudan University(复旦大学) NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MT-Video-Bench通过评估多轮对话中多模态大语言模型的6项核心能力,揭示其在处理多轮视频对话任务中的性能差异和局限性。

Comments Project Website: https://github.com/NJU-LINK/MT-Video-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04819 2026-01-09 cs.AI 70%

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

AECV-Bench:在建筑和工程图纸理解上的多模态模型评估基准

Aleksei Kondratenko, Mussie Birhane, Houssame E. Hsain, Guido Maciocci

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 AECV-Bench评估多模态模型在建筑图纸理解上的能力,发现OCR和文本问答表现最佳,但符号理解尤其是门窗计数仍存在较大误差,需改进领域特定表示和人机协作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04730 2026-01-09 cs.CL cs.CY 70%

Automatic Classifiers Underdetect Emotions Expressed by Men

自动分类器对男性表达的情绪检测不足

Ivan Smirnov, Segun T. Aroyehun, Paul Plener, David Garcia

机构 * University of Technology Sydney(技术大学悉尼大学) University of Konstanz(康斯坦茨大学) Medical University of Vienna(维也纳医学院) University of Ulm(乌尔姆大学) Complexity Science Hub(复杂科学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文发现自动分类器对男性表达的情绪检测存在系统性偏差,需谨慎使用以确保公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04709 2026-01-09 cs.AI 70%

Bridging Temporal and Textual Modalities: A Multimodal Framework for Automated Cloud Failure Root Cause Analysis

弥合时序与文本模态:一种多模态框架用于自动化云故障根本原因分析

Gijun Park

机构 * Okestro

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过融合时间序列与文本数据,提升云故障根本原因分析的自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04583 2026-01-09 cs.AI cs.MA 70%

Autonomous Agents on Blockchains: Standards, Execution Models, and Trust Boundaries

区块链上的自主代理:标准、执行模型与信任边界

Saad Alqithami

机构 * Saad Alqithami(萨德·阿利萨米)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文系统梳理了区块链与自主代理的互操作性领域,提出了五类整合模式、定制化的威胁模型和能力矩阵,并提出了研究路线图和评估套件,旨在提升链上执行的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10219 2026-01-09 cs.CL 70%

ChakmaNMT: Machine Translation for a Low-Resource and Endangered Language via Transliteration

ChakmaNMT:通过转写实现一种低资源和濒危语言的机器翻译

Aunabil Chakma, Aditya Chakma, Masum Hasan, Soham Khisa, Chumui Tripura, Rifat Shahriyar

机构 * University of Arizona(亚利桑那大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) University of Rochester(罗切斯特大学) Chittagong University of Engineering and Technology(丘比特工程与技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ChakmaNMT通过转写技术,利用孟加拉语和Chakma语的正字法关系,提升低资源语言的机器翻译效果。

Comments Submitted to ARR (January 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05039 2026-01-09 cs.MA 67%

FinDeepForecast: A Live Multi-Agent System for Benchmarking Deep Research Agents in Financial Forecasting

FinDeepForecast:一个用于在金融预测中基准测试深度研究代理的实时多智能体系统

Xiangyu Li, Xuan Yao, Guohao Qi, Fengbin Zhu, Kelvin J. L. Koa, Xiang Yao Ng, Ziyang Liu, Xingyu Ni, Chang Liu, Yonghui Yang, Yang Zhang, Wenjie Wang, Fuli Feng, Chao Wang, Huanbo Luan, Xiaofen Xing, Xiangmin Xu, Tat-Seng Chua, Ke-Wei Huang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 FinDeepForecast是一个实时多智能体系统,用于评估深度研究代理在金融预测中的表现,通过生成研究导向的金融预测任务,提供了一个公开的基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04728 2026-01-09 cs.LG cs.AI 62%

Excess Description Length of Learning Generalizable Predictors

学习可泛化的预测器的超额描述长度

Elizabeth Donoway, Hailey Joren, Fabien Roger, Jan Leike

机构 * ucb(加州大学伯克利分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EDL框架,用于量化微调提取的预测结构并评估模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04875 2026-01-09 cs.CL 57%

EvolSQL: Structure-Aware Evolution for Scalable Text-to-SQL Data Synthesis

EvolSQL: 结构感知的可扩展文本到SQL数据合成

Xuanguang Pan, Chongyang Tao, Jiayuan Bai, Jianling Gao, Zhengwei Tao, Xiansheng Zhou, Gavin Cheung, Shuai Ma

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 EvolSQL通过结构感知的进化策略生成高质量的文本到SQL数据,提升模型在结构多样性与复杂性上的表现。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04766 2026-01-09 cs.CL 57%

Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence

从第一原理重新审视裁判解码:通过无训练分布分歧方法

Shengyin Sun, Yiming Li, Renxi Liu, Weizhe Lin, Hui-Ling Zhen, Xianzhi Yu, Mingxuan Yuan, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本研究提出一种基于KL散度的无训练裁判解码方法,通过理论证明与实验验证,展示了其在提升推理和编码任务性能上的优势。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏