arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-02 至 2025-12-02 共收录 313 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2512.00082 2025-12-02 cs.CV 89%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 评测与基准 :prompting(title,abstract);LLM(title,comments);large language model(abstract);language model(abstract)

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01255 2025-12-02 cs.CR cs.CL cs.SE 89%

Large Language Models Cannot Reliably Detect Vulnerabilities in JavaScript: The First Systematic Benchmark and Evaluation

大语言模型无法可靠地检测JavaScript中的漏洞:首个系统性基准和评估

Qingyuan Fei, Xin Liu, Song Li, Shujiang Wu, Jianwei Hou, Ping Chen, Zifeng Kang

机构 * Lanzhou University(兰州大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Technology Support Center of the Cyberspace Administration of China(国家互联网信息办公室技术支撑中心) Fudan University(复旦大学) Beijing University of Posts(北京邮电大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文首次提出FORGEJS框架,构建首个系统性JavaScript漏洞检测基准ARENAJS,并揭示LLM在漏洞检测中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18649 2025-12-02 cs.CL 89%

Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical Ability in a Zero-Data-Leakage Setting

评估大型语言模型在2026年韩国CSAT数学考试中的表现:在零数据泄漏环境下测量数学能力

Goun Pyeon, Inbum Heo, Jeesu Jung, Taewook Hwang, Hyuk Namgoong, Hyein Seo, Yerim Han, Eunbin Kim, Hyeonseok Kang, Sangkeun Jung

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究评估了24种LLM在2026年韩国CSAT数学考试中的表现,发现文本输入优于图像输入,GPT-5系列模型在特定配置下达到满分,同时揭示了微积分领域表现最差,且高难度问题对模型性能影响显著。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21510 2025-12-02 cs.MA cs.AI 89%

Tool-RoCo: An Agent-as-Tool Self-organization Large Language Model Benchmark in Multi-robot Cooperation

Tool-RoCo: 一种基于机器人协作的大型语言模型自组织评估基准

Ke Zhang, Xiaoning Zhao, Ce Zheng, Jiahong Ning, Dandan Zhu, Wenqi Zhang, Chen Sun, Toshiharu Sugawara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Tool-RoCo提出了一种评估大型语言模型在多机器人协作中自主性和协作能力的基准,通过四种不同自主性范式和三个任务测试工具使用效果。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18008 2025-12-02 cs.CY cs.CL 88%

GermanPartiesQA: Benchmarking Commercial Large Language Models and AI Companions for Political Alignment and Sycophancy

GermanPartiesQA: 对商业大语言模型和AI伴侣在政治倾向和趋炎附势方面的基准测试

Jan Batzner, Volker Stocker, Stefan Schmid, Gjergji Kasneci

机构 * TUM(慕尼黑大学) TUB(慕尼黑大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

AI总结 GermanPartiesQA研究了六个商业LLMs在政治倾向和趋炎附势方面的表现,揭示了LLMs在生成事实性政党立场上的局限性以及模型特定的意识形态倾向模式。

Comments Published at AAAI/ACM AIES 2025. Presented at NeurIPS 2025 Workshop on LLM Evaluation and the International Monetary Fund's 12th Statistical Forum. GermanPartiesQA Benchmark under https://github.com/janbatzner/germanpartiesqa

Journal ref Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 8(1), 2025, pp. 330-342

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01896 2025-12-02 cs.CL 88%

OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation

OPOR-Bench:评估大型语言模型在在线公共舆论报告生成中的表现

Jinzheng Yu, Yang Xu, Haozhen Li, Junqi Li, Yifan Feng, Ligu Zhu, Hao Shen, Lei Shi

机构 * Communication University of China(中国传媒大学) Harbin Institute of Technology(哈尔滨工业大学) China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司) School of Engineering, Santa Clara University(圣克拉拉大学工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 OPOR-Bench通过定义自动在线公共舆论报告生成任务,构建了包含463个危机事件的数据集,并提出OPOR-EVAL框架评估生成报告质量,为该领域研究提供基础。

Comments 27 pages, accepted by CMC-Computers, Materials & Continua, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00390 2025-12-02 cs.CL cs.IR 88%

Mitigating the Threshold Priming Effect in Large Language Model-Based Relevance Judgments via Personality Infusing

通过注入个性缓解基于大语言模型的相关性判断中的阈值先入为主效应

Nuo Chen, Hanpei Fang, Jiqun Liu, Wilson Wei, Tetsuya Sakai, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Waseda University(早稻田大学) The University of Oklahoma(俄克拉荷马大学) EureXa Labs(EureXa实验室)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文通过注入人格特征缓解基于大语言模型的相关性判断中的阈值先入为主效应,发现特定人格特征可有效降低该效应,并提出人格提示作为改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12263 2025-12-02 cs.CV cs.AI 88%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07507 2025-12-02 cs.CL 88%

Thought2Text: Text Generation from EEG Signal using Large Language Models (LLMs)

Thought2Text: 使用大型语言模型(LLMs)从EEG信号生成文本

Abhijit Mishra, Shreya Shukla, Jose Torres, Jacek Gwizdka, Shounak Roychowdhury

机构 * School of Information University of Texas at Austin(信息学院 德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 Thought2Text利用大型语言模型从EEG信号生成文本,通过多阶段微调实现脑活动的可理解表达。

Comments Accepted to Findings of NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00134 2025-12-02 cs.SE cs.AI 88%

Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation

Asm2SrcEval: 评估大型语言模型在汇编到源代码翻译中的性能

Parisa Hamedi, Hamed Jelodar, Samita Bai, Mohammad Meymani, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Canadian Institute for Cybersecurity(加拿大网络安全研究所) University of New Brunswick(新不伦瑞克大学) Faculty of Computer Science(计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出Asm2SrcEval基准,评估五种先进大语言模型在汇编到源代码翻译任务中的性能,揭示模型在文本相似性、流畅性和效率上的权衡,为程序翻译的准确性和效率研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06284 2025-12-02 cs.AI 88%

A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision-Language Tasks

多模态大语言模型在视觉-语言任务中的综合综述与指南

Chia Xin Liang, Pu Tian, Caitlyn Heqi Yin, Yao Yua, Wei An-Hou, Li Ming, Xinyuan Song, Tianyang Wang, Ziqian Bi, Ming Liu

机构 * JTB Technology Corp.(JTB技术公司) Stockton University(斯托顿大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AppCubic USA(AppCubic美国公司) Nomad Sustaintech LTD(Nomad可持续科技有限公司) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) University of Liverpool(利物浦大学) Indiana University(印第安纳大学) Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型在视觉-语言任务中的应用,探讨了其架构、训练方法及挑战,并提供了理论与实践的全面指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00039 2025-12-02 cs.NI cs.AI cs.CL 88%

LM4Opt-RA: A Multi-Candidate LLM Framework with Structured Ranking for Automating Network Resource Allocation

LM4Opt-RA: 一种带有结构化排序的多候选LLM框架,用于自动化网络资源分配

Tasnim Ahmed, Siana Rizwan, Naveed Ejaz, Salimur Choudhury

机构 * School of Computing(计算机学院) Queen’s University(女王大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 LM4Opt-RA通过结构化排序机制和多种提示策略,提升网络资源分配优化的LLM性能,实现优于基线模型的数学评估成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12077 2025-12-02 cs.CV 87%

Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound

通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了

Dengming Zhang, Weitao You, Jingxiong Li, Weishen Lin, Wenda Shi, Xue Zhao, Heda Zuo, Junxian Wu, Lingyun Sun

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00045 2025-12-02 cs.AR cs.AI 86%

Assessing Large Language Models in Generating RTL Design Specifications

评估大语言模型在生成RTL设计规范中的表现

Hung-Ming Huang, Yu-Hsin Yang, Fu-Chieh Chang, Yun-Chia Hsu, Yin-Yu Lin, Ming-Fang Tsai, Chun-Chih Yang, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(国立台湾大学通信工程研究所) MediaTek Inc, Hsinchu Taiwan(联发科技)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.AI

AI总结 本文评估了大语言模型在生成RTL设计规范中的性能,探讨了提示策略对规范质量的影响,并提出了评估指标,为自动化规范生成提供了基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01992 2025-12-02 cs.AI cs.CL 86%

LLM CHESS: Benchmarking Reasoning and Instruction-Following in LLMs through Chess

LLM CHESS: 通过国际象棋评估大语言模型的推理与指令遵循能力

Sai Kolasani, Maxim Saplin, Nicholas Crispino, Kyle Montgomery, Jared Quincy Davis, Matei Zaharia, Chi Wang, Chenguang Wang

机构 * UC Berkeley(加州大学伯克利分校) Independent Researcher(独立研究者) UC Santa Cruz(加州大学圣克鲁兹分校) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM CHESS通过国际象棋评估大语言模型的推理与指令遵循能力,揭示了推理模型与非推理模型的显著差异,并提供了评估框架和公开排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01786 2025-12-02 cs.AI cs.LG 86%

Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems

谁评判法官?LLM陪审团即需:构建可信的LLM评估系统

Xiaochuan Li, Ke Wang, Girija Gouda, Shubham Choudhary, Yaqun Wang, Linwei Hu, Joel Vaughan, Freddy Lecue

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM陪审团即需,通过动态学习框架提升LLM评估的可靠性和可扩展性,实验表明其在关键决策中的相关性优于传统方法。

Comments 66 pages, 22 figures, 37 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03194 2025-12-02 cs.CL cs.AI 86%

Quantifying Cognitive Bias Induction in LLM-Generated Content

量化大语言模型生成内容中的认知偏差诱导

Abeer Alessa, Param Somane, Akshaya Lakshminarasimhan, Julian Skirzynski, Julian McAuley, Jessica Echterhoff

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究量化了大语言模型生成内容中的认知偏差,发现其在摘要和事实核查任务中存在框架偏差、幻觉和优先偏差,并提出针对性干预方法以减少对人类决策的影响。

Comments 21 pages (including references and appendix), 3figures. accepted to AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00461 2025-12-02 cs.CY cs.CL 86%

Whose Personae? Synthetic Persona Experiments in LLM Research and Pathways to Transparency

谁的人设?LLM研究中的人设实验及透明化路径

Jan Batzner, Volker Stocker, Bingjun Tang, Anusha Natarajan, Qinhao Chen, Stefan Schmid, Gjergji Kasneci

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了LLM研究中合成人设实验的代表性与生态效度问题,提出透明化检查表以提升评估的严谨性和实证性。

Comments Published at AAAI/ACM AIES 2025. Presented at NeurIPS 2025 Workshop Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

Journal ref Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 8(1), 2025, 343-354

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03665 2025-12-02 cs.DC cs.AI 85%

LLM & HPC:Benchmarking DeepSeek's Performance in High-Performance Computing Tasks

LLM与HPC:在高性能计算任务中评估DeepSeek的性能

Noujoud Nader, Patrick Diehl, Steve Brandt, Hartmut Kaiser

机构 * Center of Computation and Technology(计算与技术中心) Louisiana State University(路易斯安那州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了DeepSeek在高性能计算任务中生成代码的能力,发现其在扩展性和执行效率上逊于GPT-4。

Comments 9 pages, 2 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01452 2025-12-02 cs.AI 85%

Automated Risk-of-Bias Assessment of Randomized Controlled Trials: A First Look at a GEPA-trained Programmatic Prompting Framework

随机对照试验风险偏误自动评估:一种基于GEPA训练的程序化提示框架初探

Lingbo Li, Anuradha Mathrani, Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)

专题命中 评测与基准 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 GEPA通过结构化优化生成一致的提示,提升随机对照试验偏误风险评估的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10493 2025-12-02 cs.CR cs.LG 85%

The Hidden DNA of LLM-Generated JavaScript: Structural Patterns Enable High-Accuracy Authorship Attribution

LLM生成JavaScript的隐藏DNA:结构模式实现高精度作者归属

Norbert Tihanyi, Bilel Cherif, Richard A. Dubniczky, Mohamed Amine Ferrag, Tamás Bisztray

机构 * Technology Innovation Institute(技术创新研究所) Eötvös Loránd University(欧多芬·洛尔兰大学) United Arab Emirates University(联合阿拉伯酋长国大学) University of Oslo(奥斯陆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LLM-NodeJS数据集,通过分析生成JavaScript代码的结构模式,实现高精度的作者归属和模型指纹识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05239 2025-12-02 cs.CL 85%

LLM-based Automated Grading with Human-in-the-Loop

基于大型语言模型的自动评分与人类在循环中

Yucheng Chu, Hang Li, Kaiqi Yang, Yasemin Copur-Gencturk, Jiliang Tang

机构 * Computer Science and Engineering(计算机科学与工程) Michigan State University(密歇根州立大学) Rossier School of Education(罗塞尔教育学院) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GradeHITL框架,通过人类在循环中方法提升自动简答评分的准确性,实现接近人类水平的评估。

Comments Accepted to IEEE TALE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03543 2025-12-02 cs.AI cs.CY cs.MA 85%

CogniPair: From LLM Chatbots to Conscious AI Agents -- GNWT-Based Multi-Agent Digital Twins for Social Pairing -- Dating & Hiring Applications

CogniPair: 从LLM聊天机器人到有意识的AI代理 -- 基于GNWT的多智能体数字孪生用于社交配对 -- dating与招聘应用

Wanghao Ye, Sihan Chen, Yiting Wang, Shwai He, Bowei Tian, Guoheng Sun, Ziyi Wang, Ziyao Wang, Yexiao He, Zheyu Shen, Meng Liu, Yuning Zhang, Meng Feng, Yang Wang, Siyuan Peng, Yilong Dai, Zhenle Duan, Lang Xiong, Joshua Liu, Hanzhang Qin, Ang Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CogniPair基于GNWT理论,通过整合人类认知架构,创建多智能体数字孪生系统,用于社交配对,提升LLM代理的心理真实性,并应用于约会和招聘场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03945 2025-12-02 cs.IR 85%

Function-based Labels for Complementary Recommendation: Definition, Annotation, and LLM-as-a-Judge

基于功能的标签用于互补推荐:定义、标注和大语言模型作为评判者

Chihiro Yamasaki, Kai Sugahara, Yuma Nagi, Kazushi Okamoto

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于功能的标签(FBLs)用于互补推荐,通过人工标注数据集验证其有效性,展示ML和LLM在互补关系推断中的高准确率。

Journal ref Pattern Recognition Letters, Elsevier, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16671 2025-12-02 cs.CL cs.AI cs.CV 84%

MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models

MimeQA: 向具有社会智能的非语言基础模型迈进

Hengzhi Li, Megan Tjandrasuwita, Yi R. Fung, Armando Solar-Lezama, Paul Pu Liang

机构 * Massachusetts Institute of Technology(麻省理工学院) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MimeQA通过引入非语言互动数据集,评估视频大语言模型在非语言社会推理中的表现,发现其准确率较低,人类表现更优。

Comments NeurIPS 2025 Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01300 2025-12-02 cs.AI 83%

RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving

RoboDriveVLM:一种面向自动驾驶鲁棒视觉-语言模型的新型基准与基线

Dacheng Liao, Mengshi Qi, Peng Shu, Zhining Zhang, Yuxin Lin, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 RoboDriveVLM提出了一种新型基准和基线,用于评估视觉-语言模型在自动驾驶中的鲁棒性,通过模拟多种腐蚀场景提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00274 2025-12-02 cs.CL 83%

Lost without translation -- Can transformer (language models) understand mood states?

无翻译的迷失 -- 变换器(语言模型)能否理解情绪状态?

Prakrithi Shivaprakash, Diptadhi Mukherjee, Lekhansh Shukla, Animesh Mukherjee, Prabhat Chand, Pratima Murthy

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究探讨了变压器模型在印度语言中理解不同情绪状态的能力,发现翻译方法显著提升性能,但本地语言模型仍需改进以适应全球心理健康需求。

Comments 33 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05945 2025-12-02 cs.CL cs.AI cs.LG cs.MA eess.AS 82%

NeKo: Cross-Modality Post-Recognition Error Correction with Tasks-Guided Mixture-of-Experts Language Model

NeKo:跨模态识别后纠错与任务引导的专家混合语言模型

Yen-Ting Lin, Zhehuai Chen, Piotr Zelasko, Zhen Wan, Xuesong Yang, Zih-Ching Chen, Krishna C Puvvada, Szu-Wei Fu, Ke Hu, Jun Wei Chiu, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Chao-Han Huck Yang

机构 * NVIDIA

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NeKo通过任务引导的专家混合模型,实现跨模态识别后的高效纠错,显著降低WER并提升BLEU分数。

Comments ACL 2025 Industry Track. NeKo LMs: https://huggingface.co/nvidia/NeKo-v0-post-correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08906 2025-12-02 cs.CV cs.AI cs.CL cs.MM 81%

Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation

Prompt-OT: 一种用于视觉-语言模型适应中知识保留的最优传输正则化范式

Xiwen Chen, Wenhui Zhu, Peijie Qiu, Hao Wang, Huayu Li, Haiyu Wu, Aristeidis Sotiras, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Arizona(亚利桑那大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 Prompt-OT通过最优传输正则化提升视觉-语言模型在知识保留和跨领域适应中的性能

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01880 2025-12-02 cs.AI 79%

Predicting Human Chess Moves: An AI Assisted Analysis of Chess Games Using Skill-group Specific n-gram Language Models

预测人类象棋走法:一种利用技能组特定n-gram语言模型的AI辅助象棋游戏分析

Daren Zhong, Dingcheng Huang, Clayton Greenberg

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出一种利用技能组特定n-gram语言模型预测人类象棋走法的AI辅助分析框架,通过动态选择模型提升预测准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏