arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-27 至 2026-01-27 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 88 篇

2601.17604 2026-01-27 cs.SE cs.AI 77%

Human-Aligned Enhancement of Programming Answers with LLMs Guided by User Feedback

基于用户反馈的人工智能对编程答案的增强

Suborno Deb Bappon, Saikat Mondal, Chanchal K. Roy, Kevin Schneider

机构 * University of Saskatchewan(萨斯喀彻温大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出AUTOCOMBAT工具,利用用户反馈和问题上下文改进编程答案,实现近人类质量的提升,具有高实用价值。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13742 2026-01-27 cs.CL 77%

Hearing Between the Lines: Unlocking the Reasoning Power of LLMs for Speech Evaluation

在行之间倾听:解锁LLMs对语音评估的推理能力

Arjun Chandra, Kevin Miller, Venkatesh Ravichandran, Constantinos Papayiannis, Venkatesh Saligrama

机构 * Boston University(波士顿大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TRACE框架通过文本推理音频线索,实现低成本且与人类一致的语音评估。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11266 2026-01-27 cs.SE cs.AI 77%

Live API-Bench: 2500+ Live APIs for Testing Multi-Step Tool Calling

Benjamin Elder, Anupama Murthi, Jungkoo Kang, Ankita Rajaram Naik, Kiran Kate, Kinjal Basu, Danish Contractor

机构 * IBM Research AI(IBM人工智能研究实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 11+32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12592 2026-01-27 cs.CL 77%

PromptPrism: A Linguistically-Inspired Taxonomy for Prompts

PromptPrism: 一种语言学启发的提示分类法

Sullam Jeoung, Yueyan Chen, Yi Zhang, Shuai Wang, Haibo Ding, Lin Lee Cheong

机构 * Amazon AWS(亚马逊AWS)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PromptPrism通过语言学启发的分类法,为提示的结构、语义和语法分析提供系统框架,提升提示优化和性能评估的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 76%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17025 2026-01-27 cs.CY 75%

(Mis-)Informed Consent: Predatory Apps and the Exploitation of Populations with Limited Literacy

误判同意:掠夺性应用与对低识字率人群的剥削

Muhammad Muneeb Pervez, Muhammad Qasim Atiq Ullah, Ibrahim Ahmed Khan, Roshnik Rahat, Muhammad Fareed Zaffar, Rashid Tahir, Talal Rahwan, Yasir Zaki

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了低识字率人群在使用掠夺性金融应用时的隐私风险,发现85%的用户无法理解基本权限,需加强监管和LLM驱动的隐私工具。

Comments 9 pages, and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15552 2026-01-27 cs.CL cs.AI cs.CV 73%

Multimodal Evaluation of Russian-language Architectures

多模态评估框架MERA Multi对俄语架构的评估

Artem Chervyakov, Ulyana Isaeva, Anton Emelyanov, Artem Safin, Maria Tikhonova, Alexander Kharitonov, Yulia Lyakh, Petr Surovtsev, Denis Shevelev, Vildan Saburov, Vasily Konovalov, Elisei Rykov, Ivan Sviridov, Amina Miftakhova, Ilseyar Alimova, Alexander Panchenko, Alexander Kapitanov, Alena Fenogenova

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MERA Multi框架,用于评估俄语多模态架构,包含18个新任务和统一的评估方法,旨在解决俄语多模态基准缺失的问题。

Comments EACL main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17431 2026-01-27 cs.CY cs.AI cs.CL cs.DL 73%

The 17% Gap: Quantifying Epistemic Decay in AI-Assisted Survey Papers

17%的差距:量化AI辅助综述论文中的知识退化

H. Kemal İlter

机构 * Department of Management Information Systems(管理信息系统系) Bakırçay University(巴克恰伊大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文量化了AI辅助综述论文中引用链退化的现象,发现17%的引用无法解析,揭示了AI工具在检索正确标题的同时幻觉元数据的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18241 2026-01-27 cs.SE cs.AI 70%

TAM-Eval: Evaluating LLMs for Automated Unit Test Maintenance

TAM-Eval: 评估用于自动单元测试维护的LLM

Elena Bruches, Vadim Alperovich, Dari Baturova, Roman Derunets, Daniil Grebenkin, Georgy Mkrtchyan, Oleg Sedukhin, Mikhail Klementev, Ivan Bondarenko, Nikolay Bushkov, Stanislav Moiseev

机构 * Both authors contributed equally to this research.(共同作者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TAM-Eval提出一个评估LLM在自动单元测试维护能力的框架和基准,通过测试套件创建、修复和更新三个场景,揭示LLM在真实测试维护中的局限性。

Comments Accepted for publication at the 9th Workshop on Validation, Analysis and Evolution of Software Tests (VST 2026), co-located with the the 33rd IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18106 2026-01-27 cs.CL 70%

GLEN-Bench: A Graph-Language based Benchmark for Nutritional Health

GLEN-Bench: 一种基于图-语言的营养健康基准测试

Jiatan Huang, Zheyuan Zhang, Tianyi Ma, Mingchen Li, Yaning Zheng, Yanfang Ye, Chuxu Zhang

机构 * University of Connecticut, USA(美国康涅狄格大学) University of Notre Dame, USA(美国圣母大学) University of Massachusetts Amherst, USA(美国马萨诸塞大学阿姆赫斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GLEN-Bench是首个基于图-语言的营养健康基准测试,通过整合健康记录、食物组成数据和获取指标,评估营养干预中的风险检测、个性化推荐和问答任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13358 2026-01-27 cs.CL 70%

Bridging the Editing Gap in LLMs: FineEdit for Precise and Targeted Text Modifications

弥合大语言模型的编辑差距:FineEdit用于精确且有针对性的文本修改

Yiming Zeng, Wanhao Yu, Zexin Li, Tao Ren, Yu Ma, Jinghan Cao, Xiyan Chen, Tingting Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FineEdit通过专门训练的编辑模型,实现了在多领域中的精确文本修改,显著提升了单轮和多轮编辑任务的性能。

Comments We resolved some issues in this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00435 2026-01-27 cs.AI cs.HC cs.RO 70%

Towards Real-time Adaptation of Embodied Agent in Human-Robot Collaboration

面向人机协作中具身代理的实时适应

Shipeng Liu, Boshen Zhang, Zhehui Huang

机构 * University of Southern California Department of Electrical(南加州大学电气与计算机工程系) University of Southern California Department of Computer Science Los Angeles CA USA(南加州大学计算机科学系洛杉矶加州美国) University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MonTA框架,通过轻量级监控和高效适配器提升人机协作中具身代理的实时适应能力,实现更高效的协作性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17722 2026-01-27 cs.AI 70%

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17645 2026-01-27 cs.SD cs.CL cs.CV cs.MM eess.AS 70%

AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

AVMeme Exam: 一个多模态、多语言、多文化的基准测试,用于评估LLM的上下文和文化知识与思维

Xilin Jiang, Qiaolin Wang, Junkai Wu, Xiaomin He, Zhongweiyang Xu, Yinghao Ma, Minshuo Piao, Kaiyi Yang, Xiuwen Zheng, Riki Shimizu, Yicong Chen, Arsalan Firoozi, Gavin Mischler, Sukru Samet Dindar, Richard Antonello, Linyang He, Tsun-An Hsieh, Xulin Fan, Yulun Wu, Yuesheng Ma, Chaitanya Amballa, Weixiong Chen, Jiarui Hai, Ruisi Li, Vishal Choudhari, Cong Han, Yinghao Aaron Li, Adeen Flinker, Mounya Elhilali, Emmanouil Benetos, Mark Hasegawa-Johnson, Romit Roy Choudhury, Nima Mesgarani

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AVMeme Exam 通过多模态、多语言、多文化的基准测试,评估LLM在上下文和文化理解方面的局限性,揭示模型在无文本音乐和文化思维上的不足。

Comments avmemeexam.github.io/public

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17584 2026-01-27 cs.SE cs.AI 70%

Prompt Driven Development with Claude Code: Building a Complete TUI Framework for the Ring Programming Language

通过Claude Code驱动的开发:为环编程语言构建完整的终端用户界面框架

Mahmoud Samir Fayed, Ahmed Samir Fayed

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过Claude Code驱动开发,为环编程语言构建完整终端用户界面框架,展示了提示驱动方法在软件工程中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17399 2026-01-27 cs.CV cs.AI 70%

ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs

ReLE:一种可扩展的系统和结构化基准,用于诊断中文大语言模型的能力异质性

Rui Fang, Jian Li, Wei Chen, Bin Hu, Ying-Cong Chen, Xin Tang, Liang Diao

机构 * Sun Yat-sen University(中山大学) ReLE Benchmark Team(ReLE基准团队) NSFOCUS Technologies Co., Ltd.(NSFOCUS技术有限公司) HKUST-GZ(香港科技大学-广州) Huawei(华为) Ping An Property & Casualty Insurance Company of China, Ltd(平安财产保险股份有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReLE通过可扩展系统和结构化基准诊断中文大语言模型的能力异质性,提升评估效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09071 2026-01-27 cs.AI cs.GT cs.HC 70%

Strategic Tradeoffs Between Humans and AI in Multi-Agent Bargaining

人类与AI在多智能体协商中的战略权衡

Crystal Qian, Kehang Zhu, John Horton, Benjamin S. Manning, Vivian Tsai, James Wexler, Nithum Thain

机构 * Google DeepMind Mountain View CA USA(谷歌DeepMind) Harvard University Cambridge MA USA MIT \& NBER Cambridge MA USA MIT Cambridge MA USA Google DeepMind Harvard University MIT \& NBER MIT

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过实证分析比较了人类、前沿LLMs和定制化贝叶斯代理在动态多玩家协商游戏中的表现,揭示了LLMs在复杂多代理互动中与人类行为的差异及性能平局的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12679 2026-01-27 cs.CL 70%

Discourse Features Enhance Detection of Document-Level Machine-Generated Content

语篇特征增强文档级机器生成内容的检测

Yupei Li, Manuel Milling, Lucia Specia, Björn W. Schuller

机构 * Department of Computing Imperial College London London, UK Chair of Health Informatics Technical University of Munich Munich, Germany 5cm Department of Computing \& Chair of Health Informatics 5cm Imperial College London \& Technical University of Munich 5cm London, UK \& Munich, Germany 5cm

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出DTransformer模型,通过语篇分析预处理捕捉文档级结构特征,有效提升对机器生成内容的检测性能。

Comments Accepted by IJCNN 2025

Journal ref Proc. International Joint Conference on Neural Networks (IJCNN), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17058 2026-01-27 cs.DB cs.AI cs.CL cs.LG 69%

Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs

大模型能帮你清理数据吗?基于大模型的应用级数据准备综述

Wei Zhou, Jun Zhou, Haoyu Wang, Zhenghao Li, Qikang He, Shaokun Han, Guoliang Li, Xuanhe Zhou, Yeye He, Chunwei Liu, Zirui Tang, Bin Wang, Shen Tang, Kai Zuo, Yuyu Luo, Zhenzhe Zheng, Conghui He, Jingren Zhou, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Microsoft Research(微软研究院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Xiaohongshu Inc.(小红书公司) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了基于大语言模型的应用级数据准备方法,探讨了数据清洗、整合与丰富三大任务的技术、优势与局限,并提出了可扩展的大语言模型-数据系统和稳健评估协议的未来研究方向。

Comments Please refer to our repository for more details: https://github.com/weAIDB/awesome-data-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18086 2026-01-27 cs.SD eess.AS 67%

From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition

从人类语音到海洋信号:将语音大模型转移到水下声学目标识别

Mengcheng Huang, Xue Zhou, Chen Xu, Dapeng Man

机构 * College of Computer Science and Technology, Harbin Engineering University, Harbin, China(计算机科学与技术学院,哈尔滨工程大学,哈尔滨,中国)

专题命中 评测与基准 :foundation model(abstract);SLM(abstract)

AI总结 本文提出UATR-SLM,利用语音大模型进行水下声学目标识别,实验显示其在域内和跨域任务中均表现出高准确率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14949 2026-01-27 cs.IR 67%

What Should I Cite? A RAG Benchmark for Academic Citation Prediction

我应该引用什么?一个用于学术引用预测的RAG基准

Leqi Zheng, Jiajun Zhang, Canzhi Chen, Chaokun Wang, Hongwei Li, Yuying Li, Yaoxin Mao, Shannan Yan, Zixin Song, Zhiyuan Feng, Zhaolu Kang, Zirong Chen, Hang Zhang, Qiang Liu, Liang Wang, Ziyang Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CiteRAG提出一个用于学术引用预测的RAG基准,通过多层次检索策略和生成器,评估大型语言模型在引用预测中的性能。

Journal ref WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08545 2026-01-27 cs.CV 67%

T2VEval: Benchmark Dataset and Objective Evaluation Method for T2V-generated Videos

T2VEval: 用于T2V生成视频的基准数据集和客观评估方法

Zelu Qi, Ping Shi, Shuqi Wang, Chaoyang Zhang, Fei Zhao, Zefeng Ying, Da Pan, Xi Yang, Zheqi He, Teng Dai

机构 * School of Information and Communication Engineering, Communication University of China, No.1 East Street, Dingfuzhuang, Chaoyang District, Beijing, China(信息与通信工程学院,中国传媒大学) Beijing Academy of Artificial Intelligence, No.150 Chengfu Road, Haidian District, Beijing, China(北京人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 T2VEval提出了一种多分支融合方案,通过多维评估指标对T2V生成视频进行客观质量评估,提升视频生成模型的优化效果。

Comments This paper has been accepted by DISPLAYS

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06835 2026-01-27 cs.CV 67%

X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding

X-LeBench:一个用于极长第一人称视频理解的基准数据集

Wenqi Zhou, Kai Cao, Hao Zheng, Yunze Liu, Xinyi Zheng, Miao Liu, Per Ola Kristensson, Walterio Mayol-Cuevas, Fan Zhang, Weizhe Lin, Junxiao Shen

机构 * University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) College of AI, Tsinghua University(清华大学人工智能学院) Meta Memories.ai Research(Memories.ai研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 X-LeBench通过模拟真实日常生活场景,构建了首个极长第一人称视频理解基准数据集,揭示了长视频理解中的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17417 2026-01-27 cs.CY 67%

Using psychological theory to ground guidelines for the annotation of misogynistic language

利用心理学理论来确立反女性语言标注的指导方针

Artemis Deligianni, Zachary Horne, Leonidas A. A. Doumas

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出基于心理学理论的反女性语言标注指南,通过标注新数据集和LLM对比实验,验证了该指南在分类上的优越性,并探讨了LLM在反女性检测中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03310 2026-01-27 eess.AS 67%

TASU: Text-Only Alignment for Speech Understanding

TASU:用于语音理解的纯文本对齐

Jing Peng, Yi Yang, Xu Li, Yu Xi, Quanwei Tang, Yangui Fang, Junjie Li, Kai Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 TASU通过纯文本数据实现语音理解的跨模态对齐,提升了零样本语音识别性能,并在多个基准测试中优于现有模型。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19860 2026-01-27 cs.SE 67%

E-Test: E'er-Improving Test Suites

E-Test:持续改进的测试套件

Ketai Qiu, Luca Di Grazia, Leonardo Mariani, Mauro Pezzè

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 E-Test通过利用大型语言模型识别未测试的执行场景,有效提升测试套件质量并减少维护成本。

Comments Accepted at the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17065 2026-01-27 cs.LG cs.AI cs.CL cs.CY cs.MA 67%

ThinkTank-ME: A Multi-Expert Framework for Middle East Event Forecasting

ThinkTank-ME: 一个用于中东事件预测的多专家框架

Haoxuan Li, He Chang, Yunshan Ma, Yi Bin, Yang Yang, See-Kiong Ng, Tat-Seng Chua

机构 * University of Electronic Science and Technology of China(电子科技大学) Communication University of China(中国通信大学) Singapore Management University(新加坡国立管理学院) Tongji University(同济大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ThinkTank-ME通过多专家协作框架提升中东事件预测的准确性与复杂性处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18706 2026-01-27 cs.AI cs.LG 62%

Health-SCORE: Towards Scalable Rubrics for Improving Health-LLMs

Health-SCORE: 向提升健康大语言模型的可扩展评分标准迈进

Zhichao Yang, Sepehr Janghorbani, Dongxu Zhang, Jun Han, Qian Qian, Andrew Ressler, Gregory D. Lyng, Sanjit Singh Batra, Robert E. Tillman

机构 * Optum AI

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Health-SCORE是一种通用且可扩展的基于评分标准的训练和评估框架,通过降低开发成本和提升响应质量,使医疗领域的大语言模型评估和训练更加可行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18320 2026-01-27 cs.CL cs.AI cs.DB 62%

MultiVis-Agent: A Multi-Agent Framework with Logic Rules for Reliable and Comprehensive Cross-Modal Data Visualization

MultiVis-Agent:一种带有逻辑规则的多智能体框架,用于可靠且全面的跨模态数据可视化

Jinwei Lu, Yuanfeng Song, Chen Zhang, Raymond Chi-Wing Wong

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science(香港科学大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 MultiVis-Agent通过引入逻辑规则的多智能体框架,提升多模态数据可视化的可靠性与全面性,实现高评分和高完成率。

Comments Accepted to SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18218 2026-01-27 cs.HC cs.AI cs.CL 62%

PaperTok: Exploring the Use of Generative AI for Creating Short-form Videos for Research Communication

PaperTok: 探索生成式AI在科研传播中制作短视频的应用

Meziah Ruby Cristobal, Hyeonjeong Byeon, Tze-Yu Chen, Ruoxi Shang, Donghoon Shin, Ruican Zhong, Tony Zhou, Gary Hsieh

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 PaperTok利用生成式AI帮助研究人员将学术论文转化为短视频,通过自动化脚本和视听内容生成,提升科研传播效率。

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), Apr 13-17, 2026, Barcelona, Spain. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏