arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-22 至 2026-01-22 共收录 68 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 3 篇

2511.09345 2026-01-22 cs.CL 57%

Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time Scaling

Seer Self-Consistency:面向自适应测试时缩放的先进预算估计

Shiyu Ji, Yixuan Wang, Yijun Liu, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology, China(社会计算与交互机器人研究中心,哈尔滨工业大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 SeerSC通过整合系统1和系统2推理,提升自适应测试时缩放的令牌效率和延迟,实现47%的令牌消耗减少和43%的推理延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 13 篇

2601.14343 2026-01-22 cs.CR cs.SY eess.SY 85%

Rethinking On-Device LLM Reasoning: Why Analogical Mapping Outperforms Abstract Thinking for IoT DDoS Detection

重新思考设备端LLM推理:为什么类比映射优于抽象思维用于IoT DDoS检测

William Pan, Guiran Liu, Binrong Zhu, Qun Wang, Yingzhou Lu, Beiyu Lin, Rose Qingyang Hu

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出一种结合Co_T和RAG的物联网边缘DDoS检测框架,通过示例驱动推理提升小型ODLLMs在资源受限下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14270 2026-01-22 cs.CL cs.AI 81%

Opening the Black Box: A Survey on the Mechanisms of Multi-Step Reasoning in Large Language Models

揭开黑箱:关于大语言模型多步推理机制的综述

Liangming Pan, Jason Liang, Jiaran Ye, Minglai Yang, Xinyuan Lu, Fengbin Zhu

机构 * Peking University(北京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学) University of Arizona(亚利桑那大学) National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型多步推理机制,探讨了隐式和显式推理过程,并提出了未来研究方向。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15286 2026-01-22 cs.CV cs.AI cs.LG cs.RO 79%

Iterative Refinement Improves Compositional Image Generation

迭代细化改进组合图像生成

Shantanu Jaiswal, Mihir Prabhudesai, Nikash Bhardwaj, Zheyang Qin, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Lambda AI

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种迭代细化策略,通过视觉-语言模型反馈提升组合图像生成质量,实验显示在多个基准上均优于并行采样方法。

Comments Project webpage: https://iterative-img-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20362 2026-01-22 cs.CV 78%

CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation

CRAFT:连续推理与代理反馈调优用于多模态文本到图像生成

V. Kovalev, A. Kuvshinov, A. Buzovkin, D. Pokidov, D. Timonin

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 CRAFT通过显式推理和反馈调优提升多模态生成模型的可靠性,实现可控且高效的文本到图像生成。

Comments 37 pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14728 2026-01-22 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering

AQAScore: 通过音频问答评估文本到音频生成中的语义对齐

Chun-Yi Kuan, Kai-Wei Chang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AQAScore通过音频问答评估文本到音频生成的语义对齐,利用大型语言模型的推理能力,有效捕捉语义不一致性。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18085 2026-01-22 cs.CL cs.AI cs.LG 67%

Temporal Relation Extraction in Clinical Texts: A Span-based Graph Transformer Approach

临床文本中的时间关系抽取:一种基于跨度的图变换器方法

Rochana Chaturvedi, Peyman Baghershahi, Sourav Medya, Barbara Di Eugenio

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GRAPHTREX方法,通过结合基于跨度的实体关系抽取、临床预训练语言模型和异构图变换器,提升临床文本中时间关系抽取的准确率和长距离关系识别能力。

Comments Introducing a novel method for joint extraction of medical events and temporal relations from free-text, leveraging clinical LPLMs and Heterogeneous Graph Transformers, achieving a 5.5% improvement over the previous state-of-the-art and up to 8.9% on long-range relations

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14589 2026-01-22 cs.HC cs.AI cs.CL cs.CY 62%

Designing KRIYA: An AI Companion for Wellbeing Self-Reflection

设计KRIYA:一种用于幸福感自我反思的AI伴侣

Shanshan Zhu, Wenxuan Song, Jiayue Melissa Shi, Dong Whi Yoo, Karthik S. Bhat, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Drexel University(德雷塞尔大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.CL、cs.AI

AI总结 KRIYA是一种通过自我反思功能帮助用户理解个人幸福感数据的AI伴侣,旨在减少表现焦虑,提升用户对健康数据的反思性理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15164 2026-01-22 cs.RO cs.AI 57%

V-CAGE: Context-Aware Generation and Verification for Scalable Long-Horizon Embodied Tasks

V-CAGE:面向可扩展长时间跨度具身任务的上下文感知生成与验证

Yaru Liu, Ao-bo Wang, Nanyang Ye

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, England.(计算机科学与技术系,剑桥大学,剑桥,英格兰) Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) Wuhan University, Wuhan, Hubei, China(武汉大学,武汉,湖北,中国)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 V-CAGE通过上下文感知生成与验证框架,提升大规模具身任务数据集的物理和语义保真度,提高下游策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14470 2026-01-22 cs.SE cs.AI cs.MA 57%

Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering

令牌经济学:量化令牌在代理软件工程中的使用位置

Mohamad Salim, Jasmine Latendresse, SayedHassan Khatoonabadi, Emad Shihab

机构 * Data-driven Analysis of Software (DAS) Lab Concordia University Montreal Canada Data-driven Analysis of Software (DAS) Lab Concordia University

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究通过分析LLM-MA系统在软件开发生命周期中的令牌消耗,发现代码审查阶段消耗最大,提出优化代理协作效率的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14351 2026-01-22 cs.MA cs.AI 57%

If You Want Coherence, Orchestrate a Team of Rivals: Multi-Agent Models of Organizational Intelligence

如果你想要一致性,就组建一支对手团队:组织智能的多智能体模型

Gopal Vijayaraghavan, Prasanth Jayachandran, Arun Murthy, Sunil Govindan, Vivek Subramanian

机构 * Isotopes AI USA(Isotopes AI美国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过多智能体团队协作,利用对立激励因素提高组织智能的可靠性,通过远程代码执行器实现感知与执行的分离,达到高错误拦截率和可控延迟。

Comments 15 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10111 2026-01-22 cs.CV cs.AI cs.CR 57%

Training-Free In-Context Forensic Chain for Image Manipulation Detection and Localization

无需训练的上下文取证链用于图像篡改检测与定位

Rui Chen, Bin Liu, Changtao Miao, Xinghao Wang, Yi Li, Tao Gong, Qi Chu, Nenghai Yu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ICFC提出一种无需训练的多模态大语言模型框架,用于图像篡改检测与定位,通过可解释的推理流程实现高效且准确的图像分析。

Comments This version was uploaded in error and contains misleading information found in an early draft. The manuscript requires extensive and long-term revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10499 2026-01-22 cs.IR cs.CL 57%

Graph-based Approaches and Functionalities in Retrieval-Augmented Generation: A Comprehensive Survey

基于图的方法和功能在检索增强生成中的应用:全面综述

Zulun Zhu, Tiancheng Huang, Kai Wang, Junda Ye, Xinghe Chen, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了图方法在检索增强生成中的应用,分析了图在提升性能中的作用,指出现有挑战和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14757 2026-01-22 cs.CV 50%

ReinPath: A Multimodal Reinforcement Learning Approach for Pathology

ReinPath:一种用于病理学的多模态强化学习方法

Kangcheng Zhou, Jun Jiang, Qing Zhang, Shuang Zheng, Qingli Li, Shugong Xu

机构 * East China Normal University(华东师范大学) Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ReinPath提出了一种多模态强化学习方法,通过构建高质量病理学VQA数据集,结合语义奖励策略和群体相对策略优化,提升了病理图像和文本的多模态推理能力,并在零样本分类任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 18 篇

2508.04339 2026-01-22 cs.AI 85%

Deliberative Reasoning Network: An Uncertainty-Driven Paradigm for Belief-Tracked Inference with Pretrained Language Models

辩证推理网络:一种基于不确定性的信念跟踪推理范式,用于预训练语言模型

Anran Xu, Jincheng Wang, Baigen Cai, Tao Wen

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 DRN通过不确定性最小化范式提升预训练语言模型的逻辑推理能力,实现高准确率和强泛化性能。

Comments This submission represents an early exploratory draft and was uploaded prematurely. The authors have decided to withdraw it because the current version does not accurately reflect the intended scope and technical formulation of the work, and may be misleading if cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15279 2026-01-22 cs.LG cs.AI 81%

MolecularIQ: Characterizing Chemical Reasoning Capabilities Through Symbolic Verification on Molecular Graphs

MolecularIQ: 通过分子图上的符号验证来表征化学推理能力

Christoph Bartmann, Johannes Schimunek, Mykyta Ielanskyi, Philipp Seidl, Günter Klambauer, Sohvi Luukkonen

机构 * ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University, Linz, Austria(林茨ELLIS单元和LIT人工智能实验室,机器学习研究所,约翰·凯撒大学,林茨,奥地利) Clinical Research Institute Medical Artificial Intelligence, Johannes Kepler University, Linz, Austria(医学人工智能临床研究研究所,约翰·凯撒大学,林茨,奥地利)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MolecularIQ是一个专注于分子图符号验证的化学推理基准测试,旨在评估模型对分子结构推理能力的细粒度评估并揭示模型在特定任务和分子结构上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13761 2026-01-22 cs.AI cs.CL 81%

DARC: Decoupled Asymmetric Reasoning Curriculum for LLM Evolution

DARC:解耦的非对称推理课程用于LLM进化

Shengda Fan, Xuyan Ye, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DARC通过解耦的非对称推理课程框架,提升大型语言模型的自我进化能力,实现无需人工标注的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08134 2026-01-22 cs.CL 79%

How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains

大型推理模型的置信度估计有多可靠?对高风险领域的系统基准测试

Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur, Ivan Brugere, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过系统基准测试,评估了大型推理模型置信度估计方法的可靠性,发现基于文本的编码器在歧视方面表现最佳,而结构感知模型在校准方面表现最佳,揭示了当前方法的局限性。

Comments Accepted to the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026) main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14700 2026-01-22 cs.CL 79%

DARL: Encouraging Diverse Answers for General Reasoning without Verifiers

DARL: 促进无验证者的一般推理中的多样化答案

Chongxuan Huang, Lei Lin, Xiaodong Shi, Wenping Hu, Ruiming Tang

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Kuaishou Technology(快手科技) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),文化和旅游部)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DARL通过鼓励在参考答案可控偏差范围内生成多样化答案,提升大语言模型在一般推理任务中的性能和输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14479 2026-01-22 cs.CL 79%

Can LLM Reasoning Be Trusted? A Comparative Study: Using Human Benchmarking on Statistical Tasks

大语言模型的推理能力是否可信?:通过统计任务的人类基准测试

Crish Nagarkar, Leonid Bogachev, Serge Sharoff

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过统计任务的人类基准测试,评估了大语言模型在统计推理和自我评估能力上的表现,发现微调后的模型在统计任务上表现优异,且能更有效地评估答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14349 2026-01-22 cs.MA cs.LG 79%

MARBLE: Multi-Agent Reasoning for Bioinformatics Learning and Evolution

MARBLE: 多智能体推理用于生物信息学学习与进化

Sunghyun Kim, Seokwoo Yun, Youngseo Yun, Youngrak Lee, Sangsoo Lim

机构 * Division of AI Convergence, Dongguk University, Seoul, South Korea(东国大学人工智能融合系) AI Research Team, Ar-ge Inc., Seoul, South Korea(Ar-ge公司人工智能研究团队) Department of Biomedical Engineering, Dongguk University, Goyang-si, Gyeonggi-do, South Korea(东国大学生物医学工程系) Department of Computer Science and Artificial Intelligence, Dongguk University, Seoul, South Korea(东国大学计算机科学与人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 MARBLE通过多智能体推理实现生物信息学模型的稳定优化,提升性能并保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15115 2026-01-22 cs.CV 78%

Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning

无需训练的多阶段对抗推理 hateful 视频检测

Shuonan Yang, Yuchen Zhang, Zeyu Fu

机构 * Multimodal Intelligence Lab, Department of Computer Science, University of Exeter, United Kingdom(埃克塞特大学计算机科学系多模态智能实验室) Institute for Analytics and Data Science, University of Essex, United Kingdom(埃塞克斯大学分析与数据科学研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MARS通过多阶段对抗推理框架实现无需训练的可解释仇恨视频检测,提升检测可靠性与透明度。

Comments Accepted at ICASSP 2026. \c{opyright} 2026 IEEE. This is the author accepted manuscript. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14610 2026-01-22 cs.CV 78%

Learning Consistent Taxonomic Classification through Hierarchical Reasoning

通过层次推理学习一致的分类

Zhenghong Li, Kecheng Zheng, Haibin Ling

机构 * Stony Brook University(石溪大学) Ant Research(蚂蚁研究院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 VL-Taxon通过两阶段层次推理框架提升分类的叶级别准确性和层次一致性,实验表明其在iNaturalist-2021数据集上性能优于现有模型。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03369 2026-01-22 cs.CV cs.CL 74%

RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models

RiskCueBench: 视频语言模型中早期风险信号的前瞻性推理基准测试

Sha Luo, Yogesh Prabhu, Timothy Ossowski, Kaiping Chen, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 RiskCueBench通过标注早期风险信号片段,评估视频语言模型在预测未来风险事件中的能力,揭示了现有系统在解读动态情境方面的不足。

Comments *updated author email in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15267 2026-01-22 cs.CY cs.AI cs.CL 62%

Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions

评估大型语言模型在法律应用中的表现:挑战、方法与未来方向

Yiran Hu, Huanghai Liu, Chong Wang, Kunran Li, Tien-Hsuan Wu, Haitao Li, Xinran Xu, Siqing Huo, Weihang Su, Ning Zheng, Siyuan Zheng, Qingyao Ai, Yun Liu, Renjun Bian, Yiqun Liu, Charles L. A. Clarke, Weixing Shen, Ben Kao

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大型语言模型在法律应用中的评估挑战与方法,分析了现有评估框架的局限性,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14695 2026-01-22 cs.LG cs.AI 62%

CoScale-RL: Efficient Post-Training by Co-Scaling Data and Computation

CoScale-RL: 通过协同扩展数据与计算实现高效后期训练

Yutong Chen, Jiandong Gao, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院) Beijing National Research Center for Information Science(北京信息科学国家研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CoScale-RL通过协同扩展数据与计算,提升大型推理模型的训练效率和推理能力。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15282 2026-01-22 cs.CV cs.AI cs.RO 57%

Rethinking Video Generation Model for the Embodied World

重新思考具身世界的视频生成模型

Yufan Deng, Zilin Pan, Hongyu Zhang, Xiaojie Li, Ruoqing Hu, Yufei Ding, Yiming Zou, Yan Zeng, Daquan Zhou

机构 * Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Rbench机器人视频生成基准和RoVid-X数据集,旨在解决高保真机器人视频生成中的数据短缺问题,推动具身AI发展。

Comments Github: https://github.com/DAGroup-PKU/ReVidgen/ Project website: https://dagroup-pku.github.io/ReVidgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15129 2026-01-22 cs.CL 57%

RSNA Large Language Model Benchmark Dataset for Chest Radiographs of Cardiothoracic Disease: Radiologist Evaluation and Validation Enhanced by AI Labels (REVEAL-CXR)

用于心胸疾病胸部X光影像的RSNA大语言模型基准数据集:通过AI标签增强的放射科评估和验证(REVEAL-CXR)

Yishu Wei, Adam E. Flanders, Errol Colak, John Mongan, Luciano M Prevedello, Po-Hao Chen, Henrique Min Ho Lee, Gilberto Szarf, Hamilton Shoji, Jason Sho, Katherine Andriole, Tessa Cook, Lisa C. Adams, Linda C. Chu, Maggie Chung, Geraldine Brusca-Augello, Djeven P. Deva, Navneet Singh, Felipe Sanchez Tijmes, Jeffrey B. Alpert, Elsie T. Nguyen, Drew A. Torigian, Kate Hanneman, Lauren K Groner, Alexander Phan, Ali Islam, Matias F. Callejas, Gustavo Borges da Silva Teles, Faisal Jamal, Maryam Vazirabad, Ali Tejani, Hari Trivedi, Paulo Kuriki, Rajesh Bhayana, Elana T. Benishay, Yi Lin, Yifan Peng, George Shih

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过AI辅助标注流程,创建了包含200张胸部影像的基准数据集,用于评估不同模型,同时帮助放射科医生更高效地标注影像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14903 2026-01-22 cs.CL 57%

PodBench: A Comprehensive Benchmark for Instruction-Aware Audio-Oriented Podcast Script Generation

PodBench: 一个全面的指令感知音频导向播客脚本生成基准

Chenning Xu, Mao Zheng, Mingyu Zheng, Mingyang Song

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PodBench通过多方面评估框架和实验验证,揭示了开源模型在长上下文和多说话人协调任务中的鲁棒性优势,同时指出高指令遵循性与高质量内容之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14549 2026-01-22 cs.LG 57%

QMC: Efficient SLM Edge Inference via Outlier-Aware Quantization and Emergent Memories Co-Design

QMC:通过异常感知量化和涌现记忆协同设计实现高效的SLM边缘推断

Nilesh Prasad Pandey, Jangseon Park, Onat Gungor, Flavio Ponzina, Tajana Rosing

机构 * University of California San Diego(加州大学圣地亚哥分校) San Diego State University(圣地亚哥州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 QMC通过异常感知量化和涌现记忆协同设计,实现高效SLM边缘推断,显著降低内存、能耗和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏