arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-08 至 2026-01-08 共收录 99 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2505.22156 2026-01-08 cs.CL 57%

InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing

InComeS: 将压缩与选择机制整合到LLMs中以实现高效的模型编辑

Shuaiyi Li, Zhisong Zhang, Yang Deng, Chenlong Deng, Tianqing Fang, Hongming Zhang, Haitao Mi, Dong Yu, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Tencent AI Lab(腾讯AI实验室) Singapore Management University(新加坡管理学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 InComeS通过整合压缩和选择机制,提升LLMs处理多编辑任务的效率和性能。

Comments 18 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 32 篇

2601.03940 2026-01-08 cs.CL cs.AI 86%

Large-Scale Aspect-Based Sentiment Analysis with Reasoning-Infused LLMs

基于推理注入的大型方面基于情感分析

Paweł Liskowski, Krzysztof Jankowski

机构 * Snowflake Inc.(Snowflake公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 Arctic-ABSA通过引入推理注入技术,提升了大型多语言方面情感分析模型的准确性和泛化能力,实现了在多个领域和语言上的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20707 2026-01-08 cs.CL cs.AI physics.ed-ph 81%

Dissecting Physics Reasoning in Small Language Models: A Multi-Dimensional Analysis from an Educational Perspective

解构小型语言模型中的物理推理:从教育视角的多维分析

Nicy Scaria, Silvester John Joseph Kennedy, Krishna Agarwal, Diksha Seth, Deepak Subramani

机构 * Computational and Data Sciences, Indian Institute of Science, India(计算机与数据科学,印度科学研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文从教育视角出发,通过Physbench评估了小型语言模型在物理推理中的可靠性,发现其在多步骤推理中存在显著的可靠性缺口,且失败模式随模型能力变化,强调评估需更注重推理过程而非最终答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04086 2026-01-08 cs.CL 79%

KDCM: Reducing Hallucination in LLMs through Explicit Reasoning Structures

KDCM:通过显式推理结构减少大语言模型中的幻觉

Jinbo Hao, Kai Yang, Qingzhen Su, Yifan Li, Chao Jiang

机构 * School of Computer Engineering, Jiangsu Ocean University(江苏海洋大学计算机工程学院) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 KDCM通过显式推理结构减少大语言模型中的幻觉,提升预测可靠性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03400 2026-01-08 cs.CV cs.AI 79%

Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning

Eye-Q:一个多语言视觉词谜解决和图像到短语推理的基准

Ali Najar, Alireza Mirrokni, Arshia Izadyari, Sadegh Mohammadian, Amir Homayoon Sharifizade, Asal Meskin, Mobin Bagherian, Ehsaneddin Asgari

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Eye-Q提出一个多语言视觉词谜基准,评估模型在复杂视觉推理中的能力,发现现有模型在抽象和跨语言推理上存在显著差距。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00340 2026-01-08 cs.AI 79%

Better Call CLAUSE: A Discrepancy Benchmark for Auditing LLMs Legal Reasoning Capabilities

更好的CLAUSE:用于审计LLM法律推理能力的差异基准

Manan Roy Choudhury, Adithya Chandramouli, Mannan Anand, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CLAUSE是一个用于评估LLM法律推理能力的基准,通过生成现实扰动合同检测细微法律错误,揭示LLM在识别和解释法律缺陷方面的不足。

Comments 42 pages, 4 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03783 2026-01-08 cs.CL 77%

HearSay Benchmark: Do Audio LLMs Leak What They Hear?

HearSay基准:音频大语言模型是否泄露所听内容?

Jin Wang, Liang Lin, Kaiwen Luo, Weiliu Wang, Yitian Chen, Moayad Aloqaily, Xuehai Tang, Zhenhong Zhou, Kun Wang, Li Sun, Qingsong Wen

机构 * XDU(北华大学) NTU(国立台湾大学) NCEPU(南京工程大学) BUPT(北京邮电大学) SHU(上海大学) UAEU(阿联酋大学) UCAS-IIE(中国科学院大学国际学院) Squirrel AI

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 HearSay基准研究发现音频大语言模型通过声纹泄露隐私,揭示其固有隐私风险及安全机制不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04137 2026-01-08 cs.RO cs.AI cs.CV 70%

Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test

哇,哇,val!一个综合的具身世界模型评估图灵测试

Chun-Kai Fan, Xiaowei Chi, Xiaozhu Ju, Hao Li, Yong Bao, Yu-Kai Wang, Lizhang Chen, Zhiyuan Jiang, Kuangzhi Ge, Ying Li, Weishi Mi, Qingpo Wuwu, Peidong Jia, Yulin Luo, Kevin Zhang, Zhiyuan Qin, Yong Dai, Sirui Han, Yike Guo, Shanghang Zhang, Jian Tang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Wow-wo-val基准测试,评估视频基础模型在具身人工智能中的生成能力,发现其在长期规划和物理一致性上表现有限,揭示了现实世界与生成视频之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10390 2026-01-08 cs.CL cs.CR 70%

Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts

通过显式有害提示对商用黑盒大语言模型进行劫持

Chiyu Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang Lab(浙江实验室)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DH-CoT攻击方法,通过整合多种劫持技巧和恶意内容检测框架,有效劫持了包括GPT-5和Claude-4在内的商用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03589 2026-01-08 cs.CL 70%

OLA: Output Language Alignment in Code-Switched LLM Interactions

OLA:代码切换交互中的输出语言对齐

Juhyun Oh, Haneul Yoo, Faiz Ghifari Haznitrama, Alice Oh

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 OLA研究了代码切换交互中LLM输出语言对齐问题,发现现有模型存在隐含语言期望识别偏差,通过Code-Switching Aware DPO方法显著提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17394 2026-01-08 cs.CL cs.CV cs.CY 70%

Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?

视觉语言模型是否是跨文化理论思维推理者?

Zabir Al Nazi, GM Shahariar, Md. Abrar Hossain, Wei Peng

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出CulturalToM-VQA基准测试集,评估视觉语言模型在跨文化理论思维推理中的表现,发现前沿模型在准确性上显著提升,但存在假信念推理和区域差异等局限,揭示模型的社会可取性偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03432 2026-01-08 cs.SE 67%

CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models

CodeEval: 一种面向代码训练大语言模型的教育性评估方法

Danny Brahman, Mohammad Mahoor

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract)

AI总结 CodeEval通过多维基准数据集和开源执行框架,针对代码训练大语言模型的评估与改进提供教育性方法。

Comments Accepted at the International Joint Conference on Natural Language Processing & Asia-Pacific Chapter of the Association for Computational Linguistics, 2025. Will be published at ACL anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03286 2026-01-08 cs.CV cs.AI cs.CL cs.LG 67%

HyperCLOVA X 32B Think

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01216 2026-01-08 cs.CL cs.AI cs.LG 67%

Detecting PTSD in Clinical Interviews: A Comparative Analysis of NLP Methods and Large Language Models

在临床访谈中检测PTSD:自然语言处理方法和大语言模型的比较分析

Feng Chen, Dror Ben-Zeev, Gillian Sparks, Arya Kadakia, Trevor Cohen

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究比较了NLP方法和大语言模型在临床访谈中检测PTSD的效果,发现领域特定模型和嵌入方法表现最佳,强调了领域适应技术在PTSD筛查中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03515 2026-01-08 cs.CL cs.AI 62%

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents

Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理

Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁赫斯国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03268 2026-01-08 cs.CL cs.LG 62%

WRAVAL -- WRiting Assist eVALuation

WRAVAL -- 书写辅助评估

Gabriel Benedict, Matthew Butler, Naved Merchant, Eetu Salama-Laine

机构 * Amazon Fire Tablets(亚马逊火平板) Amazon Devices Product(亚马逊设备产品部) Amazon Devices OS(亚马逊设备操作系统部)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 WRAVAL提出了一种评估框架,用于评估小型语言模型在非推理任务中的能力,特别是在缺乏预定义数据集的情况下,通过任务特定微调展示其潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00947 2026-01-08 cs.CL cs.AI 62%

Table as a Modality for Large Language Models

表格作为大语言模型的一种模态

Liyao Li, Chao Ye, Wentao Ye, Yifei Sun, Zhe Jiang, Haobo Wang, Jiaming Tian, Yiming Zhang, Ningtao Wang, Xing Fu, Gang Chen, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TAMO通过将表格视为独立模态,结合文本令牌,提升大语言模型对表格数据的推理能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04055 2026-01-08 cs.CL 57%

Modular Prompt Optimization: Optimizing Structured Prompts with Section-Local Textual Gradients

模块化提示优化:通过部分局部文本梯度优化结构化提示

Prith Sharma, Austin Z. Henley

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 模块化提示优化通过局部文本梯度优化结构化提示,提升小型开源LLM的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03986 2026-01-08 cs.CL 57%

Benchmark^2: Systematic Evaluation of LLM Benchmarks

Benchmark^2: 大语言模型评估基准的系统性评估

Qi Qian, Chengsong Huang, Jingwen Xu, Changze Lv, Muling Wu, Wenhao Liu, Xiaohua Wang, Zhenghua Wang, Zisu Huang, Muzhao Tian, Jianhan Xu, Kun Hu, He-Da Wang, Yao Hu, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Washington University in St. Louis(华盛顿大学圣路易斯分校) Xiaohongshu Inc.(小红书公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Benchmark^2 提出了一种系统性评估大语言模型评估基准的方法,通过三个互补指标分析基准质量,揭示现有基准的差异并展示选择性构建的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03670 2026-01-08 cs.CL 57%

DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management

DisastQA:一个评估灾难管理中问答能力的综合性基准

Zhitong Chen, Kai Yin, Xiangjue Dong, Chengkai Liu, Xiangpeng Li, Yiming Xiao, Bo Li, Junwei Ma, Ali Mostafavi, James Caverlee

机构 * Texas A&M University(德克萨斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 DisastQA是一个用于评估灾难管理中问答能力的综合性基准,通过严格验证的问题和人类-LLM协作流程,揭示了在噪声环境下模型性能的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03590 2026-01-08 cs.CV cs.AI 57%

Can LLMs See Without Pixels? Benchmarking Spatial Intelligence from Textual Descriptions

大语言模型能否通过像素感知空间智能?基于文本描述的空间智能基准测试

Zhongbin Guo, Zhen Yang, Yushan Li, Xinyue Zhang, Wenyu Gao, Jiacheng Wang, Chengzhi Li, Xiangrui Liu, Ping Jian

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SiT-Bench通过文本描述评估大语言模型的空间智能,揭示其在全局一致性方面的不足,并表明显式空间推理可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03531 2026-01-08 cs.CL 57%

PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models

PALM-Bench: 一个全面的个性化音频-语言模型基准测试

Yuwen Wang, Xinyuan Qian, Tian-Hao Zhang, Jiaran Gao, Yuchen Pan, Xin Wang, Zhou Pan, Chen Wei, Yiming Wang

机构 * University of Science and Technology Beijing(北京科技大学) Li Auto(利汽车) Fondazione Bruno Kessler(布鲁诺·克塞尔基金会)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PALM-Bench旨在通过构建首个个性化音频-语言模型基准测试,促进个性化模型在多说话者场景中的方法发展和评估。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03458 2026-01-08 cs.CY cs.AI 57%

Automated Feedback Generation for Undergraduate Mathematics: Development and Evaluation of an AI Teaching Assistant

大学数学自动反馈生成:一种AI教学助教的开发与评估

Aron Gohr, Marie-Amelie Lawn, Kevin Gao, Inigo Serjeant, Stephen Heslip

机构 * Imperial College London(帝国理工学院伦敦校区)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的教学助手系统,用于生成大学数学作业的自动反馈,通过模块化工作流和大型语言模型实现了对技术正确性和风格的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03434 2026-01-08 cs.LG 57%

VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding

VNU-Bench:多源多模态新闻视频理解的基准数据集

Zibo Liu, Muyang Li, Zhe Jiang, Shigang Chen

机构 * University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03285 2026-01-08 physics.ed-ph cs.AI 57%

Feedback Indices to Evaluate LLM Responses to Rebuttals for Multiple Choice Type Questions

反馈指数用于评估LLM对多项选择题反驳的响应

Justin C. Dunlap, Anne-Simone Parent, Ralf Widenhorn

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出反馈指数评估LLM对多项选择题反驳的响应,通过分析谄媚和固执行为,揭示模型在不同世代间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03281 2026-01-08 eess.SY cs.AI cs.SY 57%

$α^3$-Bench: A Unified Benchmark of Safety, Robustness, and Efficiency for LLM-Based UAV Agents over 6G Networks

$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03023 2026-01-08 cs.CL cs.HC 57%

MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models

MedDialogRubrics: 一种用于大型语言模型多轮医疗咨询的综合基准和评估框架

Lecheng Gong, Weimin Fang, Ting Yang, Dongjie Tao, Chunxiao Guo, Peng Wei, Bo Xie, Jinqun Guan, Zixiao Chen, Fang Shi, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MedDialogRubrics提出了一种用于评估大型语言模型多轮医疗对话能力的综合基准和评估框架,通过合成患者案例和细粒度评估 rubrics,揭示了当前模型在医疗对话管理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02757 2026-01-08 cs.AI 57%

LLM Agent Framework for Intelligent Change Analysis in Urban Environment using Remote Sensing Imagery

基于遥感影像的城市环境智能变化分析LLM代理框架

Zixuan Xiao, Jun Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于LLM和视觉基础模型的ChangeGPT框架,通过分层结构提升变化检测的智能与适应性,实现在城市环境中的高效变化分析。

Journal ref Automation in Construction 177 (2025) 106341

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13936 2026-01-08 cs.CL 57%

FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis

FinDeepResearch:在严谨的金融分析中评估深度研究代理

Fengbin Zhu, Xiang Yao Ng, Ziyang Liu, Chang Liu, Xianwei Zeng, Chao Wang, Tianhui Tan, Xuan Yao, Pengyang Shao, Min Xu, Zixuan Wang, Jing Wang, Xin Lin, Junfeng Li, Jingxian Zhu, Yang Zhang, Wenjie Wang, Fuli Feng, Richang Hong, Huanbo Luan, Ke-Wei Huang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Estates Pte Ltd(6Estates公司) Asian Institute of Digital Finance(亚洲数字金融研究所) Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 FinDeepResearch通过HisRubric框架评估深度研究代理在金融分析中的能力,构建包含多语言和多市场的基准测试,揭示不同方法在财务分析中的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10549 2026-01-08 cs.AI 57%

ELAIPBench: A Benchmark for Expert-Level Artificial Intelligence Paper Understanding

ELAIPBench: 一个用于专家级人工智能论文理解的基准

Xinbang Dai, Huikang Hu, Yongrui Chen, Jiaqi Li, Rihui Jin, Yuyang Zhang, Xiaoguang Li, Lifeng Shang, Guilin Qi

机构 * Southeast University(东南大学) Noah’s Ark Lab(诺亚实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ELAIPBench通过专家编纂的多选题评估LLM对AI论文的理解能力,发现最佳模型准确率仅为39.95%,远低于人类,揭示了LLM在学术论文理解上的显著不足。

Comments 24 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏