arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-25 至 2025-11-25 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 17 篇

2506.12509 2025-11-25 cs.AI 79%

Graph of Verification: Structured Verification of LLM Reasoning with Directed Acyclic Graphs

验证图:基于有向无环图的结构化LLM推理验证

Jiwei Fang, Bin Zhang, Changwei Wang, Jin Wan, Zhiwei Xu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出验证图(GoV),通过灵活的节点块架构实现适应性多粒度验证,有效解决LLM推理验证中的精度与鲁棒性平衡问题。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17923 2025-11-25 cs.CL cs.AI 79%

Towards Efficient LLM-aware Heterogeneous Graph Learning

面向高效LLM-aware异构图学习

Wenda Li, Tongya Zheng, Shunyu Liu, Yu Wang, Kaixuan Chen, Hanyang Yuan, Bingde Hu, Zujie Ren, Mingli Song, Gang Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Zhejiang Lab(浙江实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Zhejiang Provincial Engineering Research Center for Real-Time SmartTech in Urban Security Governance, School of Computer and Computing Science, Hangzhou City University(浙江省实时智能城市安全治理工程技术研究中心,杭州城市大学计算机与计算科学学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou, Zhejiang, China(杭州高新技术区(滨江)区块链与数据安全研究院,杭州,浙江,中国) Nanyang Technological University(南洋理工大学) Bangsun Technology(邦sun科技)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ELLA框架,通过LLM-aware关系分词器和层次关系图变压器,高效解决异构图中复杂关系语义建模和任务间语义间隙问题,实现性能与效率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13737 2025-11-25 cs.CR 78%

ExtendAttack: Attacking Servers of LRMs via Extending Reasoning

通过扩展推理攻击LRMs的服务器

Zhenhao Zhu, Yue Liu, Zhiwei Xu, Yingwei Ma, Hongcheng Gao, Nuo Chen, Yanpei Guo, Wenjie Qu, Huiying Xu, Zifeng Kang, Xinzhong Zhu, Jiaheng Zhang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 ExtendAttack通过扩展推理过程恶意占用LRMs服务器资源,显著增加响应长度和延迟,同时保持查询含义和回答准确性。

Comments Accepted to AAAI 2026. This arXiv version corresponds to the camera-ready manuscript and includes expanded appendices. Please cite the AAAI 2026 version when available

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06567 2025-11-25 cs.LG cs.AI 73%

Human Cognition Inspired RAG with Knowledge Graph for Complex Problem Solving

受人类认知启发的基于知识图谱的RAG用于复杂问题解决

Yao Cheng, Yibo Zhao, Jiapeng Zhu, Yao Liu, Xing Sun, Xiang Li

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 CogGRAG是一种受人类认知启发的基于图的RAG框架,通过树状思维图结构实现复杂问题分解、知识检索与推理,提升知识图谱问答的准确性和可靠性。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17854 2025-11-25 cs.CL cs.AI cs.CY cs.HC cs.MA 62%

A superpersuasive autonomous policy debating system

一种超级有说服力的自主辩论系统

Allen Roush, Devin Gonier, John Hines, Judah Goldfeder, Philippe Martin Wyder, Sanjay Basu, Ravid Shwartz Ziv

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 DeepDebater是一种能够自主参与并赢得完整政策辩论的AI系统,通过多智能体协作生成高质量论证并战胜人类对手。

Comments Accepted to CLIP workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04427 2025-11-25 cs.AI cs.CL 62%

Plugging Schema Graph into Multi-Table QA: A Human-Guided Framework for Reducing LLM Reliance

将模式图嵌入多表问答:一种减少大语言模型依赖的人工引导框架

Xixi Wang, Miguel Costa, Jordanka Kovaceva, Shuai Wang, Francisco C. Pereira

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于图的框架,利用人工整理的关系知识减少对大语言模型的依赖,有效解决多表问答中复杂表格模式链接的问题。

Comments Accepted to EMNLP 2025 findings

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20840 2025-11-25 cs.RO cs.AI cs.MM 57%

Learning Primitive Embodied World Models: Towards Scalable Robotic Learning

学习原始具身世界模型:迈向可扩展的机器人学习

Qiao Sun, Liujia Yang, Wei Tang, Wei Huang, Kaixin Xu, Yongchao Chen, Mingyu Liu, Jiange Yang, Haoyi Zhu, Yating Wang, Tong He, Yilun Chen, Xili Dai, Nanyang Ye, Qinying Gu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan(复旦大学) SJTU(上海交通大学) NJUST(南京理工大学) THU(清华大学) Harvard(哈佛大学) ZJU(浙江大学) NJU(南京大学) USTC(中国科学技术大学) Tongji(同济大学) HKUST (GZ)(香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23715 2025-11-25 cs.CL 57%

Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models

不要轻信前提:评估大语言模型的前提批判能力

Jinzhe Li, Gengxu Li, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出前提批判基准,评估大语言模型在面对错误前提时的批判能力,揭示其在推理与前提批判上的差异及改进需求。

Comments EMNLP 2025 Findings camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17927 2025-11-25 cs.CV cs.AI 57%

PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning

PA-FAS: 向可解释和通用的多模态人脸反伪装迈进:通过路径增强强化学习

Yingjie Ma, Xun Lin, Yong Xu, Weicheng Xie, Zitong Yu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 PA-FAS通过路径增强强化学习提升多模态人脸反伪装的可解释性和泛化能力。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18534 2025-11-25 cs.CV 50%

HiFi-MambaV2: Hierarchical Shared-Routed MoE for High-Fidelity MRI Reconstruction

HiFi-MambaV2:分层共享路由MoE用于高保真MRI重建

Pengcheng Fang, Hongli Chen, Guangzhen Yao, Jian Shi, Fangfang Tang, Xiaohao Cai, Shanshan Shan, Feng Liu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 HiFi-MambaV2通过分层共享路由MoE和频率一致拉普拉斯金字塔,实现高保真MRI重建,优于多种基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11255 2025-11-25 cs.IR 50%

Align$^3$GR: Unified Multi-Level Alignment for LLM-based Generative Recommendation

Align$^3$GR: 基于大语言模型的生成推荐系统统一多级对齐

Wencai Ye, Mingjie Sun, Shuhang Chen, Wenjin Wu, Peng Jiang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Align$^3$GR通过统一多级对齐方法,提升大语言模型在生成推荐系统中的性能,实验显示在Recall@10和NDCG@10指标上均取得显著提升。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26213 2025-11-25 cs.CV 50%

OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning

OmniDocLayout: 通过粗到细的LLM学习实现多样化的文档布局生成

Hengrui Kang, Zhuangcheng Gu, Zhiyuan Zhao, Zichen Wen, Bin Wang, Weijia Li, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :planning(abstract)

AI总结 OmniDocLayout通过粗到细的LLM学习方法,生成多样化文档布局,解决现有布局生成中多样性和复杂性不足的问题。

Comments TL;DR: With the proposed OmniDocLayout-1M dataset and the LLM-based coarse-to-fine learning strategy, we enable diverse and complex document layout generation that achieves both strong condition consistency and adherence to fundamental aesthetic principles

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18001 2025-11-25 cs.SE 50%

Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement

通过故障性令牌定位和质量感知补丁细化增强自动程序修复

Jiaolong Kong, Xiaofei Xie, Yiheng Xiong, Yuekun Wang, Jian Wang

专题命中 复杂问题求解 :chain-of-thought(abstract)

AI总结 TokenRepair通过内部反思定位潜在故障令牌并结合质量感知的外部反馈,提升自动程序修复的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 32 篇

2511.15065 2025-11-25 cs.CV cs.AI 83%

Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks

通过视频推理:首次评估视频模型在迷宫解决任务中的推理能力

Cheng Yang, Haiyuan Wan, Yiran Peng, Xin Cheng, Zhaoyang Yu, Jiayi Zhang, Junchi Yu, Xinlei Yu, Xiawu Zheng, Dongzhan Zhou, Chenglin Wu

机构 * DeepWisdom Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文首次评估视频模型在迷宫解决任务中的推理能力,提出VR-Bench基准,展示视频生成在空间推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13837 2025-11-25 cs.AI cs.CL cs.CV 81%

Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

强化学习真的能激励大语言模型在基础模型之外提升推理能力吗?

Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Yang Yue, Shiji Song, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学 LeapLab) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现RLVR方法未有效激发LLMs的新型推理能力,而蒸馏方法能更有效地扩展模型推理能力。

Comments 31 pages, 27 figures

Journal ref NeurIPS 2025 Oral; ICML 2025 AI4MATH workshop best paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19005 2025-11-25 cs.AI 79%

Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding

引入视觉场景和推理:一个更现实的口语语言理解基准

Di Wu, Liting Jiang, Ruiyu Fang, Bianjing, Hongyan Xie, Haoxiang Su, Hao Huang, Zhongjiang He, Shuangyong Song, Xuelong Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VRSLU数据集,通过引入视觉信息和显式推理提升口语语言理解的现实应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17775 2025-11-25 cs.CL 79%

FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks

FoREST: 空间推理任务中的参考框架评估

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 FoREST基准通过空间引导提示法提升LLMs在空间推理任务中的参考框架理解能力。

Comments 10 pages, 3 Figures, 4 Tables, EMNLP-2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11025 2025-11-25 cs.CV cs.AI 79%

AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning

AirCopBench: 多无人机协作具身感知与推理的基准测试

Jirong Zha, Yuxuan Fan, Tianyu Zhang, Geng Chen, Yingfeng Chen, Chen Gao, Xinlei Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AirCopBench是一个针对多无人机协作具身感知与推理的首个全面基准测试,通过模拟与现实数据生成14600+问题,评估MLLMs在复杂协作场景中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07852 2025-11-25 cs.AI 79%

FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning

FinMR:面向高级金融推理的知识密集型多模态基准

Shuangyan Deng, Haizhou Peng, Jiachen Xu, Rui Mao, Ciprian Doru Giurcăneanu, Jiamou Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 FinMR是一个面向高级金融推理的知识密集型多模态基准,通过精心设计的问题-答案对和多样化的金融主题,评估专业分析师级别的金融推理能力。

Comments The methodology section contains inaccuracies that may lead to misleading interpretations. The authors have withdrawn this version for correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18572 2025-11-25 cs.CV cs.LG 79%

GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model

GeoReasoner: 基于大规模视觉-语言模型的街景地理定位

Ling Li, Yu Ye, Yao Zhou, Bingchuan Jiang, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tongji University(同济大学) Independent Researcher(独立研究者) Information Engineering University(信息工程大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 GeoReasoner通过整合外部知识和改进的微调方法,提升了街景地理定位的性能,优于现有模型并节省训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18437 2025-11-25 cs.CV 78%

Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning

基于感知证据的强化学习用于多模态推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Zhixiong Zeng, Siqi Yang, Peng Shi, Lin Ma, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Meituan Inc(美团公司) The University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 PEARL通过将推理锚定在验证的视觉证据上,提升多模态推理能力,有效解决视觉幻觉和奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17755 2025-11-25 cs.CV 78%

CORA: Consistency-Guided Semi-Supervised Framework for Reasoning Segmentation

CORA: 一致性引导的半监督框架用于推理分割

Prantik Howlader, Hoang Nguyen-Canh, Srijan Das, Jingyi Xu, Hieu Le, Dimitris Samaras

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CORA通过一致性引导的半监督方法实现高效推理分割,在Cityscapes和PanNuke数据集上分别提升2.3%和2.4%

Comments WACV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17584 2025-11-25 cs.LG cs.AI 76%

LLM-Powered Text-Attributed Graph Anomaly Detection via Retrieval-Augmented Reasoning

通过检索增强推理的大型语言模型驱动的文本属性图异常检测

Haoyan Xu, Ruizhi Qian, Zhengtao Yao, Ziyi Liu, Li Li, Yuqi Li, Yanshu Li, Wenqing Zheng, Daniele Rosa, Daniel Barcklow, Senthil Kumar, Jieyu Zhao, Yue Zhao

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出基于检索增强推理的LLM驱动文本属性图异常检测框架,通过生成语义连贯但上下文不一致的异常节点,提升异常检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18177 2025-11-25 cs.CL 74%

Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models

重新思考检索:从传统检索增强生成到金融领域大语言模型中的代理和非向量推理系统

Elias Lumer, Matt Melich, Olivia Zino, Elena Kim, Sara Dieter, Pradeep Honaganahalli Basavaraju, Vamse Kumar Subbiah, James A. Burke, Roberto Hernandez

机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出基于向量的代理RAG方法,在金融问答中优于非向量方法,通过交叉编码器重排序和小到大块检索显著提升检索精度和回答质量,但需权衡成本性能。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09711 2025-11-25 cs.CL cs.AI 73%

PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry

PsychiatryBench: 一个面向心理治疗的多任务基准测试

Aya E. Fouda, Abdelrahamn A. Hassan, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 PsychiatryBench通过权威教科书和病例书构建多任务基准,评估LLMs在心理治疗中的临床一致性与安全性,揭示模型在多轮随访等任务中的不足,推动专门调优和更严谨的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18298 2025-11-25 cs.AI 70%

Cross-Disciplinary Knowledge Retrieval and Synthesis: A Compound AI Architecture for Scientific Discovery

跨学科知识检索与综合:一种用于科学发现的复合AI架构

Svitlana Volkova, Peter Bautista, Avinash Hiriyanna, Gabriel Ganberg, Isabel Erickson, Zachary Klinefelter, Nick Abele, Hsien-Te Kao, Grant Engberson

机构 * Aptima, Inc.(Aptima公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 BioSage通过整合LLMs与RAG,利用专门代理实现跨学科知识检索与综合,提升科学发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20495 2025-11-25 cs.CL cs.AI cs.IR cs.LG cs.SE 67%

ReCode: Updating Code API Knowledge with Reinforcement Learning

ReCode: 通过强化学习更新代码API知识

Haoze Wu, Yunzhi Yao, Wenhao Yu, Ningyu Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReCode通过强化学习方法提升LLMs在动态API环境下的代码生成能力,尤其在CodeUpdateArena任务中表现优异。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19100 2025-11-25 cs.AI cs.FL cs.LG 62%

Extracting Robust Register Automata from Neural Networks over Data Sequences

从数据序列中的神经网络提取鲁棒的寄存器自动机

Chih-Duo Hong, Hongjian Jiang, Anthony W. Lin, Oliver Markgraf, Julian Parsert, Tony Tan

机构 * National Chengchi University(国立成功大学) University of Kaiserslautern-Landau(凯撒斯劳滕-劳恩堡大学) University of Liverpool(利物浦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种从神经网络中提取鲁棒寄存器自动机的方法,通过结合鲁棒性检查器与自动机学习算法,实现对神经网络的鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10727 2025-11-25 cs.CL cs.AI 62%

Word-level Annotation of GDPR Transparency Compliance in Privacy Policies using Large Language Models

基于大型语言模型的GDPR透明性合规性隐私政策词级注释

Thomas Cory, Wolf Rieder, Julia Krämer, Philip Raschke, Patrick Herbke, Axel Küpper

机构 * Erasmus University Rotterdam(埃因霍温大学)

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的隐私政策词级注释方法,用于评估GDPR透明性合规性,通过模块化管道和双层评估提升注释准确性。

Comments Accepted to Proceedings on Privacy Enhancing Technologies (PoPETs) 1 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14268 2025-11-25 cs.CL cs.AI cs.SI 62%

Can Large Language Models Detect Misinformation in Scientific News Reporting?

大型语言模型能否在科学新闻报道中检测虚假信息?

Yupeng Cao, Aishwarya Muralidharan Nair, Nastaran Jamalipour Soofi, Elyon Eyimife, K. P. Subbalakshmi

机构 * Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了使用大型语言模型检测科学新闻中虚假信息的可能性,并提出了SciNews数据集及多种基线架构进行验证。

详情

展开后加载摘要…

URL PDF HTML 收藏