EXAONE Deep: Reasoning Enhanced Language Models
EXAONE Deep:增强推理能力的语言模型
机构 * LG AI Research(LG人工智能研究)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 EXAONE Deep通过训练专用推理数据集,在数学和编码任务中展现出优于同类模型的能力,并提供大模型版本供研究使用。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
EXAONE Deep:增强推理能力的语言模型
机构 * LG AI Research(LG人工智能研究)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 EXAONE Deep通过训练专用推理数据集,在数学和编码任务中展现出优于同类模型的能力,并提供大模型版本供研究使用。
从黏土到代码:AI对伊朗鸽塔的类型学与物质性解读
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文研究AI对伊朗鸽塔的类型学与物质性解读,揭示AI在重建传统设计智能时的局限与创新。
Comments Proceedings of SIGraDi 2025: XXIX International Conference of the Ibero-American Society of Digital Graphics, Córdoba, Argentina, 2025
VisualQuest: 一个用于多模态大语言模型(MLLMs)抽象视觉推理的基准数据集
机构 * School of Computer Science and Technology, Dalian University of Technology, Dalian, China(大连理工大学计算机科学与技术学院) ; School of Foreign Languages, Dalian University of Technology, Dalian, China(大连理工大学外语学院) ; School of Computer Science and Technology, Xinjiang Normal University, Urumqi, China(新疆师范大学计算机科学与技术学院)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 VisualQuest通过风格化图像和针对性问题,评估多模态大语言模型在抽象视觉推理上的能力,发现Gemini和GPT-4o在不同任务上表现突出,揭示多模态理解的挑战。
基准成功,临床失败:当强化学习优化于基准,而非患者
机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) ; University of Bonn(波恩大学) ; Lamarr Institute(拉马尔研究所) ; Department of Health Queensland(昆士兰健康部) ; Griffith University(格里菲斯大学) ; University Hospital Bonn(波恩大学医院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ChexReason通过低资源强化学习在医学影像基准上表现优异,但其跨数据集迁移性下降,揭示了RL范式在临床应用中的局限性。
破解物联网安全:大语言模型能否超越静态分析工具?
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文评估大语言模型在物联网交互威胁检测中的性能,发现其在语义理解上有潜力,但在结构推理方面表现不佳,需结合符号分析提升可靠性。
基于规则的方法用于原子句子提取
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究通过分析复杂句子结构对基于规则的原子句子提取性能的影响,提出了依赖关系提取规则,并在WikiSplit数据集上实现了较高的提取准确率。
基于大型语言模型的代码漏洞检测方法实证评估:RAG、SFT和双智能体系统
机构 * Department of Electrical, Computer, and Software Engineering(电气、计算机与软件工程系) ; Ontario Tech University(安大略技术大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文通过实证评估,比较了RAG、SFT和双智能体系统在代码漏洞检测中的有效性,发现RAG在准确率和F1分数上表现最佳,SFT和双智能体系统也展示了良好的性能,证明了领域专业知识对LLM在实际漏洞检测中的重要性。
Journal ref https://conf.researchr.org/home/cascon-2025
Pat-DEVAL: 专利描述的法律思维链评估
机构 * Macquarie University(麦考瑞大学) ; Amazon(亚马逊公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 Pat-DEVAL通过法律约束的推理机制,首次提出评估专利描述的多维框架,显著提升法律合规性评估效果。
AutoTrust: 评估自动驾驶大视觉语言模型的可信度
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 AutoTrust研究自动驾驶大视觉语言模型的可信度问题,发现通用模型在可信度上优于专用模型,同时揭示DriveVLMs在隐私、安全和公平性方面的漏洞。
Comments Published at TMLR 2025
探讨在音频深度伪造检测中使用多模态大语言模型的可行性
机构 * Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校) ; Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组) ; Monash University, Melbourne, Australia(墨尔本大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文探讨了多模态大语言模型在音频深度伪造检测中的可行性,通过结合音频输入与多提示方法,展示了模型在域内数据上的良好表现及潜在应用价值。
Comments Accepted at IJCB 2025
S1-MMAlign: 一个大规模、跨学科的数据集用于科学图像-文本理解
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 S1-MMAlign是一个大规模跨学科数据集,通过语义增强提升科学图像与文本的对齐质量,推动AI在科学领域的应用。
Comments 12 pages, 5 figures. Dataset available at https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign
从元数据到意义:一个语义单元知识图谱用于生物多样性探索
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出语义单元以提升用户与知识图谱的互操作性,并展示如何利用大语言模型和嵌入模型构建结构化、FAIR元数据。
Comments Master's thesis