当前位置:首页 > 文章列表 > 科技周边 > 人工智能 > 推理性能直逼o1,DeepSeek再次出手,重点:即将开源

推理性能直逼o1,DeepSeek再次出手,重点:即将开源

来源:机器之心 2024-11-26 12:33:34 0浏览 收藏

本篇文章向大家介绍《推理性能直逼o1,DeepSeek再次出手,重点:即将开源》,主要包括,具有一定的参考价值,需要的朋友可以参考一下。

DeepSeek 又出手了,这次又是重磅炸弹。

昨晚,DeepSeek 上线了全新的推理模型 DeepSeek-R1-Lite-Preview ,直接冲击 OpenAI o1 保持了两个多月的大模型霸主地位。

在美国数学竞赛(AMC)中难度等级最高的 AIME 以及全球顶级编程竞赛(codeforces)等权威评测中,DeepSeek-R1-Lite-Preview 模型已经大幅超越了 GPT-4o 等顶尖模型,有三项成绩还领先于 OpenAI o1-preview
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
背后的秘诀,就是「深度思考」。

更多的强化学习、原生的思维链、更长的推理时间,能让大模型的性能更强,这在领域内已经是广泛共识。这种模式其实非常像人类大脑的深度思考。

与 OpenAI o1 有点不一样的是,DeepSeek-R1-Lite-Preview 会在回复中展示「思路链」推理,也就是响应查询和输入的不同链或「思路」,并解释它在做什么以及为什么这样做。

就像是解题时,有人喜欢将每一步骤都详尽地写在卷子上,而 DeepSeek-R1-Lite-Preview 更进一步:把内心 OS 也都写出来了。

DeepSeek 官方表示,DeepSeek R1 系列模型使用强化学习训练,推理过程包含大量反思和验证,思维链长度可达数万字。已经发布的 DeepSeek-R1-Lite-Preview 使用的是一个较小的基座模型,尚未完全释放长思维链的潜力。
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
对于用户的 Prompt,DeepSeek-R1-Lite-Preview 会有一个很长的推理过程。如上图中的红色实线所示,模型所能达到的准确率与所给定的推理长度呈正相关。且相比于传统的多次采样 + 投票(Majority Voting),模型思维链长度增加展现出了更高的效率。

最惊艳的是,发布即上线:所有用户均可通过官网开启与 DeepSeek-R1-Lite-Preview 的对话,但注意要先在输入框中打开「深度思考」模式,每天限制 50 次使用
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
体验地址:http://chat.deepseek.com/

不得不说,对 o1 直接发起冲击的 DeepSeek,着实让国内 AI 社区振奋了一把:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
                                 图源:https://www.zhihu.com/question/4689435060/answer/36575793425

由于 DeepSeek-R1-Lite-Preview 目前仅支持网页使用,没有发布完整代码供独立第三方分析或基准测试,也没有通过 API 提供 DeepSeek-R1-Lite-Preview 以进行同类独立测试,也没有解释 DeepSeek-R1-Lite-Preview 是如何训练或构建的博客文章或技术论文,大家心中其实还有许多的「问号」。

但 DeepSeek 已经表示,正式版 DeepSeek-R1 模型会完全开源,还会公开技术报告,部署 API 服务
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
                                图源:https://www.zhihu.com/question/4689435060/answer/36604051127

回想起上一次,DeepSeek-V2 的开源和 API 降价,直接引发了国产大模型厂商的降价浪潮。同样的力度再来一波,不知道大家如何顶住。

耐心等待的时间里,我们先来实测一下。

一手实测体验

与 OpenAI o1 相同的是,根据问题的复杂程度,它也需要「思考」数十秒后再回答。

虽然有些过程中的思路在人类看来可能毫无意义,甚至是错误的,但据初步测评,DeepSeek-R1-Lite-Preview 回复的最终整体准确率还是比较高的。

比如它可以回答 GPT-4o 和 Claude 系列都翻车过的问题 —— 经典陷阱题「Strawberry 这个词中有多少个字母 R?」和「9.11 和 9.9 哪个更大?」。

有用户在 DeepSeek Chat 上使用这些 Prompt 进行测试,回复结果和思考用时情况如下:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
                         Strawberry 这个词中有多少个字母 R?用时 29 秒。
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
                              9.11 和 9.9 哪个更大?用时 9 秒。

不过在数草莓的问题上,R1-Lite-Preview 有时也会困惑,数出「只有 2 个 r」的答案:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
本站也实测了一把,似乎对于中文,R1-Lite-Preview 的准确率更高:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
对于需要动脑的问题,R1-Lite-Preview 的表现也可圈可点,比如它可以破解行测题的逻辑陷阱:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
由 LeCun 提出的物理题:圆周上均匀分布了 7 根轴,每根轴上都有一个齿轮。每个齿轮都与其左边和右边的齿轮啮合。齿轮从 1 到 7 编号,依次沿圆周排列。问题是:如果齿轮 3 顺时针旋转,问齿轮 7 会沿什么方向旋转?
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
得出解来十分丝滑:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
接下来,给 R1-Lite-Preview 上点强度,看看它能否笑对大学物理的噩梦:《电磁学千题解》。
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
在 34 秒内,它根据题意列出了对应的公式,得到了正确答案:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
至于 R1-Lite-Preview 被全球顶级编程竞赛(codeforces)等权威评测检验过的代码能力,让它手撕大厂秋招级别的 Leetcode 经典题「岛屿问题」试一下:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
运行起来也没大问题。

然而,相比推理、物理和编程,R1-Lite-Preview 的数学能力可能没那么让人放心。

比如科技博主 @Transformer - 周问了一道中学水平的数列题,只有 o1 和 o1mini 做对了,R1-Lite-Preview 没想出关键的破题思路,而是「蒙」出了答案。
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
而对于最能考验人类大脑的深度思考能力的 IMO 国际数学奥林匹克竞赛试题,R1-Lite-Preview 的表现是这样的:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
这道代数题相当难,全球仅有 5 个人全对。在长达 162 秒的思考过程中,R1-Lite-Preview 洋洋洒洒地把解题思路写成了一篇小论文,可能它的老师也教过 —— 把解题过程写上能得一半分。
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
令人遗憾的是,最终答案 c=1 是错的,正确答案如下:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
而另一位「解题过程没写全」的选手 OpenAI o1 却给出了正确答案:
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
这说明,DeepSeek-R1-Lite-Preview 仍有进步空间,也更让我们期待完整版模型的发布了。

各位读者已经试用了吗?欢迎在评论区分享有趣的实测案例。

参考链接:
https://mp.weixin.qq.com/s/e1YnTxZlzFvjcmrLLTA8fw
https://venturebeat.com/ai/deepseeks-first-reasoning-model-r1-lite-preview-turns-heads-beating-openai-o1-performance/

今天带大家了解了的相关知识,希望对你有所帮助;关于科技周边的技术知识我们会一点点深入介绍,欢迎大家关注golang学习网公众号,一起学习编程~

版本声明
本文转载于:机器之心 如有侵犯,请联系study_golang@163.com删除
小米双 11 战报:Redmi K70 至尊版拿下安卓手机销冠,智能手环突破 130 万件小米双 11 战报:Redmi K70 至尊版拿下安卓手机销冠,智能手环突破 130 万件
上一篇
小米双 11 战报:Redmi K70 至尊版拿下安卓手机销冠,智能手环突破 130 万件
NumPy 中的 unique 函数为什么自动排序?
下一篇
NumPy 中的 unique 函数为什么自动排序?
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    542次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    508次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    497次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    484次学习
查看更多
AI推荐
  • 茅茅虫AIGC检测:精准识别AI生成内容,保障学术诚信
    茅茅虫AIGC检测
    茅茅虫AIGC检测,湖南茅茅虫科技有限公司倾力打造,运用NLP技术精准识别AI生成文本,提供论文、专著等学术文本的AIGC检测服务。支持多种格式,生成可视化报告,保障您的学术诚信和内容质量。
    96次使用
  • 赛林匹克平台:科技赛事聚合,赋能AI、算力、量子计算创新
    赛林匹克平台(Challympics)
    探索赛林匹克平台Challympics,一个聚焦人工智能、算力算法、量子计算等前沿技术的赛事聚合平台。连接产学研用,助力科技创新与产业升级。
    102次使用
  • SEO  笔格AIPPT:AI智能PPT制作,免费生成,高效演示
    笔格AIPPT
    SEO 笔格AIPPT是135编辑器推出的AI智能PPT制作平台,依托DeepSeek大模型,实现智能大纲生成、一键PPT生成、AI文字优化、图像生成等功能。免费试用,提升PPT制作效率,适用于商务演示、教育培训等多种场景。
    108次使用
  • 稿定PPT:在线AI演示设计,高效PPT制作工具
    稿定PPT
    告别PPT制作难题!稿定PPT提供海量模板、AI智能生成、在线协作,助您轻松制作专业演示文稿。职场办公、教育学习、企业服务全覆盖,降本增效,释放创意!
    102次使用
  • Suno苏诺中文版:AI音乐创作平台,人人都是音乐家
    Suno苏诺中文版
    探索Suno苏诺中文版,一款颠覆传统音乐创作的AI平台。无需专业技能,轻松创作个性化音乐。智能词曲生成、风格迁移、海量音效,释放您的音乐灵感!
    102次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码