当前位置：首页 > 文章列表 > 科技周边 > 人工智能 > OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

来源：51CTO.COM 2023-05-13 11:37:00 0浏览收藏

热门推荐

漫画APP

漫画阅读推荐，热门漫画资源更好找

科技周边不知道大家是否熟悉？今天我将给大家介绍《OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开》，这篇文章主要会讲到等等知识点，如果你在看完本篇文章后，有更好的建议或者发现哪里有问题，希望大家都能积极评论指出，谢谢！希望我们能一起加油进步！

没想到，打开AI黑盒这件事，可能还要靠AI自己来实现了。

OpenAI的最新研究来了一波大胆尝试：

让GPT-4去解释GPT-2的行为模式。

结果显示，超过1000个神经元的解释得分在0.8以上——也就是说GPT-4能理解这些神经元。

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

要知道，“AI黑箱难题”长期以来是一个热议话题，尤其是大语言模型领域，人类对其内部工作原理的理解还非常有限，这种“不透明化”也进一步引发了人类对AI的诸多担忧。

目前推进AI可解释性研究的一个简单办法，就是逐个分析大模型中的神经元，手动检查以确定它们各自所代表的数据特征。

但对于规模已经达到百亿、千亿级别的大规模神经网络来说，工作量和工作难度就都涨了亿点点吧。

由此，OpenAI的研究人员想到，干嘛不让AI去自动化搞定这个大工程？

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

在这项最新的研究中，他们将GPT-4打造成了一个理解AI行为模式的工具，把GPT-2超过30万个神经单元都解释了一遍，并和实际情况比对进行评分。

最终生成的解释数据集和工具代码，已对外开源。

研究人员表示：未来，这种AI工具可能在改善LLM性能上发挥巨大作用，比如减少AI偏见和有害输出。

解释接近人类水平

具体来看，整个研究的步骤可以分为三步。

第一步，先给GPT-4一段文本，并展示GPT-2在理解这段文本时激活的神经元情况。

然后让GPT-4来解释，这段文本中神经元的激活情况。

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

比如示例中给出了一段漫威复联的文本，GPT-4分析的激活神经元为：

电影、角色和娱乐

第二步，让GPT-4开始模拟，这些被解释的神经元接下来会做什么。

GPT-4给出了一段内容。

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

第三步，让GPT-2真实的神经元激活来生成结果，然后和GPT-4模拟的结果进行比对，研究人员会对此打分。

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

在博客给出的示例中，GPT-4的得分为0.34.

使用这个办法，研究人员让GPT-4解释了GPT-2一共307200个神经元。

OpenAI表示，使用这一基准，AI解释的分数能接近人类水平。

从总体结果来看，GPT-4在少数情况下的解释得分很高，在0.8分以上。

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

他们还发现，不同层神经元被激活的情况，更高层的会更抽象。

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

此外，团队还总结了如下几点结论：

如果让GPT-4重复解释，它的得分能更高
如果使用更强大的模型来解释，得分也会上升
用不同的激活函数训练模型，能提高解释分数

总结来看就是，虽然GPT-4目前的表现一般，但是这个方法和思路的提升空间还有很大。

团队也强调，现在在GPT-2上的表现都不太好，如果换成更大、更复杂的模型，表现也会比较堪忧。

同时这种模式也能适用于联网的LLM，研究人员认为可以通过简单调整，来弄清楚神经元如何决策搜索内容和访问的网站。

此外他们还表示，在创建这个解释系统时并没有考虑商业化问题，理论上除了GPT-4，其他LLM也能实现类似效果。

接下来，他们打算解决研究中的这几个问题：

AI神经元行为十分复杂，但GPT-4给的解释非常简单，所以有些复杂行为还无法解释；
希望最终自动找到并解释复杂的整个神经回路，神经元和注意力头一起工作；
目前只解释了神经元的行为，但没解释行为背后的机制；
整个过程算力消耗巨大。

网友：快进到AI创造AI

意料之中，这项研究马上在网络上引发热议。

大家的脑洞画风be like：“AI教人类理解AI。”

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

“AI教人类关掉AI中存在风险的神经元。”

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

还有人开始畅想，AI理解AI会快速发展为AI训练AI（已经开始了），然后再过不久就是AI创造新的AI了。

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

当然这也引发了不少担忧，毕竟GPT-4本身不还是个黑盒嘛。

人类拿着自己不理解的东西，让它解释另一个自己不理解的东西，这个风险emm……

OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开

这项研究由OpenAI负责对齐的团队提出。

他们表示，这部分工作是他们对齐研究的第三大支柱的一部分：

我们想要实现自动化对齐。一种值得思考的方面是，随着AI的进步，这种想法可能会得到进一步的扩展。随着AI模型不断提升智能水平，我们也能够找到更好的方式来解释AI。

论文地址：
https://openaipublic.blob.core.windows.net/neuron-explainer/paper/index.html

参考链接：
[1]https://openai.com/research/language-models-can-explain-neurons-in-language-models
[2]https://www.globalvillagespace.com/tech/openais-tool-explains-language-model-behavior/

今天关于《OpenAI震撼研究：用GPT-4解释30万神经元，原来AI的黑盒要AI自己去打开》的内容就介绍到这里了，是不是学起来一目了然！想要了解更多关于GPT-4,AI,模型的内容请关注golang学习网公众号！

GPT-4 模型

版本声明

本文转载于：51CTO.COM 如有侵犯，请联系study_golang@163.com删除

手机也能运行：谷歌发布 PaLM 2 人工智能语言模型，Bard 聊天机器人大改进

手机也能运行：谷歌发布 PaLM 2 人工智能语言模型，Bard 聊天机器人大改进

上一篇: 手机也能运行：谷歌发布 PaLM 2 人工智能语言模型，Bard 聊天机器人大改进

mysql字段类型如何修改

下一篇: mysql字段类型如何修改

查看更多

最新文章

科技周边 · 人工智能 | 1星期前 | AI绘画

AI绘画工具安装与配置教程

339浏览收藏
科技周边 · 人工智能 | 1星期前 |

海螺AI语音功能测评与体验分享

260浏览收藏
科技周边 · 人工智能 | 1星期前 |

ChatGPT读不了加密PDF？先解密再上传

438浏览收藏
科技周边 · 人工智能 | 1星期前 |

千问AI测试规范与覆盖率提升技巧

152浏览收藏
科技周边 · 人工智能 | 1星期前 |

MiniMaxMusic2.0专业模式上线：音乐创作新神器

232浏览收藏
科技周边 · 人工智能 | 1星期前 |

即梦AI音乐可视化效果评测

280浏览收藏
科技周边 · 人工智能 | 1星期前 | 豆包AI 豆包AI助手

豆包AI写诗技巧与教程分享

152浏览收藏
科技周边 · 人工智能 | 1星期前 | openclaw

OpenClawAI摘要生成技巧全解析

102浏览收藏
科技周边 · 人工智能 | 1星期前 |

百度发布DuMate智能体，李彦宏解读DAA新定义

247浏览收藏
科技周边 · 人工智能 | 1星期前 |

智谱清影制作鸟瞰街景镜头教程

306浏览收藏
科技周边 · 人工智能 | 1星期前 | openclaw

OpenClaw框架解析与技术亮点揭秘

357浏览收藏
科技周边 · 人工智能 | 1星期前 |

即梦AI美妆详情页提示词技巧

334浏览收藏

查看更多

课程推荐

前端进阶之JavaScript设计模式

设计模式是开发人员在软件开发过程中面临一般问题时的解决方案，代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景，打造一站式知识长龙服务，适合有JS基础的同学学习。

543次学习
GO语言核心编程课程

本课程采用真实案例，全面具体可落地，从理论到实践，一步一步将GO核心编程技术、编程思想、底层实现融会贯通，使学习者贴近时代脉搏，做IT互联网时代的弄潮儿。

516次学习
简单聊聊mysql8与网络通信

如有问题加微信：Le-studyg；在课程中，我们将首先介绍MySQL8的新特性，包括性能优化、安全增强、新数据类型等，帮助学生快速熟悉MySQL8的最新功能。接着，我们将深入解析MySQL的网络通信机制，包括协议、连接管理、数据传输等，让

500次学习
JavaScript正则表达式基础与实战

在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。

487次学习
从零制作响应式网站—Grid布局

本系列教程将展示从零制作一个假想的网络科技公司官网，分为导航，轮播，关于我们，成功案例，服务流程，团队介绍，数据部分，公司动态，底部信息等内容区块。网站整体采用CSSGrid布局，支持响应式，有流畅过渡和展现动画。

485次学习

查看更多

AI推荐

ChatExcel酷表

ChatExcel酷表是由北京大学团队打造的Excel聊天机器人，用自然语言操控表格，简化数据处理，告别繁琐操作，提升工作效率！适用于学生、上班族及政府人员。

7870次使用
Any绘本

探索Any绘本（anypicturebook.com/zh），一款开源免费的AI绘本创作工具，基于Google Gemini与Flux AI模型，让您轻松创作个性化绘本。适用于家庭、教育、创作等多种场景，零门槛，高自由度，技术透明，本地可控。

8293次使用
可赞AI

可赞AI，AI驱动的办公可视化智能工具，助您轻松实现文本与可视化元素高效转化。无论是智能文档生成、多格式文本解析，还是一键生成专业图表、脑图、知识卡片，可赞AI都能让信息处理更清晰高效。覆盖数据汇报、会议纪要、内容营销等全场景，大幅提升办公效率，降低专业门槛，是您提升工作效率的得力助手。

8104次使用
星月写作

星月写作是国内首款聚焦中文网络小说创作的AI辅助工具，解决网文作者从构思到变现的全流程痛点。AI扫榜、专属模板、全链路适配，助力新人快速上手，资深作者效率倍增。

10033次使用
MagicLight

MagicLight.ai是全球首款叙事驱动型AI动画视频创作平台，专注于解决从故事想法到完整动画的全流程痛点。它通过自研AI模型，保障角色、风格、场景高度一致性，让零动画经验者也能高效产出专业级叙事内容。广泛适用于独立创作者、动画工作室、教育机构及企业营销，助您轻松实现创意落地与商业化。

8871次使用

查看更多

相关文章

GPT-4王者加冕！读图做题性能炸天，凭自己就能考上斯坦福

2023-04-25 501浏览
单块V100训练模型提速72倍！尤洋团队新成果获AAAI 2023杰出论文奖

2023-04-24 501浏览
ChatGPT 真的会接管世界吗？

2023-04-13 501浏览
VR的终极形态是「假眼」？Neuralink前联合创始人掏出新产品：科学之眼！

2023-04-30 501浏览
实现实时制造可视性优势有哪些？

2023-04-15 501浏览

Golang学习网：公益在线Go学习平台，帮助Go学习者快速成长！

技术交流群

Copyright 2023 http://www.17golang.com/ All Rights Reserved ｜苏ICP备2023003363号-1

关注公众号

Golang学习网

微信登录更方便

密码登录
注册账号

登录即同意用户协议和隐私政策

返回登录

重置密码