当前位置：首页 > 文章列表 > 科技周边 > 人工智能 > 识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源

识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源

来源：51CTO.COM 2024-05-16 14:15:15 0浏览收藏

学习科技周边要努力，但是不要急！今天的这篇文章《识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源》将会介绍到等等知识点，如果你想深入学习科技周边，可以关注我！我会持续更新相关文章的，希望对大家都能有所帮助！

大模型带来的生命科学领域突破，刚刚再传新进展。

来自清华系，使用大模型实现了单细胞身份识别，同时模型LangCell也正式对外开源。

它不仅可以准确识别细胞身份，还具有很强的零样本分析能力，论文已被ICML 2024录⽤。

识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源

LangCell的数据集中包含2750万条数据，涵盖了细胞类型、发育阶段、组织器官、疾病筛选等8个维度的信息，称得上是“细胞的百科全书”。

实际测试中，LangCell也在多个细胞识别任务上超越了前SOTA，在研究人员专门设计的新任务上也表现突出。

然而，在不使用文本信息的情况下，单独使用其包含的细胞编码器模块，也能在各个任务上实现最优表现。

出品团队：清华系创业公司⽔⽊分⼦与清华⼤学AIR聂再清教授团队。

大模型，细胞识别的“新武器”

细胞，是探索⽣命奥秘的起点，细胞⾝份的识别，是⽣物科学领域的⼀⼤热点。

这不仅关于细胞的“户”调查，还关系到它们在组织中的“社交关系”，以及它们对“物信号”和“环境变化”的敏感反应，详细分析单细胞测序数据。

但单细胞测序数据分析，就像是⼀场科学界的“寻宝游戏”，可能需要⼀个⼏⼈到⼏⼗⼈不等的跨学科的团队，用⼏周到⼏个⽉，甚⾄更⻓时间来完成。

现在，LangCell模型成为了细胞⾝份识别的“新武器”。

LangCell是⾸个结合单细胞RNA测序数据与⾃然语⾔处理进⾏预训练的单细胞表征模型，不仅提⾼了识别的准确性，还减少了对⼤量标记数据的依赖。

传统的单细胞RNA测序数据分析，就像是在没有地图的情况下寻找宝藏，虽然能找到⼀些线索，但总有些⼒不从⼼。

⽽LangCell模型，通过构建单细胞数据和⾃然语⾔的统⼀表⽰，就像是给了模型⼀张“藏宝图”，让它能够更直接地找到与细胞⾝份相关的信息。

具体来说，LangCell主要由细胞编码器（Cell Encoder，CE）和文本编码器两部分组成。

其中细胞编码器使用预训练的Geneformer初始化。将排序后的基因表达序列输入转化为嵌入向量序列，在序列开始处添加[CLS]标记，其嵌入向量经过线性变换作为整个细胞的表征向量。

文本编码器又有单模态和多模态两种编码模式。

单模态时相当于一个BERT模型,用于将文本转换为嵌入向量；

多模态时在self-attention后添加cross-attention模块，融合细胞嵌入向量计算联合表征，并通过线性层预测细胞-文本匹配概率。

识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源

为训练LangCell，研究⼈员还构建了⼀个名为scLibrary的数据集，它包含了2750万条scRNA-seq数据及从OBO Foundry中获取的细胞⾝份的多视⻆⽂本描述，就像是细胞研究的“百科全书”。

这个数据集不仅包含了⼤量的原始数据，还包含了多视⻆的细胞⾝份⽂本描述，为模型提供了丰富的学习材料。

此外在零样本场景中，只需未知类型细胞的scRNA-seq数据输入到CE中，得到细胞嵌入向量表征，然后与候选类型的文本嵌入向量进行相似度计算，分数最高的类型即被预测为该未知细胞的类型。

识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源

结果，LangCell模型在零样本细胞⾝份理解场景中表现出⾊，即使没有进⾏微调，也能直接对新的细胞类型进⾏注释。

在PBMC数据集上，零样本的LangCell分类准确率就已达到86.5%，F1评分更是超过了前SOTA模型的9-shot表现。

识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源

在更具挑战的跨数据集的细胞-文本检索任务中，LangCell的零样本召回率R@1、R@5和R@10结果都超过了用30%标注数据训练的BioTranslator模型。

识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源

此外，研究者还专门构建了“非小细胞肺癌亚型分类”和“细胞通路识别”两个具有重要生物学意义的新基准测试任务。

结果在非小细胞肺癌亚型分类任务中，LangCell的零样本分类准确率和F1分数分别达到93.5%和93.2%，比10-shot的Geneformer高出约20%。

而对于细胞批次整合任务，在PBMC10K和Perirhinal Cortex两个数据集上，LangCell的Avgbio、ASWbatch和Sfinal三个指标均达到了最优。

识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源

不仅LangCell的表现优异，即使在不使用文本信息的情况下，单独的CE模块也能在各个任务上实现最优表现。

在多个细胞类型注释任务的数据集上，CE模块的成绩都超过了前SOTA，在细胞通路识别上的表现也十分优异。

识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源

作者介绍，LangCell的这些能力，在新疾病或细胞亚型的研究中尤为重要，可以减少对⼤量标记数据的依赖，加速疾病机理的发现。

团队简介

⽔⽊分⼦由清华⼤学智能产业研究院（AIR）孵化，重点研究方向是⽣物医药⾏业基础⼤模型及新⼀代对话式⽣物医药研发助⼿。

水木分子和清华大学还有两项与北大和南大共同研发的成果一同入选了ICML 2024，分别在小分子3D表示学习和大分子蛋白质表示学习方面取得进展。

GitHub：https://github.com/PharMolix/OpenBioMed

论文地址https://arxiv.org/abs/2405.06708

本篇关于《识别细胞也能用大模型了！清华系团队出品，已入选ICML 2024 | 开源》的介绍就到此结束啦，但是学无止境，想要了解学习更多关于科技周边的相关知识，请关注golang学习网公众号！

AI 数据

版本声明

本文转载于：51CTO.COM 如有侵犯，请联系study_golang@163.com删除

如何在 Golang 单元测试中使用集成测试框架？

如何在 Golang 单元测试中使用集成测试框架？

上一篇: 如何在 Golang 单元测试中使用集成测试框架？

李飞飞揭秘创业方向“空间智能”：视觉化为洞察，看见成为理解，理解导致行动

下一篇: 李飞飞揭秘创业方向“空间智能”：视觉化为洞察，看见成为理解，理解导致行动

查看更多

最新文章

科技周边 · 人工智能 | 3天前 | 人工智能 · GenAI · opentelemetry · 可观测性 · AI工程 · 人工智能链路追踪 GenAI OpenTelemetry AI可观测性 LLM网关 Token统计

AI 调用可观测架构：从散乱日志到 OpenTelemetry GenAI 字段统一

427浏览收藏
科技周边 · 人工智能 | 3天前 | Node.js · 人工智能 · deepseek · AI工具 · Node.js 人工智能命令行工具流式输出 AI摘要 DeepSeek API

用 DeepSeek API 从零写一个流式摘要小工具：Node.js 命令行版

154浏览收藏
科技周边 · 人工智能 | 4天前 | JSON · 人工智能 · 结构化输出 · 接口排查 · JSON Schema AI结构化输出解析失败 LLM接口提示词排查

AI 结构化输出解析失败怎么办：从提示词到 JSON Schema 逐步定位

309浏览收藏
科技周边 · 人工智能 | 5天前 | 人工智能 · webgpu · 浏览器API · 本地推理 · 前端AI · AI推理 WebGPU 降级方案前端性能浏览器端AI 本地推理

WebGPU 做浏览器端 AI 推理：能力边界、检测和降级方案

234浏览收藏
科技周边 · 人工智能 | 6天前 | 人工智能 · 前端流式输出 · AI聊天 · Fetch Stream · 前端 AI聊天流式输出 ReadableStream TextDecoder Fetch Stream

AI 聊天流式输出前端配方：用 Fetch Stream 实现逐字渲染和中断控制

448浏览收藏
科技周边 · 人工智能 | 1星期前 | 人工智能 · rag · 向量数据库 · 检索增强生成 · 人工智能 AI应用 RAG embedding 向量检索

RAG 答非所问怎么排查：从切块、向量到召回上下文

427浏览收藏
科技周边 · 人工智能 | 2星期前 | 人工智能 · rag · 向量检索 · 知识库问答 · AI工程化 · 人工智能知识库 RAG 重排向量检索文档切分证据引用

AI 知识库检索召回工作流：从文档切分到重排和证据引用

191浏览收藏
科技周边 · 人工智能 | 2星期前 | JSON · 人工智能 · 结构化输出 · 大模型接口 · 后端接入 · 人工智能 JSON AI接口 Schema 结构化输出

AI 接口 JSON 返回不稳定排查：从提示词到结构化输出

299浏览收藏
科技周边 · 人工智能 | 2星期前 | 人工智能 · mcp · ai agent · 工具接入 · 安全审计 · AI Agent MCP Model Context Protocol 工具清单资源上下文权限审计

MCP 服务接入工作流：从工具清单到权限审计的 AI Agent 落地路线

378浏览收藏
科技周边 · 人工智能 | 2星期前 | 人工智能 · ai agent · 工具调用 · 结构化输出 · 工程排查 · AI Agent Schema 结构化输出超时重试工具调用兜底回答

AI Agent 工具调用失败排查：从 Schema 到超时兜底的完整工作流

195浏览收藏
科技周边 · 人工智能 | 2星期前 | 人工智能 · rag · 知识库检索 · RAG 向量检索 AI知识库混合召回结果重排

AI 知识库检索不到答案排查：从分块到重排的 RAG 修复流程

453浏览收藏
科技周边 · 人工智能 | 2星期前 | 人工智能 · AI工程 · 成本控制 · 人工智能成本控制 AI接口 token预算 Batch API

AI 批量调用成本控制：从请求日志到预算阈值的完整工作流

202浏览收藏

查看更多

课程推荐

前端进阶之JavaScript设计模式

设计模式是开发人员在软件开发过程中面临一般问题时的解决方案，代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景，打造一站式知识长龙服务，适合有JS基础的同学学习。

543次学习
GO语言核心编程课程

本课程采用真实案例，全面具体可落地，从理论到实践，一步一步将GO核心编程技术、编程思想、底层实现融会贯通，使学习者贴近时代脉搏，做IT互联网时代的弄潮儿。

516次学习
简单聊聊mysql8与网络通信

如有问题加微信：Le-studyg；在课程中，我们将首先介绍MySQL8的新特性，包括性能优化、安全增强、新数据类型等，帮助学生快速熟悉MySQL8的最新功能。接着，我们将深入解析MySQL的网络通信机制，包括协议、连接管理、数据传输等，让

500次学习
JavaScript正则表达式基础与实战

在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。

487次学习
从零制作响应式网站—Grid布局

本系列教程将展示从零制作一个假想的网络科技公司官网，分为导航，轮播，关于我们，成功案例，服务流程，团队介绍，数据部分，公司动态，底部信息等内容区块。网站整体采用CSSGrid布局，支持响应式，有流畅过渡和展现动画。

485次学习

查看更多

AI推荐

ljg-skills

ljg-skills 是李继刚开源的 AI 技能与提示词集合，面向大模型使用者整理了一批可复用的 prompt、角色设定和任务技能模板，适合用于学习提示词设计、搭建个人 AI 工作流和沉淀团队常用智能体能力。

3827次使用
MELO音乐

MELO音乐是一站式AI视频与音乐制作助手，对标suno, udio的高品质体验。提供伴奏生成、原创写词、无损导出、哼唱识曲、混音变声等全套音频与短视频编辑工具。无论是流行Kpop、电音说唱、民谣古风、摇滚儿歌还是商用轻音乐，MELO为你免费谱曲，轻松做同款！

3530次使用
UniScribe

UniScribe 是一款 AI 音视频转文字与内容整理工具，支持上传音频、视频文件或粘贴 YouTube 链接，自动生成转写文本、摘要、思维导图和关键问题，并支持多格式导出，适合会议记录、课程学习、访谈整理和内容创作复盘。

3513次使用
剧云

剧云是专业中文剧本创作平台，安全稳定运行十余年，集成AI编剧、剧本医生审核、人物小传、剧情关系图、大纲编写、多人协作、Word导入导出、版权管控功能，数据安全防护，轻松高效创作剧本。

3701次使用
万象有声

万象有声，一个专为有声创作者打造的新一代智能有声内容创作平台。平台提供专业的智能拆章、智能画本编辑、AI配音、AI生成音效、后期制作、智能对轨、智能审听等有声创作全流程工具，可以帮助创作者高效、低成本创作出引人入胜的有声作品。立即体验，让有声书制作更简单！

3663次使用

查看更多

相关文章

AI写作工具免费版安装教程（含豆包Clawdbot）

2026-05-30 501浏览
WPS AI能自动生成PPT吗？输入主题一键制作演示文稿

2026-05-27 501浏览
Canva手机闪退解决方法及适配指南

2026-05-25 501浏览
Hermes Agent依赖的工具链有哪些必备工具链介绍

2026-05-05 501浏览
千问AI官网地址链接入口_千问AI官方网站登陆入口

2026-05-05 501浏览

Golang学习网：公益在线Go学习平台，帮助Go学习者快速成长！

技术交流群

Copyright 2023 http://www.17golang.com/ All Rights Reserved ｜苏ICP备2023003363号-1

关注公众号

Golang学习网

微信登录更方便

密码登录
注册账号

登录即同意用户协议和隐私政策

返回登录

重置密码