Um Guia de Codificação para Construir um Pipeline Completo de Análise de Sequenciamento de RNA de C…

Neste tutorial, construímos um pipeline completo para análise de sequenciamento de RNA de célula única usando o Scanpy. Começamos instalando as bibliotecas necessárias e carregando o conjunto de dados PBMC 3k, depois realizamos controle de qualidade, filtragem e normalização para preparar os dados para análise posterior. Em seguida, identificamos genes altamente variáveis, realizamos PCA para redução de dimensionalidade e construímos um grafo de vizinhança para gerar embeddings UMAP e clusters Leiden. Através da descoberta e visualização de genes marcadores, exploramos como os clusters correspondem às populações de células biológicas e implementamos uma estratégia de anotação baseada em regras simples para inferir tipos de células. Copiar Código Copiado Usar um navegador diferente import sys import subprocess import importlib def pip_install(*packages): subprocess.check_call([sys.executable, "-m", "pip", "install", "-q", *packages]) required = [ "scanpy", "anndata", "leidenalg", "igraph", "harmonypy", "seaborn" ] pip_install(*required) import os import warnings warnings.filterwarnings("ignore") import numpy as np import pandas as pd import matplotlib.pyplot as plt import scanpy as sc import anndata as ad sc.settings.verbosity = 2 sc.settings.set_figure_params(dpi=110, facecolor="white", frameon=False) np.random.seed(42) print("Versão do Scanpy:", sc.__version__) adata = sc.datasets.pbmc3k() adata.var_names_make_unique() print("

AnnData Inicial:") print(adata) adata.layers["counts"] = adata.X.copy() adata.var["mt"] = adata.var_names.str.upper().str.startswith("MT-") sc.pp.calculate_qc_metrics(adata, qc_vars=["mt"], percent_top=None, log1p=False, inplace=True) print("

Resumo do CQ:") display( adata.obs[["n_genes_by_counts", "total_counts", "pct_counts_mt"]].describe().T ) Instalamos todas as dependências necessárias e importamos as principais bibliotecas de computação científica necessárias para a análise. Configuramos as configurações do Scanpy, inicializamos o ambiente e carregamos o conjunto de dados de sequenciamento de RNA de célula única PBMC 3k. Em seguida, calculamos métricas de controle de qualidade, incluindo porcentagem de genes mitocondriais, contagens totais e o número de genes detectados, para cada célula. Copiar Código Copiado Usar um navegador diferente fig, axs = plt.subplots(1, 3, figsize=(15, 4)) sc.pl.violin(adata, ["n_genes_by_counts"], jitter=0.4, ax=axs[0], show=False) sc.pl.violin(adata, ["total_counts"], jitter=0.4, ax=axs[1], show=False) sc.pl.violin(adata, ["pct_counts_mt"], jitter=0.4, ax=axs[2], show=False) plt.tight_layout() plt.show() sc.pl.scatter(adata, x="total_counts", y="n_genes

Fonte: MarkTechPost

Publicado em 2026-03-09

Notícias relacionadas

Continue explorando