Neste tutorial, construímos um pipeline completo para análise de sequenciamento de RNA de célula única usando o Scanpy. Começamos instalando as bibliotecas necessárias e carregando o conjunto de dados PBMC 3k, depois realizamos controle de qualidade, filtragem e normalização para preparar os dados para análise posterior. Em seguida, identificamos genes altamente variáveis, realizamos PCA para redução de dimensionalidade e construímos um grafo de vizinhança para gerar embeddings UMAP e clusters Leiden. Através da descoberta e visualização de genes marcadores, exploramos como os clusters correspondem às populações de células biológicas e implementamos uma estratégia de anotação baseada em regras simples para inferir tipos de células. Copiar Código Copiado Usar um navegador diferente import sys import subprocess import importlib def pip_install(*packages): subprocess.check_call([sys.executable, "-m", "pip", "install", "-q", *packages]) required = [ "scanpy", "anndata", "leidenalg", "igraph", "harmonypy", "seaborn" ] pip_install(*required) import os import warnings warnings.filterwarnings("ignore") import numpy as np import pandas as pd import matplotlib.pyplot as plt import scanpy as sc import anndata as ad sc.settings.verbosity = 2 sc.settings.set_figure_params(dpi=110, facecolor="white", frameon=False) np.random.seed(42) print("Versão do Scanpy:", sc.__version__) adata = sc.datasets.pbmc3k() adata.var_names_make_unique() print("
AnnData Inicial:") print(adata) adata.layers["counts"] = adata.X.copy() adata.var["mt"] = adata.var_names.str.upper().str.startswith("MT-") sc.pp.calculate_qc_metrics(adata, qc_vars=["mt"], percent_top=None, log1p=False, inplace=True) print("
Resumo do CQ:") display( adata.obs[["n_genes_by_counts", "total_counts", "pct_counts_mt"]].describe().T ) Instalamos todas as dependências necessárias e importamos as principais bibliotecas de computação científica necessárias para a análise. Configuramos as configurações do Scanpy, inicializamos o ambiente e carregamos o conjunto de dados de sequenciamento de RNA de célula única PBMC 3k. Em seguida, calculamos métricas de controle de qualidade, incluindo porcentagem de genes mitocondriais, contagens totais e o número de genes detectados, para cada célula. Copiar Código Copiado Usar um navegador diferente fig, axs = plt.subplots(1, 3, figsize=(15, 4)) sc.pl.violin(adata, ["n_genes_by_counts"], jitter=0.4, ax=axs[0], show=False) sc.pl.violin(adata, ["total_counts"], jitter=0.4, ax=axs[1], show=False) sc.pl.violin(adata, ["pct_counts_mt"], jitter=0.4, ax=axs[2], show=False) plt.tight_layout() plt.show() sc.pl.scatter(adata, x="total_counts", y="n_genes
Fonte: MarkTechPost
Publicado em 2026-03-09