Uma Implementação de Codificação de MolmoAct para Raciocínio Espacial com Consciência de Profundida…

Neste tutorial, abordamos o MolmoAct passo a passo e construímos uma compreensão prática de como os modelos de raciocínio de ação podem raciocinar no espaço a partir de observações visuais. Configuramos o ambiente, carregamos o modelo, preparamos as entradas de imagem multi-visão e exploramos como o MolmoAct produz raciocínio com consciência de profundidade, rastros visuais e saídas robóticas acionáveis a partir de instruções em linguagem natural. Conforme avançamos no fluxo de trabalho, executamos a inferência e também examinamos como o modelo analisa ações, visualiza trajetórias e suporta pipelines de processamento mais avançados para tarefas orientadas à robótica. Copie o Código Copiado Use um Navegador diferente print("=" * 80) print(" SEÇÃO 1: INSTALAÇÃO E CONFIGURAÇÃO") print("=" * 80) import subprocess import sys def install_packages(): """Instala todos os pacotes necessários para o MolmoAct""" packages = [

"torch>=2.0.0",

"torchvision",

"transformers==4.52",

"accelerate",

"einops",

"Pillow",

"numpy",

"matplotlib",

"requests",

"scipy",

"huggingface_hub",

] for package in packages:

print(f" Instalando {package}...")

subprocess.check_call([sys.executable, "-m", "pip", "install", "-q", package]) print(" Todos os pacotes instalados com sucesso!") install_packages() print("\n" + "=" * 80) print(" SEÇÃO 2: IMPORTS E CONFIGURAÇÃO") print("=" * 80) import torch import numpy as np import matplotlib.pyplot as plt from PIL import Image import requests from io import BytesIO from typing import List, Tuple, Dict, Optional, Union import json import time from dataclasses import dataclass import warnings import re warnings.filterwarnings("ignore", category=FutureWarning) warnings.filterwarnings("ignore", category=UserWarning) print(f" Dispositivo: {device}") if torch.cuda.is_available(): print(f" GPU: {torch.cuda.get_device_name(0)}") print(f" Memória da GPU: {torch.cuda.get_device_properties(0).total_memory / 1e9:.2f} GB") print("\n" + "=" * 80) print(" SEÇÃO 3: CARREGADOR DE MODELO MOLMOACT") print("=" * 80) @dataclass class MolmoActConfig: """Configuração para o modelo MolmoAct""" model_name: str = "allenai/MolmoAct-7B-D-0812"

torch_dtype: str = "bfloat16"

device_map: str = "auto"

max_new_tokens: int = 256

temperature: float = 0.0

do_sample: bool = False Configuramos o tutorial e preparamos o ambiente necessário para rodar o MolmoAct no Google Colab. Instalamos todos os pacotes necessários, importamos as bibliotecas centrais e configuramos o ambiente de execução para detectar se a aceleração por GPU está disponível. Também definimos a configuração base

Fonte: MarkTechPost

Publicado em 2026-04-12

Notícias relacionadas

Continue explorando