Neste tutorial, focamos na construção de um pipeline de avaliação transparente e mensurável para aplicações de large language models usando TruLens. Em vez de tratar os LLMs como caixas pretas, instrumentamos cada estágio de uma aplicação para que as entradas, etapas intermediárias e saídas sejam capturadas como rastros estruturados. Em seguida, anexamos funções de feedback que avaliam quantitativamente o comportamento do modelo em dimensões como relevância, fundamentação e alinhamento contextual. Ao executar múltiplas variantes de aplicação sob a mesma configuração de avaliação, mostramos como o TruLens permite experimentação disciplinada, reprodutibilidade e melhoria baseada em dados de sistemas LLM. Copiar Código Copiado Use um navegador diferente!pip -q install trulens trulens-providers-openai chromadb openai import os, re, getpass from dataclasses import dataclass from typing import List, Dict, Any import numpy as np import chromadb from chromadb.utils.embedding_functions import OpenAIEmbeddingFunction from openai import OpenAI from trulens.core import TruSession, Feedback from trulens.providers.openai import OpenAI as TruOpenAI from trulens.apps.app import TruApp from trulens.core.otel.instrument import instrument from trulens.otel.semconv.trace import SpanAttributes from trulens.dashboard import run_dashboard if not os.environ.get("OPENAI_API_KEY"): os.environ["OPENAI_API_KEY"] = getpass.getpass("Digite OPENAI_API_KEY (entrada oculta): ") Preparamos o ambiente Colab instalando todas as bibliotecas necessárias e importando as dependências centrais usadas ao longo do tutorial. Lemos com segurança a chave da API OpenAI do terminal para evitar codificar credenciais sensíveis. Também inicializamos as ferramentas fundamentais que permitem o rastreamento, a avaliação de feedback e a visualização do painel. Copiar Código Copiado Use um navegador diferente def normalize_ws(s: str) -> str: return re.sub(r"\s+", " ", s).strip() RAW_DOCS = [ { "doc_id": "trulens_core", "title": "Ideia central do TruLens", "text": "TruLens é usado para rastrear e avaliar aplicações LLM. Ele pode registrar execuções de aplicações, calcular pontuações de feedback e fornecer um painel para comparar versões e investigar rastros e resultados." }, { "doc_id": "trulens_feedback", "title": "Funções de feedback", "text": "As funções de feedback do TruLens podem pontuar fundamentação, relevância de contexto e relevância de resposta. Elas são configuradas especificando quais partes de um registro de aplicação devem ser usadas como entrada." }, { "doc_id": "trulens_rag", "title": "Fluxo de trabalho RAG", "text": "Um fluxo de trabalho típico
Fonte: MarkTechPost
Publicado em 2026-02-23