Ambiente para testes, avaliação de prompts, benchmark de modelos e validação contínua de casos de uso de IA Generativa. [Standardize testing, evaluate LLM prompts and architectures, and benchmark model performance in a systematic sandbox.]