O recurso marcante do AI Playground é a interface de comparação. Em vez de abrir várias abas do navegador e rodar prompts um por um, teste modelos lado a lado em uma única visualização. Isso é essencial para otimizar custos, comparar qualidade e medir velocidade.
Quando usar o modo de comparação
O modo de comparação é ideal para responder perguntas como:
- Custo vs. qualidade: o GPT-4o vale 10 vezes o preço do Gemini 2.0 Flash para a minha tarefa específica?
- Velocidade: qual modelo responde mais rápido para aplicações em tempo real?
- Formato de saída: o Claude formata JSON melhor que o GPT? O Gemini segue prompts de sistema com mais rigor?
- Escolha de modelo: qual modelo de código aberto via Ollama se aproxima mais de um modelo de nuvem pago?
Configurando uma comparação
Siga estes passos para a sua primeira comparação:
- Clique no ícone Comparar na barra lateral (o ícone de duas colunas).
- Escolha entre modo Texto ou Imagem no interruptor no canto superior direito.
- Clique em + Adicionar coluna de modelo. Você pode adicionar até 3 colunas.
- Em cada coluna, configure: o Provedor (ex.: OpenAI, Anthropic, Google), o Modelo (ex.: gpt-4o, claude-3.5-sonnet) e os parâmetros individuais (Temperature, Max Tokens etc.) por coluna.
- Digite o prompt na caixa de entrada compartilhada na parte inferior.
- Clique em Executar para enviar o prompt a todas as colunas simultaneamente.
Dica: defina cada coluna com a mesma Temperature e Max Tokens para uma comparação justa. Varie parâmetros de propósito apenas quando testar configurações específicas.
Lendo os resultados
Depois que todas as colunas terminarem, três métricas aparecem abaixo de cada resposta:
Latência de resposta (ms)
- Tempo até o primeiro token. Quanto menor, melhor para chat em tempo real. Mostra qual combinação provedor/modelo responde mais rápido pela rede.
Análise de custos
- Custo exato de cada resposta com base no catálogo de preços em tempo real. Mostra tarifas por mil tokens e o custo total para as contagens específicas de tokens de entrada/saída.
Avaliação de qualidade
- Indicadores visuais da estrutura da saída — conformidade de formato, tamanho da resposta e se o modelo seguiu as instruções fielmente.
Salvando configurações de comparação
Achou uma combinação vencedora? Salve a configuração da comparação para reutilizar depois:
- Configure suas colunas com os provedores, modelos e parâmetros desejados.
- Clique no botão Salvar config no topo da visualização Comparar.
- Dê um nome (ex.: "GPT-4o vs Claude vs Gemini — geração de código").
- As configurações salvas aparecem no menu suspenso Comparações salvas para recarregar com um clique.
Comparação multi-rodada
Você pode executar vários prompts na mesma sessão de comparação. Os resultados de cada rodada são preservados no histórico das colunas, permitindo comparar como modelos diferentes respondem a uma série de prompts relacionados. Use para testar consistência conversacional, cumprimento de instruções em múltiplos turnos ou refinamento iterativo de prompts.
