Configurando Modelos LLM
- Como selecionar uma plataforma e um modelo para seu agente LLM
- O que as configurações da aba Geral fazem
- Como ajustar temperatura, limites de tokens e outras opções na aba Avançado
Quando você define o Assistant Type de um agente como llm, o AutoTalk revela as opções de configuração do modelo. A primeira coisa que você escolhe é a plataforma de IA, depois configura o modelo e seu comportamento.
Selecionando uma plataforma
O campo Tipo de plataforma determina qual provedor de IA alimenta seu agente. O AutoTalk suporta estes provedores gerenciados e opções de endpoint personalizado:
| Plataforma | Descrição |
|---|---|
| openai (padrão) | Modelos da OpenAI incluindo GPT-5.5, GPT-5.4, GPT-4.1 e outros. |
| deepseek | Modelos DeepSeek, incluindo DeepSeek V4 Flash e V4 Pro. |
| gemini | Modelos Google Gemini, incluindo Gemini 3.1 Flash-Lite e modelos Gemini 2.5. |
| anthropic | Modelos Anthropic Claude, incluindo Opus, Sonnet e Haiku. |
| openrouter | Encaminha requisições pelo OpenRouter usando um ID de modelo com prefixo do provedor. |
| custom | Conecte-se a um endpoint de API personalizado ou de terceiros. Use para provedores não listados acima, ou para seus próprios modelos ajustados servidos por uma API compatível. |
Após selecionar uma plataforma, cinco abas de configuração aparecem: Geral, Mensagens, Ações, Ferramentas e Avançado. Esta página cobre as abas Geral e Avançado; veja Mensagens do Sistema e Ferramentas para as outras.
Configurações da aba Geral
A aba Geral contém a plataforma, o modelo e o token de API.
Modelo
Selecione o modelo específico a ser usado em uma lista dropdown. Cada modelo exibe:
- Um selo de custo (Baixo custo, Médio ou Alto custo), derivado de onde o preço combinado de entrada + saída do modelo se posiciona entre os modelos disponíveis
- Preço por 1K tokens tanto para entrada quanto para saída, para que você possa estimar custos
Modelos mais leves custam menos, mas podem produzir respostas de menor qualidade; modelos mais pesados custam mais, mas lidam melhor com conversas complexas. Modelos obsoletos continuam visíveis para agentes existentes, mas aparecem marcados no seletor; escolha um modelo estável atual para novos agentes.
Token
Um campo pesquisável onde você pode selecionar um token de API existente ou criar um novo. Este token autentica seu agente com a plataforma de IA escolhida. Se você ainda não adicionou uma chave de API para a plataforma, pode criar uma diretamente neste campo.
Nota: O campo Token fica oculto de forma condicional. Ele só aparece quando você usa a plataforma openrouter, ou quando ativa o interruptor Ativar chave de API própria (BYO) — também na aba Geral — para um provedor gerenciado. Com o BYOK desativado em um provedor gerenciado (openai, deepseek, gemini, anthropic), o AutoTalk usa sua própria chave de plataforma, então nenhum campo Token é exibido.
Configurações da aba Avançado
Temperatura, limites de tokens e as opções de comportamento opcionais ficam na aba Avançado, agrupadas em seções.
Temperatura
Na seção Comportamento. Controla o quão criativas ou determinísticas são as respostas do modelo. O valor padrão é 1.
- Valores mais baixos (0.0 a 0.5): O agente fornece respostas mais focadas, previsíveis e consistentes. Ideal para suporte factual ao contato.
- Valores mais altos (0.8 a 1.5): O agente produz respostas mais variadas e criativas. Útil para brainstorming ou conversas casuais, mas pode reduzir a precisão.
Alguns modelos não suportam temperatura — em especial a família GPT-5 (gpt-5.5, gpt-5.4, gpt-5.4-mini, gpt-5.4-nano), que a ignoram. Para esses modelos o controle de temperatura aparece desabilitado no formulário.
Loop do agente
Na seção Comportamento (exibida em todas as plataformas). Quando Ativar loop de agente está marcado (desativado por padrão), o agente pode executar várias rodadas de chamadas de ferramenta automaticamente antes de produzir a resposta final, em vez de parar após uma única rodada. Ativá-lo revela Máx. iterações do loop de agente, que limita quantas rodadas do loop podem ocorrer (padrão 15, intervalo de 1 a 50). Valores mais altos permitem que o agente encadeie mais chamadas de ferramenta, mas podem aumentar a latência e o custo. O loop do agente não está disponível no modo Responses API.
Modo da API
Na seção Comportamento, na plataforma padrão openai. Seleciona como o AutoTalk chama o provedor: Chat Completions (padrão) ou Responses. Chat Completions é o modo padrão usado pela maioria dos agentes. Responses usa a Responses API da OpenAI, habilitando recursos como armazenamento de respostas no servidor e tratamento nativo de MCP; ele não suporta o loop do agente.
Máximo de tokens da resposta
Na seção Limites de tokens. Define o limite superior de quantos tokens o modelo pode gerar em uma única resposta. Use para controlar o comprimento da resposta e o custo. Se deixado vazio, o modelo usa seu máximo padrão.
Máximo de caracteres por mensagem
Na seção Limites de tokens. Limita quantos caracteres da mensagem do usuário são enviados ao modelo. O padrão é 1024 caracteres (máximo 2048). Aumente se seus contatos tendem a enviar mensagens mais longas e você quer que o agente considere o texto completo; diminua para reduzir custos em entradas extensas.
Ativar saídas estruturadas
Na seção Saídas estruturadas. Quando marcado, o modelo é instruído a retornar respostas em formato estruturado (como JSON). Isso é útil quando a saída do agente é consumida por outro sistema em vez de ser exibida diretamente ao contato.
Ativar orçamento de tokens do contexto
Na seção Orçamento de contexto. Quando marcado, o AutoTalk gerencia quanto do histórico da conversa é enviado ao modelo, impondo um orçamento de tokens para o contexto. Isso evita que a janela de contexto exceda o limite do modelo em conversas longas e ajuda a controlar custos.
Ativar processamento de imagens
Na seção Processamento de imagens, disponível apenas quando a plataforma é openai. Quando marcado, o agente pode receber e processar imagens enviadas pelos contatos (em modelos que suportam capacidades de visão). Isso permite que o agente descreva, analise ou responda a fotos e capturas de tela.
Para a maioria dos agentes voltados ao contato, comece com a plataforma openai e escolha um modelo estável capaz como gpt-4.1 ou gpt-4o-mini. Se o modelo suportar temperatura (como a família GPT-4.1 / GPT-4o), defina-a entre 0.3 e 0.5 para respostas confiáveis; observe que os modelos da família GPT-5 (incluindo gpt-5.4-mini) ignoram a temperatura, então o ajuste não se aplica a eles. Deixe Máximo de caracteres por mensagem no padrão e ative o processamento de imagens apenas se seu caso de uso exigir, pois aumenta o consumo de tokens.