Skip to content

Instantly share code, notes, and snippets.

Show Gist options
  • Select an option

  • Save alexishida/03f7a411f96fdc4b343e5ec659b2f90b to your computer and use it in GitHub Desktop.

Select an option

Save alexishida/03f7a411f96fdc4b343e5ec659b2f90b to your computer and use it in GitHub Desktop.
IA anotações

📊 Guia Comparativo Unificado de Modelos de IA para Desenvolvimento (2026)

Este documento consolida a análise técnica de todos os modelos discutidos ao longo da nossa conversa, integrando as IAs com raciocínio avançado (effort-based reasoning) e os modelos especializados do ecossistema de engenharia de software em 2026 — agora atualizado com o Claude Fable 5 (topo da linha Mythos-class da Anthropic) e o GPT-5.6 (Sol).


🎯 O Melhor Modelo para Cada Cenário (Visão Consolidada)

🎨 Criar Design de Sites, Apps e Sistemas (Front-end e UI/UX)

  • O Campeão: Claude Fable 5 (High Effort)
  • Porquê? Como modelo Mythos-class, é state-of-the-art em UI design e "one-shotting" de apps completos, implementa designs com alta fidelidade e usa visão para validar o próprio resultado visual contra o mockup original.
  • Alternativas Fortes: Claude 4.6 Sonnet (High Effort) (excelente custo-benefício com auto-correção visual) e Kimi K2.6 (ótima opção open-weights para design-to-code).

⚙️ Engenharia e Arquitetura de Software (Back-end e Algoritmos Complexos)

  • Os Melhores: Claude Fable 5 (High Effort) e GPT-5.6 Sol (Ultra / Max Effort)
  • Porquê? O Fable 5 sustenta tarefas longas, multi-etapas e assíncronas que os modelos anteriores não conseguiam manter, planejando por estágios e delegando a sub-agentes. Já o GPT-5.6 Sol em modo ultra usa subagentes para acelerar trabalho complexo e o modo max dedica tempo massivo de inferência para caçar bugs de concorrência ou segurança mais ocultos.
  • Alternativas Fortes: Claude 4.8 Opus (High Effort) para lógica matemática pura e GPT-5.5 (Max Effort) para refatoração total.

📋 Análise de Requisitos e Modelagem (PRDs e Documentação)

  • O Campeão: GPT-5.6 Terra (Medium Effort) ou GLM-5.1
  • Porquê? O Terra oferece o equilíbrio ideal de inteligência e custo para mapear fluxos de negócios e antecipar edge cases sem estourar o orçamento. A linha GLM-5 / 5.1 continua sendo a escolha ideal do mundo de código aberto para gerar artefatos estruturados diretamente.
  • Alternativa: ChatGPT 5.4 (Medium Effort) segue excelente para PRDs mais enxutos.

☕ Coisas Corriqueiras e Tarefas Rápidas (Scripts, RegEx e Consultas no Terminal)

  • Os Melhores: GPT-5.6 Luna e DeepSeek V4 Flash
  • Porquê? Para rotinas do dia a dia, a prioridade é agilidade e economia. O Luna ($1/$6 por milhão) é o tier eficiente para alto volume, e o DeepSeek V4 Flash, MiniMax M3 e MiMo-V2.5 entregam respostas instantâneas para pequenos scripts sem pesar no orçamento.

📊 Tabela Comparativa Global e Unificada (Versão Atualizada — Julho/2026)

Modelo Nível de Esforço (Effort) Tipo de Acesso Especialidade no Dev Janela de Contexto Custo-Benefício Perfil / "Adjetivo" de Trabalho
Claude Fable 5 High / Adaptive Effort Proprietário (Mythos-class) Tarefas Longas Autónomas, Fullstack e Arquitetura 1 Milhão Alto Custo ($10/$50) O Titã: State-of-the-art quase geral; trabalha por dias, delega a sub-agentes e valida o próprio trabalho por visão.¹
GPT-5.6 Sol Ultra Effort (Subagentes) Proprietário (Codex/API) Orquestração Multi-agente e Sistemas Críticos Não publicada² Alto Custo ($5/$30) O Maestro: Modo ultra usa subagentes para acelerar trabalho complexo além de um único agente.
GPT-5.6 Sol Max Effort Proprietário (Codex/API) Vulnerabilidades Profundas e Debugging Longo Não publicada² Alto ($5/$30) O Detetive: Raciocínio mais profundo do Sol; caça bugs de concorrência e segurança ocultos.
GPT-5.6 Sol Medium / Standard Proprietário (Chat/Codex/API) Engenharia de Software Geral Avançada Não publicada² Médio-Alto O Engenheiro Sénior: Respostas robustas para o ambiente corporativo diário.
GPT-5.6 Terra Standard Proprietário (Codex/API) Análise de Requisitos e Trabalho Equilibrado Não publicada² Excelente ($2.50/$15) O Gestor Técnico: Equilíbrio de inteligência e custo; mapeia arquiteturas sem estourar orçamento.
GPT-5.6 Luna Fast Stream Proprietário (Codex/API) Scripts rápidos, RegEx e Alto Volume Não publicada² Muito Barato ($1/$6) O Ágil: Tier eficiente para workloads de alto volume e tarefas repetitivas.
ChatGPT 5.5 Max / High Effort Proprietário (API) Sistemas Críticos e Refatoração Total 2 Milhões Alto Custo O Estrategista: Computação massiva em inferência para bugs complexos (geração anterior).
ChatGPT 5.5 Low / Standard Proprietário (API) Engenharia de Software Geral Avançada 2 Milhões Médio O Veterano Robusto: Respostas sólidas e rápidas para o dia a dia corporativo.
Claude 4.8 Opus High Effort Proprietário (API) Arquitetura de Software e Lógica Pura 1 Milhão Alto Custo O Cientista: Raciocínio profundo para algoritmos, criptografia e regras pesadas. É também o modelo de fallback do Fable 5.³
Claude 4.6 Sonnet High Effort Proprietário (API) Design-to-Code Avançado e Fullstack 512k Médio-Alto O Arquiteto Visual: Componentização impecável com auto-correção visual automática.
Claude 4.6 Sonnet Standard Proprietário (API) Code Generation Geral e APIs 512k Excelente O Pragmático: Código limpo, modular e bem documentado de forma veloz.
ChatGPT 5.4 Medium Effort Proprietário (API) Análise de Requisitos e PRDs Complexos 1 Milhão Excelente O Analista Funcional: Mapeia arquiteturas e dependências sem alucinar.
ChatGPT 5.4 Low Effort / Flash Proprietário (API) Scripts rápidos, RegEx e Consultas 1 Milhão Muito Barato O Direto: Respostas ágeis no terminal para debugar pequenas sintaxes.
Qwen 3.7 Max Agente Nativo Proprietário (API) Loops de Execução Longos (Agentes) 1 Milhão Médio O Incansável: Excelente para rodar de forma autónoma no editor resolvendo tarefas.
Qwen 3.7 Plus Standard Proprietário (API) Code Generation Geral e Front-end 512k Excelente O Poliglota: Excelente sintaxe de código e fluidez na comunicação técnica.
Qwen 3.6 Plus Standard Proprietário (API) Legados e Suporte a Manutenção 256k Bom O Estável: Útil para manter sistemas da arquitetura do ano anterior.
DeepSeek V4 Pro Standard Reasoning Open-Weights / API Lógica de Back-end e Otimização 128k Alto O Cirurgião: Focado em performance pura de código e algoritmos otimizados.
DeepSeek V4 Flash Fast Stream Open-Weights / API Automações e Microscripts rápidos 128k Imbatível O Relâmpago: Velocidade e economia extremas para tarefas repetitivas.
Kimi K2.6 Multimodal Nativo Open-Weights Engenharia de Interfaces (Front-end) 256k Excelente O Estilista: Transforma imagens e mockups em código Tailwind/React estruturado.
Kimi K2.5 Standard Open-Weights Coding Geral auxiliado por ferramentas 128k Bom O Assistente: Equilibrado para desenvolvimento guiado e suporte comum.
GLM-5.1 Document Focus Open-Weights Geração de Artefatos e Docs Técnicos 200k Ótimo O Analista Avançado: Transforma reuniões e rascunhos em especificações técnicas.
GLM-5 Document Focus Open-Weights Documentação Técnica e Estruturas 200k Ótimo O Escrivão: Ótimo para organização inicial de pastas e mapeamento de escopo.
MiMo-V2.5-Pro IoT Focused Open-Weights Integração de Sistemas e Hardware / IoT 1 Milhão Ótimo O Conectado: Perfeito para código embarcado e fluxos extensos de contexto.
MiMo-V2.5 Standard Open-Weights Scripts leves e rotinas de automação 128k Bom O Compacto: Uma IA eficiente para microsserviços e rotinas em background.
MiniMax M3 Fast Chat Proprietário (API) Interações rápidas de Chat no Terminal 128k Médio O Prático: Respostas diretas ao ponto, sem enrolação teórica.
MiniMax M2.7 Standard Proprietário (API) Consultas leves e micro-refatorações 128k Médio-Baixo O Transicional: Substituído gradativamente pela linha M3 e Flash.
MiniMax M2.5 Standard Proprietário (API) Rotinas simples e manutenção básica 64k Baixo O Veterano: Mantido para retrocompatibilidade em integrações antigas de API.

Notas: ¹ Fable 5 é Mythos-class (tier acima do Opus). Preço de $10/$50 por milhão de tokens (o dobro do Opus 4.8), janela de 1M de contexto e até 128k de saída. Queries sensíveis de cyber/bio são reencaminhadas automaticamente para o Opus 4.8, sem cobrança do preço Fable nesses casos. ² OpenAI ainda não publicou oficialmente a janela de contexto do GPT-5.6 nos materiais de lançamento. Preços de API: Sol $5/$30, Terra $2.50/$15, Luna $1/$6 por milhão de tokens. ³ No fluxo do Fable 5, o Opus 4.8 atua como modelo de fallback quando os classificadores de segurança bloqueiam certos pedidos.


🚫 Modelos a Evitar (Não Recomendados em 2026)

Esta tabela reúne modelos que, embora ainda possam aparecer em pickers ou integrações, não valem a escolha hoje — seja por estarem obsoletos, superados por sucessores diretos com melhor custo-benefício, ou por não se encaixarem bem em fluxos de desenvolvimento sério. Use apenas se houver um motivo específico (retrocompatibilidade, dependência legada, restrição de custo extrema).

Modelo Motivo para Evitar Substituto Recomendado
MiniMax M2.5 Janela de apenas 64k e capacidade defasada; mantido só para retrocompatibilidade de APIs antigas. MiniMax M3 ou DeepSeek V4 Flash
MiniMax M2.7 Fase de transição, já sendo substituído em performance; sem vantagem sobre o M3. MiniMax M3
MiMo-V2.5 (padrão) Útil só em nichos de background; para uso geral perde para alternativas mais rápidas e baratas. DeepSeek V4 Flash / GPT-5.6 Luna
Kimi K2.5 Superado diretamente pelo K2.6, que é multimodal nativo e melhor em design-to-code. Kimi K2.6
Qwen 3.6 Plus Geração anterior; só faz sentido para manter sistemas na arquitetura do ano passado. Qwen 3.7 Plus
GLM-5 (padrão) Substituído pelo GLM-5.1 para geração de artefatos e especificações técnicas. GLM-5.1
ChatGPT 5.4 (todos os efforts) Duas gerações atrás; superado por 5.5 e agora por 5.6 em capacidade e eficiência de tokens. GPT-5.6 Terra/Luna
ChatGPT 5.5 Boa, mas encarece sem entregar o ganho do 5.6 (subagentes, ultra effort, caching previsível). Evitar para trabalho novo. GPT-5.6 Sol/Terra
DeepSeek V4 Pro (para front-end/UI) Focado em back-end e otimização; fraco encaixe para design e interfaces. Claude Fable 5 ou Kimi K2.6

Regra prática: para trabalho novo, evite modelos de gerações anteriores (linha 5.4, Qwen 3.6, Kimi K2.5, GLM-5, MiniMax M2.x). Reserve-os apenas quando uma integração legada ou orçamento apertado justificar.

⚠️ O Claude 4.8 Opus NÃO está nesta lista de propósito. Em high effort ele compensa — e muito — para lógica pesada pontual, algoritmos e back-end complexo, a metade do custo do Fable 5 (~$5/$25 vs $10/$50 por milhão). A vantagem do Fable só se paga em tarefas longas e autónomas (migrações grandes, sessões multi-dia com sub-agentes, validação visual de front-end). Para um bug isolado ou uma regra de negócio pontual, o Opus 4.8 alto costuma ser a escolha mais racional.


💡 Modelo de Workflow Recomendado (Atualizado)

  1. Escopo com Custo Inteligente: Use o GPT-5.6 Terra (Medium Effort) ou GLM-5.1 para transformar briefings informais em PRDs rígidos.
  2. Arquitetura de Algoritmo Crítico: Aloque o Claude Fable 5 (High Effort) ou o Claude 4.8 Opus (High Effort) para modelar esquemas de bases de dados e regras complexas de Back-end.
  3. Produção Visual de Alta Fidelidade: Alimente o Claude Fable 5 ou o Claude 4.6 Sonnet (High Effort) com os mockups para gerar um Front-end robusto e componentizado com validação visual.
  4. Resolução de Gargalos em Produção: Ative o GPT-5.6 Sol (Ultra / Max Effort) ou o ChatGPT 5.5 (Max Effort) apenas para rastrear falhas severas de performance, vazamentos de memória ou vulnerabilidades críticas.
  5. Tarefas Longas e Autónomas: Delegue ao Claude Fable 5 projetos multi-dia (grandes migrações, implementações complexas) que exigem planejamento por estágios e auto-verificação.
  6. Apoio Contínuo no Terminal: Configure o GPT-5.6 Luna ou o DeepSeek V4 Flash como assistente de digitação rápida e gerador de scripts cotidianos.

Tabela de substituição — Codex no ChatGPT Plus (geração 5.6)

Se você usava o modelo antigo (esquerda), passe a usar o equivalente 5.6 (direita). A geração 5.6 (Sol / Terra / Luna) chegou em 09/07/2026. Valores estimados, sujeitos a mudança.

Equivalência de modelos

Você usava (antigo) Passe a usar (5.6) Custo por crédito* Custo de mensagens (Plus, ~/5h) vs. o antigo Melhor para
GPT-5.4 Medium Terra Medium Médio ($2.50/$15 · 125/375 créd) 20–110 msgs Capacidade ≥, mais eficiente Trabalho diário, bugs escopados, refactors médios
GPT-5.4-mini Luna Low/Medium Baixo ($1/$6 · 50/300 créd) 50–280 msgs Mais capaz pelo mesmo custo baixo Alto volume, edições triviais, subagentes, 1ª passada
GPT-5.4 High Terra High / Sol Medium Terra médio · Sol alto ($5/$30) Terra 20–110 · Sol 15–90 Mais precisão e persistência Tarefas multi-etapa, tradeoffs, análise mais profunda
GPT-5.5 (flagship) Sol Medium/High Alto ($5/$30 · 250/1500 créd) 15–90 msgs Mais capaz pelo MESMO preço Coding difícil, contexto longo, depuração ambígua
GPT-5.5 (economizando) Terra High Médio ($2.50/$15) 20–110 msgs ~Mesma qualidade, ~metade do custo Quando quer qualidade 5.5 gastando menos franquia
(tarefa difícil de verdade) Sol High / Sol Max Alto a muito alto 15–90 (Max gasta mais) Profundidade máxima single-agent Bugs cabeludos, vuln research, raciocínio longo
(refactor amplo divisível) Sol Ultra Muito alto (~3x Sol) consome bem mais Subagentes em paralelo Refactor grande com deadline, dá p/ dividir em partes

Sua troca principal: GPT-5.4 Medium → Terra Medium

Observações

  • * Custo por crédito = quanto cada modelo drena da franquia/créditos por tarefa (preço API por 1M tokens e créditos Codex). Não há conversão fixa: contexto, MCP, tamanho do repositório e effort mudam o consumo.
  • Regra prática: comece no menor par modelo+effort que resolve e suba de nível só quando o resultado não passar. Evite trocar modelo e effort ao mesmo tempo — assim você não sabe qual dos dois ajudou.
  • Limites reais: confira sempre em Codex Settings > Usage ou com /status na CLI.
  • Outros planos: Pro (US$100) ≈ 5x · Pro (US$200) ≈ 20x os limites do Plus.
# path opencode plugin vscode path opencode
C:\Users\<user>\AppData\Roaming\npm\node_modules\opencode-ai\bin\opencode.exe
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment