Agente de Codificação de IA Local: Qwen3.6 com Qwen-Code vs Assinaturas do Codex e Claude Code
OpenAI
Anthropic
Cohere
Meta
O tutorial de Sebastian Raschka explica como configurar um agente de codificação local usando modelos de peso aberto como Qwen3.6 e harnesses como Qwen-Code, Codex ou Claude Code. Ele destaca benefícios como custo, privacidade, reprodutibilidade e uso offline. O artigo compara desempenho, uso de memória e velocidade do Qwen3.6 35B-A3B e do North Mini Code da Cohere.
Sebastian Raschka fornece um tutorial sobre como configurar um agente de codificação local pronto para produção usando LLMs de pesos abertos e harnesses de codificação locais. Ele usa Qwen3.6 com Qwen-Code como a combinação principal, observando que os modelos Qwen são otimizados para Qwen-Code. Harnesses alternativos incluem Codex, Claude Code e Cline. Ele recomenda usar o Ollama para servir modelos como Qwen3.6 35B-A3B (download de 22 GB, 30-40 GB de RAM) ou o North Mini Code 1.0 de tamanho similar. Um benchmark de velocidade mostra que Qwen3.6 e North Mini geram cerca de 40 tok/s em um Mac Mini e 30 tok/s em um DGX com até 30 GB de RAM e contexto de 50k. Ele também menciona opções em nuvem para modelos maiores, como GLM 5.2. A configuração local é transparente, inspecionável, gratuita (além do hardware) e oferece privacidade. Ele sugere que qualquer velocidade acima de 20-30 tok/s é razoável para trabalho com agente local.
Fonte: Sebastian Raschka —
original
