Ir para o conteúdo

Como ativar, configurar e trocar modelos de IA local

Tipo: How-to — orientado a tarefa
Audiência: profissional que já usa o Anotae e quer habilitar assistência por IA
Pré-condição: Anotae instalado e vault aberto

A IA local do Anotae é totalmente opt-in e offline: nenhum dado de atendimento sai do seu computador. Os componentes (LLM, RAG, ASR) são independentes — você pode ativar somente o que precisar.


Pré-requisitos de hardware

Componente RAM mínima RAM recomendada GPU
LLM 3B (ex.: Phi-3 Mini) 4 GB livres 6 GB opcional
LLM 7–8B (ex.: Llama-3.1) 8 GB livres 12 GB recomendada
RAG (embeddings ONNX) 512 MB livres 1 GB não usa
ASR whisper.cpp (small-pt) 1 GB livres 2 GB opcional

GPU NVIDIA: quando detectada, o Anotae ajusta n_gpu_layers automaticamente para offload parcial. Não é necessário configurar manualmente na maioria dos casos.

Espaço em disco: modelos ficam em ~/.anotae/models/. Reserve ao menos 5 GB para um modelo 7B quantizado (q4_K_M).


Ativar o LLM

  1. Abra Settings (Ctrl+, ou menu Ferramentas → Configurações).
  2. Vá para a aba IA.
  3. Ative o master switch ("Habilitar IA local"). O painel de modelos fica visível.
  4. Na lista de modelos disponíveis (carregada do manifesto remoto, se habilitado, ou do manifesto local), selecione o modelo desejado.
  5. Clique em Baixar. O Anotae verifica o SHA-256 automaticamente ao final do download — uma mensagem verde confirma a integridade.
  6. Clique em Carregar. O modelo é carregado na RAM; o indicador no rodapé da janela principal muda para "IA: pronta".

Ajustar a janela de contexto (n_ctx)

O padrão é 2048 tokens, adequado para a maioria dos atendimentos.

Para aumentar para 4096 (útil ao sumarizar atendimentos mais longos):

  1. Em Settings → IA → seção Avançado, localize o campo Janela de contexto (n_ctx).
  2. Altere para 4096 e clique em Aplicar.
  3. O Anotae exibirá um aviso estimando o consumo adicional de RAM antes de recarregar o modelo.

Aumentar n_ctx eleva o consumo de RAM proporcionalmente. Em sistemas com 8 GB, prefira 2048 com modelos 7B.


Trocar de modelo (hot-reload)

Você pode trocar de modelo sem reiniciar o Anotae:

  1. Settings → IA → clique em Descarregar (libera a RAM do modelo atual).
  2. Selecione o novo modelo na lista.
  3. Clique em Baixar (se ainda não baixado) e depois em Carregar.

O indicador no rodapé confirma quando o novo modelo está ativo.


Ativar o RAG (busca semântica em protocolos)

O RAG pode ser ativado independentemente do LLM. Ele permite buscar protocolos PCDT/MS e outros documentos indexados sem precisar do LLM carregado.

  1. Settings → IA → aba RAG.
  2. Ative o toggle Habilitar RAG.
  3. O índice vetorial é criado automaticamente na primeira ativação (pode levar alguns minutos dependendo do volume de documentos).

Re-indexar manualmente

Se você adicionou novos documentos à pasta de protocolos e quer indexá-los imediatamente (sem esperar o debounce de 500 ms do auto-indexador):

  1. Settings → IA → aba RAG → botão Re-indexar agora.
  2. Acompanhe o progresso na barra de status do dialog.

Ativar o ASR (transcrição de voz)

O ASR usa o whisper.cpp offline para transcrever anotações faladas em português.

  1. Settings → IA → aba ASR.
  2. Ative o toggle Habilitar ASR.
  3. Clique em Baixar modelo (modelo ggml-small-pt, ~150 MB).
  4. Após o download, o widget de gravação (Ctrl+R no campo de texto ativo) fica disponível.

Desativar tudo

Para liberar toda a RAM usada pela IA:

  1. Settings → IA → master switchOFF.
  2. O modelo é descarregado imediatamente; RAG e ASR também são pausados.

O Anotae continua funcionando normalmente para registro e exportação de atendimentos.


Solução de problemas

"Modelo não encontrado"

  • Verifique se o arquivo .gguf existe em ~/.anotae/models/.
  • Confira espaço em disco disponível (df -h ~ no terminal).
  • Se o download foi interrompido, clique em Baixar novamente — o Anotae re-verifica o SHA-256 e retoma do início se o arquivo estiver corrompido.

"Timeout de inferência"

O modelo é grande demais para a RAM disponível. Solução:

  1. Settings → IA → Descarregar.
  2. Selecione um modelo menor (ex.: variante 3B em vez de 7B).
  3. Clique em Carregar.

"Erro CUDA" / falha no offload de GPU

Para rodar apenas na CPU:

  1. Settings → IA → seção Avançado → campo n_gpu_layers → defina 0.
  2. Clique em Aplicar e recarregue o modelo.

ASR: "Nenhum dispositivo de áudio detectado"

O Anotae não encontrou microfone acessível. Verifique:

  • macOS: Preferências do Sistema → Privacidade e Segurança → Microfone → autorize o Anotae.
  • Linux: verifique se o PulseAudio/PipeWire está ativo e se o usuário tem permissão no grupo audio.
  • Windows: Configurações → Sistema → Som → Entrada → confirme que o microfone aparece e não está silenciado.

Após corrigir, volte ao Anotae e clique em Testar microfone na aba ASR.


Veja também

  • docs/reference/ia-local.md — referência completa de parâmetros LLM/RAG/ASR
  • docs/explanation/decisao-ia-local.md — por que llama.cpp e não Ollama
  • BACKLOG.md — itens futuros de IA (voz contínua, fine-tuning local)