Como ativar, configurar e trocar modelos de IA local¶
Tipo: How-to — orientado a tarefa
Audiência: profissional que já usa o Anotae e quer habilitar assistência por IA
Pré-condição: Anotae instalado e vault aberto
A IA local do Anotae é totalmente opt-in e offline: nenhum dado de atendimento sai do seu computador. Os componentes (LLM, RAG, ASR) são independentes — você pode ativar somente o que precisar.
Pré-requisitos de hardware¶
| Componente | RAM mínima | RAM recomendada | GPU |
|---|---|---|---|
| LLM 3B (ex.: Phi-3 Mini) | 4 GB livres | 6 GB | opcional |
| LLM 7–8B (ex.: Llama-3.1) | 8 GB livres | 12 GB | recomendada |
| RAG (embeddings ONNX) | 512 MB livres | 1 GB | não usa |
| ASR whisper.cpp (small-pt) | 1 GB livres | 2 GB | opcional |
GPU NVIDIA: quando detectada, o Anotae ajusta n_gpu_layers automaticamente para offload parcial. Não é necessário configurar manualmente na maioria dos casos.
Espaço em disco: modelos ficam em ~/.anotae/models/. Reserve ao menos 5 GB para um modelo 7B quantizado (q4_K_M).
Ativar o LLM¶
- Abra Settings (
Ctrl+,ou menu Ferramentas → Configurações). - Vá para a aba IA.
- Ative o master switch ("Habilitar IA local"). O painel de modelos fica visível.
- Na lista de modelos disponíveis (carregada do manifesto remoto, se habilitado, ou do manifesto local), selecione o modelo desejado.
- Clique em Baixar. O Anotae verifica o SHA-256 automaticamente ao final do download — uma mensagem verde confirma a integridade.
- Clique em Carregar. O modelo é carregado na RAM; o indicador no rodapé da janela principal muda para "IA: pronta".
Ajustar a janela de contexto (n_ctx)¶
O padrão é 2048 tokens, adequado para a maioria dos atendimentos.
Para aumentar para 4096 (útil ao sumarizar atendimentos mais longos):
- Em Settings → IA → seção Avançado, localize o campo Janela de contexto (n_ctx).
- Altere para
4096e clique em Aplicar. - O Anotae exibirá um aviso estimando o consumo adicional de RAM antes de recarregar o modelo.
Aumentar
n_ctxeleva o consumo de RAM proporcionalmente. Em sistemas com 8 GB, prefira 2048 com modelos 7B.
Trocar de modelo (hot-reload)¶
Você pode trocar de modelo sem reiniciar o Anotae:
- Settings → IA → clique em Descarregar (libera a RAM do modelo atual).
- Selecione o novo modelo na lista.
- Clique em Baixar (se ainda não baixado) e depois em Carregar.
O indicador no rodapé confirma quando o novo modelo está ativo.
Ativar o RAG (busca semântica em protocolos)¶
O RAG pode ser ativado independentemente do LLM. Ele permite buscar protocolos PCDT/MS e outros documentos indexados sem precisar do LLM carregado.
- Settings → IA → aba RAG.
- Ative o toggle Habilitar RAG.
- O índice vetorial é criado automaticamente na primeira ativação (pode levar alguns minutos dependendo do volume de documentos).
Re-indexar manualmente¶
Se você adicionou novos documentos à pasta de protocolos e quer indexá-los imediatamente (sem esperar o debounce de 500 ms do auto-indexador):
- Settings → IA → aba RAG → botão Re-indexar agora.
- Acompanhe o progresso na barra de status do dialog.
Ativar o ASR (transcrição de voz)¶
O ASR usa o whisper.cpp offline para transcrever anotações faladas em português.
- Settings → IA → aba ASR.
- Ative o toggle Habilitar ASR.
- Clique em Baixar modelo (modelo
ggml-small-pt, ~150 MB). - Após o download, o widget de gravação (
Ctrl+Rno campo de texto ativo) fica disponível.
Desativar tudo¶
Para liberar toda a RAM usada pela IA:
- Settings → IA → master switch → OFF.
- O modelo é descarregado imediatamente; RAG e ASR também são pausados.
O Anotae continua funcionando normalmente para registro e exportação de atendimentos.
Solução de problemas¶
"Modelo não encontrado"¶
- Verifique se o arquivo
.ggufexiste em~/.anotae/models/. - Confira espaço em disco disponível (
df -h ~no terminal). - Se o download foi interrompido, clique em Baixar novamente — o Anotae re-verifica o SHA-256 e retoma do início se o arquivo estiver corrompido.
"Timeout de inferência"¶
O modelo é grande demais para a RAM disponível. Solução:
- Settings → IA → Descarregar.
- Selecione um modelo menor (ex.: variante 3B em vez de 7B).
- Clique em Carregar.
"Erro CUDA" / falha no offload de GPU¶
Para rodar apenas na CPU:
- Settings → IA → seção Avançado → campo n_gpu_layers → defina
0. - Clique em Aplicar e recarregue o modelo.
ASR: "Nenhum dispositivo de áudio detectado"¶
O Anotae não encontrou microfone acessível. Verifique:
- macOS: Preferências do Sistema → Privacidade e Segurança → Microfone → autorize o Anotae.
- Linux: verifique se o PulseAudio/PipeWire está ativo e se o usuário tem permissão no grupo
audio. - Windows: Configurações → Sistema → Som → Entrada → confirme que o microfone aparece e não está silenciado.
Após corrigir, volte ao Anotae e clique em Testar microfone na aba ASR.
Veja também¶
docs/reference/ia-local.md— referência completa de parâmetros LLM/RAG/ASRdocs/explanation/decisao-ia-local.md— por que llama.cpp e não OllamaBACKLOG.md— itens futuros de IA (voz contínua, fine-tuning local)