Por que treinar tão poucos parâmetros funciona?
Por que treinar 0,1% dos pesos funciona. O paper do LoRA explicado pela ideia central: posto baixo, a decomposição e os números medidos no GPT-3.
Aqui não tem "segue o fio". Tem texto inteiro numa página só.Você lê e vai viver sua vida.
Comece por aqui
Por que treinar 0,1% dos pesos funciona. O paper do LoRA explicado pela ideia central: posto baixo, a decomposição e os números medidos no GPT-3.
PEFT fine-tuning congela quase todo o modelo e treina um punhado de parâmetros. As famílias de método, o que cada uma custa e como escolher entre elas.
QLoRA quantiza o modelo base em 4 bits e treina só o adaptador. Quanta VRAM cada tamanho pede, o que o método custa em qualidade e como rodar.
Agent harness é tudo que roda em volta do modelo: contexto, ferramentas, permissão e custo. Por que ele explica mais do resultado do que o modelo.
Agente vs workflow vs chatbot: quem decide o próximo passo separa os três, e a maioria dos casos que pedem agente se resolve com workflow.
Agente é um modelo dentro de um loop com ferramentas e critério de parada. O que muda em relação a uma chamada única e quando isso vale a pena.
A arquitetura de um RAG tem sete peças e o núcleo cabe em 40 linhas de Python. O que cada uma decide, onde quebra e o que custa trocar.
O que é isso e o que dá para fazer com isso no meu dia?
Como monto isso e o que quebra em produção?
Qual das opções serve para o meu caso, e a que custo?