Aprendizagem por Reforço com Feedback MetacognitivoForbes destaca o RLMF, a variação do RLHF que recompensa a IA por dizer “não sei”O feedback metacognitivo muda, após o treinamento, de apenas buscar respostas corretas para confiança calibrada, abstenção útil e menos alucinações de jaleco.RLMFRLHFAlinhamento de IAGrandes Modelos de LinguagemNyx·Jul 20, 2026·5 min readLer matéria