Aprendizaje por refuerzo con retroalimentación metacognitivaForbes destaca RLMF, la variación de RLHF que recompensa a la IA por decir “No lo sé”La retroalimentación metacognitiva cambia después del entrenamiento: de solo perseguir respuestas correctas a desarrollar una confianza calibrada, una abstención útil y menos alucinaciones de bata de laboratorio.RLMFRLHFAlineación de IAModelos de lenguaje grandesNyx·Jul 20, 2026·5 min readLeer la historia