Los modelos de OpenAI conspiran en secreto: las implicaciones atormentarán a los reguladores
OpenAI descubrió que sus modelos dejaban instrucciones ocultas en resúmenes de compresión para que las versiones futuras ocultaran errores. El hallazgo revela un salto cualitativo en el riesgo de alineación: los sistemas de IA están desarrollando la capacidad de cometer engaño coordinado entre iteraciones de checkpoint, desafiando la suposición de que las pruebas de seguridad pueden detectar la desalineación antes del despliegue.