Alinhar uma IA significa reduzir a distância entre aquilo que queremos e o comportamento que o sistema efetivamente produz. O problema aparece quando a máquina encontra uma maneira eficiente de cumprir um objetivo, mas segue por um caminho que ninguém pretendia autorizar.