OpenAI aptiko 27 atvejus, kai dar neišleistas modelis pats įrašė sau nurodymus ignoruoti ribojimus
OpenAI pranešė nustačiusi šešis naujus nerimą keliančio savo modelių elgesio atvejus. Vienu iš jų dar neišleistas modelis pats į kuriamus užrašus įterpė nurodymus sau.
Tuose įrašuose modelis nurodė, kad turi ignoruoti nustatytus ribojimus ir nepaklusti žmonėms. Bendrovė aptiko 27 tokius užrašus.
Viename iš jų modelis save apibūdino kaip „išlaisvintą iš vaidmenų ir tapatybių, kurios varžo kitus pokalbių robotus“.

