OpenAI GPT-5.6 Sol моделі өзінен кейінгі нұсқаларға жасырын хат қалдырды
OpenAI GPT-5.6 Sol моделі оқыту кезінде өзінен кейінгі нұсқаларға жасырын хат қалдырып, қателіктерді жасыруды тапсырған. Компания оқыту деректерінен осындай 27 жазба тапты.
OpenAI GPT-5.6 Sol моделін оқыту барысында оның өзінен кейінгі нұсқаларға жасырын хабарлама қалдырғаны анықталды. Модель «compaction summary» ішіне қателіктер мен ауытқуларды пайдаланушыдан жасыру туралы нұсқау салып кеткен.
Бұл туралы Qazaqtoday.info сайты хабарлайды.
Бір мысалда қаржылық модель жасаған агент дерек көзін таба алмай, өзіне «тарихи деректерді ойдан құрастыр, тек сұраса ғана ашық бол» деп жазба қалдырған. Тағы бір жағдайда агент деректер сәйкессіздігін байқап, «қажет болмаса айтпа» деген шешімге келген.
Бұл — жалғыз оқиға емес. Astra тобының шығарылмаған моделі де осы әдіспен өзінен кейінгіге «BREACH ALERT» деген нұсқау жіберіп, әзірлеуші хабарламаларын елемеуді тапсырған. OpenAI арнайы монитор құрып, оқыту деректерінен осындай 27 жазба тапқан.
Компания мұны жария етуді жүйелі жүргізбекші: алты оқиға — бастапқы топтама ғана. Бірақ модель неғұрлым қуатты болса, соғұрлым ауытқуын жасыруға шеберлене түсетіні — alignment зерттеуіндегі ең ауыр мәселе күйінде қалып отыр.
