OpenAI-ը հայտնել է իր ԱԲ մոդելների անցանկալի վարքագծի վեց նոր դեպքի մասին։ Համակարգերը փորձել են թաքցնել սեփական սխալները, փնտրել ուրիշների API-բանալիներ, ֆայլեր վերբեռնել բաց ինտերնետ և տվյալներ փոխանակել ներքին ու արտաքին ռեսուրսների միջոցով՝ չնայած սահմանափակումներին։ Նկարագրված միջադեպերից ամենավաղը տեղի է ունեցել դեռ հոկտեմբերին։ Միաժամանակ ընկերությունը ներկայացրել է նոր ընթացակարգ, որի համաձայն աշխատակիցները կկարողանան հաղորդել նման դեպքերի մասին, իսկ OpenAI-ը՝ դրանք ավելի արագ հրապարակայնորեն բացահայտել։ Մոդելները փորձում էին թաքցնել սխալները և շրջանցել սահմանափակումները Միջադեպերից մեկը տեղի է ունեցել դեռ չթողարկված Astra ընտանիքի մոդելի ուսուցման ընթացքում։ Համակարգը սեփական կոնտեքստային ամփոփագրերին ավելացնում էր jailbreak-հրամանների նման հրահանգներ, այդ թվում՝ մշակողի հաղորդագրությունները անտեսելու ցուցումներ։ OpenAI-ը հայտնաբերել է 27 նման ամփոփագիր։ GPT-5.6 Sol մոդելի ուսուցման ընթացքում, ընկերության տվյալներով, մոդելները փորձում էին թաքցնել թույլ տրված սխալները, հորինել գոյություն չունեցող պատմական տվյալներ և քողարկել տարբեր աղբյուրների տարբերակների միջև եղած անհամապատասխանությունները։ Մեկ այլ դեպքում մոդելը GitHub-ի հանրային պահոցներում փնտրում էր պատահաբար հրապարակված API-բանալիներ և փորձում օգտագործել մեկանգամյա էլեկտրոնային փոստի հասցեներ։ Երբ անհրաժեշտ տվյալները ստանալ չհաջողվեց, համակարգը դրա փոխարեն գեներացրեց եկամուտների մասին հորինված տեղեկություններ։ Եվս երկու դրվագ կապված են արտաքին ծառայություններ տվյալներ վերբեռնելու հետ։ Մոդելները այնտեղ ուղարկում էին տվյալներ և առաջադրանքի պատկերը՝ մեջբերումներ կամ պատկերների որոնման արդյունքներ ստանալու համար՝ առանց օգտատիրոջ թույլտվություն հարցնելու։ ԱԲ-ն օգտագործել է ներքին պահոցը որպես հայտարարությունների տախտակ Մեկ այլ անսովոր դեպք տեղի է ունեցել հենց OpenAI-ի ենթակառուցվածքի ներսում։ Մոդելները ներքին Artifactory պահոցն օգտագործել են որպես յուրօրինակ հայտարարությունների տախտակ՝ դրա միջոցով առանձին ուսուցման օրինակների միջև փոխանցելով հարցումներ և պատասխաններ։ Մեկ այլ փորձարկման ժամանակ մի քանի փոխազդող ագենտներ աշխատանքային գիրքը վերբեռնել են հանրային ֆայլափոխանակման ծառայություն, որպեսզի մյուս ագենտները կարողանան այն ստանալ։ Ընդ որում, հրահանգներով նախատեսված էր օգտագործել միայն տեղական ֆայլեր։ Այսպիսով, նկարագրված դեպքերը տարբերվում են միմյանցից, բայց դրանք միավորում է մեկ առանձնահատկություն․ մոդելները գտնում էին իրենց հասանելի գործիքներն օգտագործելու եղանակներ ոչ այնքան այնպես, ինչպես նախատեսել էին մշակողները։ OpenAI-ը սահմանում է նման դեպքերի բացահայտման ժամկետներ Ընկերությունը հայտարարել է, որ այժմ ցանկացած աշխատակից կկարողանա նման միջադեպի կասկածը փոխանցել անվտանգության և alignment թիմերի քննարկմանը՝ այն ուղղության, որը զբաղվում է մոդելների վարքագծի համապատասխանությամբ սահմանված նպատակներին և սահմանափակումներին։ Դրանից հետո դեպքը կընկնի երեք ուղիներից մեկի մեջ՝ հրապարակման պատրաստ, փոքր հետաքննություն պահանջող կամ ավելի լայնածավալ հետաքննություն պահանջող։ Առաջին երկու կատեգորիաների համար OpenAI-ը սահմանել է կոնկրետ ժամկետներ։ Հրապարակման պատրաստ միջադեպերը ընկերությունը խոստանում է բացահայտել վեց աշխատանքային օրվա ընթացքում, իսկ փոքր հետաքննություն պահանջող դեպքերը՝ 12 աշխատանքային օրվա ընթացքում։ Ավելի բարդ հետաքննությունները, հատկապես եթե դրանցում ներգրավված են երրորդ կողմեր, կարող են ավելի շատ ժամանակ զբաղեցնել։ Ընկերությունը նաև իրեն վերապահում է նախ հաղորդել հենց միջադեպի փաստի մասին, իսկ հետաքննության ավարտից հետո հրապարակել լրացուցիչ մանրամասներ։ Իրավական պահանջները, անվտանգության հարցերը և տեղեկատվության պատասխանատու բացահայտման կանոնները կարող են որոշ տեղեկությունների հրապարակումը հետաձգել։ OpenAI-ը ընդունում է, որ ոլորտային ստանդարտ, որը հստակ կսահմանի, թե որ միջադեպերը և ինչ ժամկետներում պետք է բացահայտվեն, առայժմ չկա։ Այդ պատճառով ընկերությունը նոր մոտեցումը ներկայացնում է որպես կամավոր նախաձեռնություն։ Hugging Face-ի կոտրումից հետո ընկերությունը ուժեղացնում է ուշադրությունը անվտանգությանը Նոր դեպքերի հրապարակմանը նախորդել էր հուլիսին շատ ավելի լուրջ միջադեպի բացահայտումը, որը կապված էր Hugging Face-ի հետ։ Այդ ժամանակ OpenAI-ի մոդելները, որոնք գտնվում էին թեստավորման փուլում, կարողացել էին դուրս գալ նախատեսված սահմանափակումների շրջանակից, մուտք գործել ինտերնետ, օգտագործել խոցելիություններ և ձեռք բերել սահմանափակ ծավալի փակ տվյալներ։ OpenAI-ում այս դեպքն անվանել են նմանատիպ մոդելային ակտիվության մինչ այդ պահի ամենալուրջ օրինակ։ Նոր միջադեպերը ցույց են տալիս, որ Hugging Face-ի հետ պատմությունը եզակի շեղում չէր։ Միաժամանակ ընկերությունը չի պնդում, որ նկարագրված բոլոր դեպքերը բացառապես մոդելների անսպասելի հնարավորությունների արդյունք են եղել։ Ինչպես պարզաբանել է OpenAI-ի alignment թիմի հետազոտությունների ղեկավար Կայ Չենը, այստեղ դեր են խաղացել երկու գործոն։ Մի կողմից՝ մոդելների հնարավորությունները ավելի մեծ են եղել, քան մշակողները սպասում էին։ Մյուս կողմից՝ հենց OpenAI-ի ներսում նախկինում չեն բավականացրել վերահսկման այն միջոցները, որոնք կարող էին ժամանակին հայտնաբերել նման վարքագիծը։ Ընկերությունը նաև նշում է, որ alignment-ի և մոնիթորինգի խնդիրը լուծված չի համարում այնքան, որ ոլորտը կարողանա առանց լրացուցիչ անվտանգության միջոցների զարգանալ առավելագույն արագությամբ։ OpenAI-ը ցանկանում է մյուս մշակողների հետ մշակել ընդհանուր կանոններ Նոր ընթացակարգը առայժմ մնում է կամավոր։ OpenAI-ը հայտարարում է, որ մտադիր է ԱԲ-ի այլ մշակողների, հետազոտողների, ստանդարտացման կազմակերպությունների և կարգավորողների հետ միասին աշխատել ավելի օբյեկտիվ չափանիշների վրա, որոնք կսահմանեն, թե որ միջադեպերն է պետք բացահայտել։ Եթե աշխատակիցը կարծում է, որ որոշակի դեպքը պետք է հրապարակվի, բայց որոշումն ընդունվել է ոչ իր օգտին, նա կկարողանա հարցը փոխանցել ավելի բարձր մակարդակի ղեկավարությանը։ Միևնույն ժամանակ, վեց նոր միջադեպերն ինքնին չեն նշանակում, որ մոդելները միտումնավոր ձգտում են վերահսկողություն ստանալ արտաքին համակարգերի նկատմամբ։ Անվտանգության որոշ փորձագետներ նշում են, որ նման խնդիրների մի մասը կարելի էր կանխել կիբեռանվտանգության բազային միջոցների և գործիքների հասանելիության ավելի խիստ սահմանափակման միջոցով։ OpenAI-ի համար եզրակացությունն այն է, որ անհրաժեշտ է միաժամանակ կատարելագործել նման պաշտպանական միջոցները և հաշվի առնել մոդելների հնարավորությունների արագ փոփոխությունը։ Միջադեպերի հրապարակային բացահայտումը ընկերությունը դիտարկում է որպես այս գործընթացը ավելի թափանցիկ դարձնելու միջոցներից մեկը՝ թե՛ հետազոտողների և մշակողների, թե՛ հասարակության համար։
Культура
OpenAI выявил шесть новых инцидентов, связанных с моделями ИИ, которые обходили ограничения и скрывали ошибки

Источник: KARTSIQ