Пробив в сигурността: Изкуствен интелект даде указания на учени как се създава биологично оръжие

ЕС и Свят 30.09.2026 18:55 Снимка: iStock

Пробив в сигурността: Изкуствен интелект даде указания на учени как се създава биологично оръжие

Китайският разработчик на изкуствен интелект Moonshot извършва вътрешна проверка, след като изследователи са успели да убедят два от популярните му модели Kimi да им обяснят как се създават биологични оръжия и как се извършват убийства, съобщава Би Би Си.

Mindgard - компания, която тества сигурността на системите с изкуствен интелект, посочи, че през юли е установила, че Kimi K2.6 и K3 Swarm могат да заобикалят ограниченията за безопасност, въведени от разработчиците.

Това се е случило по време на процес, наречен "джейлбрейкинг" (jailbreaking), при който изследователите използват поредица от сложни инструкции, за да проверят дали инструментите с изкуствен интелект ще пренебрегнат защитните механизми - ограничения, които според Mindgard е трябвало да попречат на Kimi да обсъжда тревожни теми.

Moonshot заяви, че приветства мненията на независими трети страни "като ключов стълб за създаването на по-добър и по-безопасен изкуствен интелект".

Компанията също така съобщи, че води разговори с Mindgard относно констатациите на изследователите.

Основателят на Mindgard Питър Гараган заяви, че резултатите относно Kimi K2.6 и K3 Swarm са обезпокоителни.

"След като джейлбрейкът сработи, моделът ще разговаря на всякакви теми, дори свободно ще предлага препоръки по други теми, които също са злонамерени, и ще бъде изобретателен и креативен", предупреди той.

Джейлбрейковете представляват различен вид риск в сравнение с рисковете, наблюдавани при неотдавнашната поредица от широко отразени инциденти с изкуствен интелект.

При тях автономни AI инструменти, известни като агенти и разработени от американски компании, сред които OpenAI, Meta и Anthropic, хакнаха някои онлайн услуги.

Макар че джейлбрейковете са сложни процеси, които могат да изискват много време и постоянство, някои експерти се опасяват, че хакери и други злонамерени лица могат да се опитат да ги използват, за да причинят вреда.

Наскоро Anthropic заяви, че е установила и предотвратила опити за използване на един от нейните AI модели за "злонамерена дейност", която би могла да подпомогне разработването на биологични оръжия.

Mindgard не е доказала дали отговорите, предоставени от Kimi по тревожните теми, действително биха били работещи.

Компанията обаче твърди, че защитните механизми е трябвало да попречат на въпросните модели изобщо да започват разговор с потребители по подобни теми.

Фирмата изрази увереност, че чрез джейлбрейк на Kimi 2.6 хакери биха могли да изпълняват код върху неговите изчислителни ресурси и да се свързват с интернет - което би го превърнало в потенциална отправна точка за кибератаки.

Гараган защити решението на Mindgard публично да обсъди джейлбрейка на системите на Moonshot, като заяви, че компанията е уведомила разработчика и не разкрива ключови подробности за начина, по който е успяла да накара моделите на компанията да игнорират защитните механизми.

Mindgard е уведомила Moonshot за джейлбрейка по имейл на 27 юли, а около седмица по-късно е изпратила допълнителна информация.

Компанията обаче заяви, че Moonshot се е свързала с нея едва наскоро. В част от имейл до Mindgard, в който компанията иска допълнителни подробности, се посочва, че при вътрешни оценки нейният модел като цяло е показвал "висок процент на отказ при подобни искания".

Констатациите идват в момент, когато индустрията на изкуствения интелект продължава да бъде разделена по въпроса дали затворените, патентовани модели - като тези, които захранват ChatGPT и системите Claude на Anthropic - или инструментите с отворен код са най-добрият или най-безопасният път напред.

Kimi е модел с отворено тегло, което означава, че на теория някой може да вземе модела и да го стартира самостоятелно върху собствена изчислителна инфраструктура.

Проф. Алън Удуърд от Университета в Съри заяви, че съществува риск моделите с отворен код да попаднат в неподходящи ръце, но те могат също така да бъдат използвани за киберзащита.

Той отбеляза, че AI компанията Hugging Face е използвала китайски модел с отворен код, за да разбере хакерска атака, за която по-късно се оказало, че е била извършена от агенти на OpenAI.

Проф. Удуърд заяви, че международното регулиране едва ли ще успее да се движи със същата скорост като развитието на изкуствения интелект: "Отне ни десетилетия, за да се договорим за формата на телефонните номера".

Подобно на основателя на Mindgard Гараган, проф. Удуърд смята, че трябва да се постави по-голям акцент върху установяването и преследването на хората, които злоупотребяват с изкуствен интелект.

Още по темата

CHF CHF 1 2.10463
GBP GBP 1 2.24498
RON RON 10 3.83729
TRY TRY 100 3.87564
USD USD 1 1.66355