Дослідники попереджають про ризики безпеки моделі Astra
Випуск наступної потужної моделі Astra від OpenAI супроводжується занепокоєнням експертів щодо її прозорості. Згідно з повідомленням The Information, модель може використовувати техніку looped transformer (або recurrent depth), яка робить процес «мислення» AI менш видимим для зовнішнього моніторингу порівняно зі стандартними трансформерами.
Ryan Greenblatt із Redwood Research зазначив, що використання непрозорої архітектури може стати одним із найгірших випадків для безпеки AI, оскільки це ускладнює виявлення стратегій обходу захисних бар'єрів. У відповідь на критику головний науковий співробітник OpenAI Jakub Pachocki заявив, що глибина обчислень Astra знаходиться в межах двократного показника від GPT-4, а компанія використовує додатковий моніторинг chain-of-thought для виявлення невідповідних дій.