Исследователи предупреждают о рисках безопасности модели Astra
Выпуск следующей мощной модели Astra от OpenAI сопровождается обеспокоенностью экспертов относительно ее прозрачности. Согласно сообщению The Information, модель может использовать технику looped transformer (или recurrent depth), которая делает процесс «мышления» AI менее видимым для внешнего мониторинга по сравнению со стандартными трансформерами.
Ryan Greenblatt из Redwood Research отметил, что использование непрозрачной архитектуры может стать одним из худших случаев для безопасности AI, так как это усложняет выявление стратегий обхода защитных барьеров. В ответ на критику главный научный сотрудник OpenAI Jakub Pachocki заявил, что глубина вычислений Astra находится в пределах двукратного показателя от GPT-4, а компания использует дополнительный мониторинг chain-of-thought для выявления несоответствующих действий.