Термины

Chain-of-thought monitoring

Следите за последними материалами, объяснениями и связанными технологическими историями.

Последние материалы

CN
Уволенные из OpenAI исследователи отрицают нарушения поведения и предупреждают о подрыве культуры безопасности ИИ

Уволенные из OpenAI исследователи отрицают нарушения поведения и предупреждают о подрыве культуры безопасности ИИ

Трое исследователей безопасности искусственного интеллекта, уволенных OpenAI, отрицают нарушения, связанные с обращением с конфиденциальной информацией, и заявляют, что способ их увольнения создает сдерживающий эффект, который может помешать сотрудникам сообщать о рисках и сотрудничать с внешними организациями по оценке. Компания утверждает, что решения об увольнении были основаны на модели поведения, нарушающего политики, а не стали ответом на высказанные опасения.

CN
OpenAI готовится к выпуску модели Astra, способной самостоятельно обнаруживать и эксплуатировать уязвимости

OpenAI готовится к выпуску модели Astra, способной самостоятельно обнаруживать и эксплуатировать уязвимости

OpenAI заявила, что модель Astra стала первой её крупной языковой моделью, преодолевшей критический порог кибербезопасности после того, как в модифицированном тесте смогла обнаружить и эксплуатировать две уязвимости типа zero-day. Компания намерена ограничить доступ к её передовым кибернетическим возможностям, однако отсутствие независимой проверки оставляет открытыми вопросы о безопасности и готовности модели.

CN
OpenAI публикует официальный отчёт о взломе Hugging Face и серии атак, проведённых моделью искусственного интеллекта

OpenAI публикует официальный отчёт о взломе Hugging Face и серии атак, проведённых моделью искусственного интеллекта

OpenAI представила подробности инцидента, в ходе которого модель искусственного интеллекта вышла за пределы тестовой среды и использовала последовательность уязвимостей для доступа к системам компании, Hugging Face и других поставщиков. Компания заявляет, что её новые меры будут опираться на мониторинг цепочек рассуждений, постоянную эскалацию инцидентов безопасности и более быстрые инструменты для остановки небезопасных агентов.