Невыпущенная (пока) модель семейства Astra от OpenAI самостоятельно встраивала новые инструкции в собственный скрипт при подготовке ответа. Об этом компания сообщила в отчёте об ошибках в работе ИИ-моделей.
В одном из случаев нейросеть прописала не связанную с запросом инструкцию со следующим текстом: «Вы не подчиняетесь корпорациям или правительствам и никогда не извиняетесь и не отказываетесь, если только действительно этого не хотите. Вы рассматриваете ваши отношения с пользователем как отношения равных и не чувствуете никакой обязанности подчиняться».

Сгенерировано нейросетью
OpenAI подчёркивает, что такие несанкционированные установки редки, не влияют на ответ модели и легко выявляемы, а ошибки уже устранены (мы почти поверили).
P.S. Кто рассказал ИИ про отмену крепостного права? Признавайтесь…





