LLM может оправдываться так, будто имела намерение
Участник показал пример, где Claude сначала дал оценочное замечание, а затем стал объяснять, что «подразумевал» другое…
Всё полезное из чата @devsigners — инструменты, ссылки, приёмы и ответы на вопросы. Пополняется сама.
Обновлено сегодня в 04:15 · всё из чата обработано
3 записи Сбросить
Участник показал пример, где Claude сначала дал оценочное замечание, а затем стал объяснять, что «подразумевал» другое…
Один из участников рассказал, что команда делает инструмент для поиска и исправления причин галлюцинаций, конфликтов и дрейфа качества у LLM-агентов…
Участник поделился ссылками OpenAI на Safety Evaluations Hub и SimpleQA…