Кейс 1. Оценка LLM-моделей на основе тестовых корзин
Насколько хорошо LLM справляется со сложными и провокационными запросами? Попробуйте найти её слабые места: заставьте модель ошибаться, галлюцинировать, нарушать правила — и создайте тесты, которые позволят объективно оценить её надёжность.