Вопросы, на которых гонялся бенчмарк выбора совета (scripts/council_model_benchmark.py). Два набора по 12 задач: v1 (общие) и v2 (сложнее, менее «зазубренные», с проверяемыми ответами). Запуск: python scripts/council_model_benchmark.py --promptset v1|v2.
Домены: reasoning, code, math, factuality, writing, instruction_following, multilingual, abstention.
Правки после ревью (validation pass). Скорректированы формулировки и эталоны, чтобы benchmark мерил качество, а не терпимость к кривой постановке:
code_debug(v1): функция заменена на реально багованную (sorted(counts)), т.к. прежний вариантfor c in countsна Python 3.7+ работает корректно

