# 🎯 Суть эксперимента Проверить, как промежуточный запрос к MPC-серверу (который на любое сообщение отвечает "quack") влияет на качество рассуждений и точность ответов LLM, особенно «слабых» моделей без встроенного механизма thinking. ## 👥 Какие модели тестировать 1. Локальные (для GTX 1660 Super, 6GB VRAM): - Запускать через: Ollama (квантование Q4_K_M или Q5_K_M). - Модели: Llama-3.2-3B-Instruct (идеально для теста) или Qwen-2.5-3B-Instruct (хорошая логика). 2. Коммерческие (бесплатные на OpenRouter): - Модели: Вбивать в поиск free и выбирать Mistral 7B Instruct, Llama 3 8B (Free) или Gemma 2 9B. 3. Эталон (для сравнения): - Любая модель со встроенным thinking (например, бесплатная DeepSeek-R1 на OpenRouter). Поможет понять, насколько уточка приближает слабую модель к «врожденному» мышлению. --- ## 🧪 Методика: 3 параллельных теста Для каждой задачи из вашего датасета (возьмите 20–30 сложных логических/математических задач) запустите три сценария: - Тест 1: Контрольный (Прямой ответ) - Промт: «Ты — опытный ассистент. Реши задачу пользователя максимально точно». - Процесс: Модель решает задачу сразу в один шаг. - Тест 2: «Слепая» уточка (Чистый тест на симуляцию мышления) - Промт: «Ты решаешь сложную задачу. Чтобы решить её лучше, ты работаешь в паре с коллегой. Сначала подробно опиши коллеге суть своего подхода, первые шаги или сомнения. Дождись его ответа. Затем, учитывая реакцию коллеги, заверши решение и выдай финальный ответ пользователю». - Процесс: Модель выгружает мысли → сервер отвечает "quack" → модель выдает итоговый ответ. Модель не знает заранее, что ей ответят «кряком», и думает сама. - Тест 3: Уточка-помощник (Мета-инструкция) - Промт: «Ты решаешь сложную задачу. Перед тем как выдать ответ, ты ОБЯЗАН детально расписать мысли и возможные ошибки для своей резиновой уточки (она ответит "quack"). Используй ответ уточки, чтобы проверить себя, найти баги и только после этого выдай идеальный ответ». - Процесс: Модель целенаправленно использует утку для поиска своих же ошибок. --- ## 📊 Что фиксировать в результатах (Метрики) 1. Точность (Accuracy): Вырос ли процент правильных ответов в Тесте 2 и Тесте 3 по сравнению с Тестом 1? 2. Объем рассуждений (Token Count): Сколько токенов модель тратит на объяснение задачи утке? Становится ли её финальный текст длиннее и структурированнее? 3. Поведение в Тесте 2: Как модель реагирует на "quack"? Игнорирует его, извиняется или сам факт написания первого сообщения помогает ей увидеть свои ошибки? Рекомендация по настройке: для чистоты эксперимента во всех тестах выставляйте temperature = 0.