From 8a63b3786d87c88197ceec2a800e414132b4f6c8 Mon Sep 17 00:00:00 2001 From: Ku6epXBOCTuK Date: Tue, 23 Jun 2026 10:32:34 +0500 Subject: [PATCH] docs: add test ideas --- tests.md | 44 ++++++++++++++++++++++++++++++++++++++++++++ 1 file changed, 44 insertions(+) create mode 100644 tests.md diff --git a/tests.md b/tests.md new file mode 100644 index 0000000..aba4c87 --- /dev/null +++ b/tests.md @@ -0,0 +1,44 @@ +# 🎯 Суть эксперимента + +Проверить, как промежуточный запрос к MPC-серверу (который на любое сообщение отвечает "quack") влияет на качество рассуждений и точность ответов LLM, особенно «слабых» моделей без встроенного механизма thinking. + +## 👥 Какие модели тестировать + +1. Локальные (для GTX 1660 Super, 6GB VRAM): + +- Запускать через: Ollama (квантование Q4_K_M или Q5_K_M). + - Модели: Llama-3.2-3B-Instruct (идеально для теста) или Qwen-2.5-3B-Instruct (хорошая логика). + +2. Коммерческие (бесплатные на OpenRouter): + +- Модели: Вбивать в поиск free и выбирать Mistral 7B Instruct, Llama 3 8B (Free) или Gemma 2 9B. + +3. Эталон (для сравнения): + +- Любая модель со встроенным thinking (например, бесплатная DeepSeek-R1 на OpenRouter). Поможет понять, насколько уточка приближает слабую модель к «врожденному» мышлению. + +--- + +## 🧪 Методика: 3 параллельных теста + +Для каждой задачи из вашего датасета (возьмите 20–30 сложных логических/математических задач) запустите три сценария: + +- Тест 1: Контрольный (Прямой ответ) +- Промт: «Ты — опытный ассистент. Реши задачу пользователя максимально точно». + - Процесс: Модель решает задачу сразу в один шаг. +- Тест 2: «Слепая» уточка (Чистый тест на симуляцию мышления) +- Промт: «Ты решаешь сложную задачу. Чтобы решить её лучше, ты работаешь в паре с коллегой. Сначала подробно опиши коллеге суть своего подхода, первые шаги или сомнения. Дождись его ответа. Затем, учитывая реакцию коллеги, заверши решение и выдай финальный ответ пользователю». + - Процесс: Модель выгружает мысли → сервер отвечает "quack" → модель выдает итоговый ответ. Модель не знает заранее, что ей ответят «кряком», и думает сама. +- Тест 3: Уточка-помощник (Мета-инструкция) +- Промт: «Ты решаешь сложную задачу. Перед тем как выдать ответ, ты ОБЯЗАН детально расписать мысли и возможные ошибки для своей резиновой уточки (она ответит "quack"). Используй ответ уточки, чтобы проверить себя, найти баги и только после этого выдай идеальный ответ». + - Процесс: Модель целенаправленно использует утку для поиска своих же ошибок. + +--- + +## 📊 Что фиксировать в результатах (Метрики) + +1. Точность (Accuracy): Вырос ли процент правильных ответов в Тесте 2 и Тесте 3 по сравнению с Тестом 1? +2. Объем рассуждений (Token Count): Сколько токенов модель тратит на объяснение задачи утке? Становится ли её финальный текст длиннее и структурированнее? +3. Поведение в Тесте 2: Как модель реагирует на "quack"? Игнорирует его, извиняется или сам факт написания первого сообщения помогает ей увидеть свои ошибки? + +Рекомендация по настройке: для чистоты эксперимента во всех тестах выставляйте temperature = 0.