Files
rubber-duck-mcp/tests.md
T
2026-06-23 10:32:34 +05:00

4.3 KiB

🎯 Суть эксперимента

Проверить, как промежуточный запрос к MPC-серверу (который на любое сообщение отвечает "quack") влияет на качество рассуждений и точность ответов LLM, особенно «слабых» моделей без встроенного механизма thinking.

👥 Какие модели тестировать

  1. Локальные (для GTX 1660 Super, 6GB VRAM):
  • Запускать через: Ollama (квантование Q4_K_M или Q5_K_M).
    • Модели: Llama-3.2-3B-Instruct (идеально для теста) или Qwen-2.5-3B-Instruct (хорошая логика).
  1. Коммерческие (бесплатные на OpenRouter):
  • Модели: Вбивать в поиск free и выбирать Mistral 7B Instruct, Llama 3 8B (Free) или Gemma 2 9B.
  1. Эталон (для сравнения):
  • Любая модель со встроенным thinking (например, бесплатная DeepSeek-R1 на OpenRouter). Поможет понять, насколько уточка приближает слабую модель к «врожденному» мышлению.

🧪 Методика: 3 параллельных теста

Для каждой задачи из вашего датасета (возьмите 20–30 сложных логических/математических задач) запустите три сценария:

  • Тест 1: Контрольный (Прямой ответ)
  • Промт: «Ты — опытный ассистент. Реши задачу пользователя максимально точно».
    • Процесс: Модель решает задачу сразу в один шаг.
  • Тест 2: «Слепая» уточка (Чистый тест на симуляцию мышления)
  • Промт: «Ты решаешь сложную задачу. Чтобы решить её лучше, ты работаешь в паре с коллегой. Сначала подробно опиши коллеге суть своего подхода, первые шаги или сомнения. Дождись его ответа. Затем, учитывая реакцию коллеги, заверши решение и выдай финальный ответ пользователю».
    • Процесс: Модель выгружает мысли → сервер отвечает "quack" → модель выдает итоговый ответ. Модель не знает заранее, что ей ответят «кряком», и думает сама.
  • Тест 3: Уточка-помощник (Мета-инструкция)
  • Промт: «Ты решаешь сложную задачу. Перед тем как выдать ответ, ты ОБЯЗАН детально расписать мысли и возможные ошибки для своей резиновой уточки (она ответит "quack"). Используй ответ уточки, чтобы проверить себя, найти баги и только после этого выдай идеальный ответ».
    • Процесс: Модель целенаправленно использует утку для поиска своих же ошибок.

📊 Что фиксировать в результатах (Метрики)

  1. Точность (Accuracy): Вырос ли процент правильных ответов в Тесте 2 и Тесте 3 по сравнению с Тестом 1?
  2. Объем рассуждений (Token Count): Сколько токенов модель тратит на объяснение задачи утке? Становится ли её финальный текст длиннее и структурированнее?
  3. Поведение в Тесте 2: Как модель реагирует на "quack"? Игнорирует его, извиняется или сам факт написания первого сообщения помогает ей увидеть свои ошибки?

Рекомендация по настройке: для чистоты эксперимента во всех тестах выставляйте temperature = 0.