docs: add test ideas
This commit is contained in:
@@ -0,0 +1,44 @@
|
||||
# 🎯 Суть эксперимента
|
||||
|
||||
Проверить, как промежуточный запрос к MPC-серверу (который на любое сообщение отвечает "quack") влияет на качество рассуждений и точность ответов LLM, особенно «слабых» моделей без встроенного механизма thinking.
|
||||
|
||||
## 👥 Какие модели тестировать
|
||||
|
||||
1. Локальные (для GTX 1660 Super, 6GB VRAM):
|
||||
|
||||
- Запускать через: Ollama (квантование Q4_K_M или Q5_K_M).
|
||||
- Модели: Llama-3.2-3B-Instruct (идеально для теста) или Qwen-2.5-3B-Instruct (хорошая логика).
|
||||
|
||||
2. Коммерческие (бесплатные на OpenRouter):
|
||||
|
||||
- Модели: Вбивать в поиск free и выбирать Mistral 7B Instruct, Llama 3 8B (Free) или Gemma 2 9B.
|
||||
|
||||
3. Эталон (для сравнения):
|
||||
|
||||
- Любая модель со встроенным thinking (например, бесплатная DeepSeek-R1 на OpenRouter). Поможет понять, насколько уточка приближает слабую модель к «врожденному» мышлению.
|
||||
|
||||
---
|
||||
|
||||
## 🧪 Методика: 3 параллельных теста
|
||||
|
||||
Для каждой задачи из вашего датасета (возьмите 20–30 сложных логических/математических задач) запустите три сценария:
|
||||
|
||||
- Тест 1: Контрольный (Прямой ответ)
|
||||
- Промт: «Ты — опытный ассистент. Реши задачу пользователя максимально точно».
|
||||
- Процесс: Модель решает задачу сразу в один шаг.
|
||||
- Тест 2: «Слепая» уточка (Чистый тест на симуляцию мышления)
|
||||
- Промт: «Ты решаешь сложную задачу. Чтобы решить её лучше, ты работаешь в паре с коллегой. Сначала подробно опиши коллеге суть своего подхода, первые шаги или сомнения. Дождись его ответа. Затем, учитывая реакцию коллеги, заверши решение и выдай финальный ответ пользователю».
|
||||
- Процесс: Модель выгружает мысли → сервер отвечает "quack" → модель выдает итоговый ответ. Модель не знает заранее, что ей ответят «кряком», и думает сама.
|
||||
- Тест 3: Уточка-помощник (Мета-инструкция)
|
||||
- Промт: «Ты решаешь сложную задачу. Перед тем как выдать ответ, ты ОБЯЗАН детально расписать мысли и возможные ошибки для своей резиновой уточки (она ответит "quack"). Используй ответ уточки, чтобы проверить себя, найти баги и только после этого выдай идеальный ответ».
|
||||
- Процесс: Модель целенаправленно использует утку для поиска своих же ошибок.
|
||||
|
||||
---
|
||||
|
||||
## 📊 Что фиксировать в результатах (Метрики)
|
||||
|
||||
1. Точность (Accuracy): Вырос ли процент правильных ответов в Тесте 2 и Тесте 3 по сравнению с Тестом 1?
|
||||
2. Объем рассуждений (Token Count): Сколько токенов модель тратит на объяснение задачи утке? Становится ли её финальный текст длиннее и структурированнее?
|
||||
3. Поведение в Тесте 2: Как модель реагирует на "quack"? Игнорирует его, извиняется или сам факт написания первого сообщения помогает ей увидеть свои ошибки?
|
||||
|
||||
Рекомендация по настройке: для чистоты эксперимента во всех тестах выставляйте temperature = 0.
|
||||
Reference in New Issue
Block a user