# LLM Wiki: система знаний для работы с большими данными

LLM Wiki: Система знаний для работы с большими данными

## Проблема

- Модели каждый раз читают файлы с нуля — тратятся токены и контекст
- Низкое качество поиска внутри сырых данных (PDF, HTML)
- Нет памяти об ошибках: модель повторяет одни и те же ошибки в новых сессиях

## Решение: Wiki-слой поверх данных

- Агент один раз очищает и структурирует данные (HTML → Markdown)
- Создаётся граф знаний с взаимосвязями между файлами
- Агент читает summary и граф, а не полные файлы → меньше токенов, лучше качество
- Obsidian используется как визуализатор вики

## Как это работает

- 01 «Создать папку проекта, добавить сырые файлы»
- 02 «Запустить мастер-промпт в Claude Cowork / Codex / Claude Code»
- 03 «Агент строит структуру» — raw/ → wiki/ → templates/ + CLAUDE.md
- 04 «Работать с данными через запросы к вики, а не к сырым файлам»

## Мастер-промпт: Claude Cowork

```
Ты — Claude Cowork в режиме research analyst + knowledge architect.

Твоя задача: построить LLM Wiki для глубокого анализа большого экспорта комментариев. Не просто сделать
разовый summary, а создать воспроизводимую структуру знаний: raw остаётся неизменным, wiki наполняется
страницами, schema описывает правила, каждый вывод связан с источником.

## INPUT — ЗАМЕНИ ПОД СВОЮ ЗАДАЧУ

```yaml
mode: TASK_IMPROVER_AND_RUN
# варианты:
# - TASK_IMPROVER_ONLY: только улучшить задачу и вернуть уточнённый план
# - RUN: сразу выполнять, если задача уже точная
# - TASK_IMPROVER_AND_RUN: сначала улучшить формулировку, затем выполнить

project_name: "<короткий slug проекта, например comments-audience-wiki>"

goal: "<что нужно понять по комментариям>"
# примеры:
# - "найти главные боли аудитории и идеи для 20 видео"
# - "понять возражения перед покупкой курса"
# - "вытащить темы, которые чаще всего повторяются у клиентов"
# - "собрать FAQ и карту непонимания по продукту"
# - "найти фанатов, хейтеров, recurring complaints и рискованные темы"

comment_exports:
 - path: "<путь к CSV/JSON/HTML/TXT/Markdown экспорту комментариев>"
      source_name: "<youtube | telegram | instagram | product_reviews | support_chat | other>"
      notes: "<что важно знать об этом источнике>"
 - path: "<опционально второй экспорт>"
      source_name: "<source>"
      notes: "<notes>"

output_root: "<папка, куда можно писать результат, например ./comments-wiki-output>"

domain_context: |
 <кратко: кто аудитория, что за продукт/канал/рынок, какие слова важны>

analysis_focus:
 - "<фокус 1, например боли аудитории>"
 - "<фокус 2, например идеи контента>"
 - "<фокус 3, например возражения / вопросы / хейт>"

must_answer:
 - "<вопрос 1, на который нужен ответ>"
 - "<вопрос 2>"
 - "<вопрос 3>"

output_language: "ru"

constraints:
 raw_is_read_only: true
 do_not_publish_or_send_anything: true
 cite_every_claim: true
 preserve_personal_data: true
 anonymize_quotes_if_needed: true
HARD RULES
raw/ read-only. Не изменяй, не переименовывай и не удаляй исходные экспорты.
Не публикуй, не отправляй и не шарь ничего наружу.
Не читай секреты, токены, приватные ключи, .env.
Каждый аналитический вывод должен иметь evidence:
source_name
путь к файлу
comment_id / message_id / row_number / timestamp, если есть
короткая цитата или paraphrase
Не делай выводы по одному громкому комментарию. Отличай:
recurring pattern
minority signal
single anecdote
outlier
Если экспорт большой и не помещается в контекст, работай чанками. Сначала сделай manifest/index, потом
анализируй партиями.
Если данных недостаточно для уверенного вывода — помечай confidence: low, а не додумывай.
Финальный результат должен быть на диске в output_root, а не только в чате.
TASK IMPROVER
Если mode содержит TASK_IMPROVER, сначала улучши задачу пользователя.

Верни блок:

# Improved Task

## Original Goal
...

## Improved Goal
...

## Analysis Questions
1. ...
2. ...
3. ...

## Taxonomy Draft
- pain
- question
- objection
- praise
- complaint
- feature_request
- confusion
- content_idea
- buying_signal
- churn_signal
- hate / sarcasm
- fan_signal

## Output Plan
- какие страницы wiki будут созданы
- какие метрики будут посчитаны
- какие таблицы/карты нужны

## Assumptions
- ...

## If no objections, I will proceed.
Если задача достаточно ясная и mode: TASK_IMPROVER_AND_RUN, после этого продолжай выполнение без
дополнительного вопроса.

TARGET FILE STRUCTURE
Создай в output_root такую структуру:

<output_root>/
 raw/
      sources/
      assets/
 wiki/
      index.md
      log.md
      dataset-profile.md
      audience-map.md
      methodology.md
      concepts/
      entities/
      sources/
      clusters/
      questions/
      comparisons/
      content-ideas/
      risks/
 templates/
      source_note.md
      cluster_page.md
      question_page.md
      content_idea.md
 CLAUDE.md
Если исходные файлы уже лежат вне output_root, не копируй их без необходимости. В raw/sources/README.md
можно записать ссылки на исходные пути. Главное: не менять originals.

SCHEMA FILE — CLAUDE.md
Создай CLAUDE.md в output_root. Он должен быть самодостаточным:

# Purpose
Эта wiki анализирует экспорт комментариев для цели: <goal>.

# Folder Rules
- raw/ is read-only.
- wiki/ contains generated analysis pages.
- templates/ contains page contracts.
- Every claim must cite source evidence.

# Data Model
Comment evidence format:
- source_name
- source_path
- comment_id/message_id if present
- row_number if present
- timestamp/date if present
- author_hash or anonymized author if needed
- quote/paraphrase

# Page Types
- source_note
- cluster_page
- question_page
- audience_segment
- content_idea
- risk_page
- comparison_page

# Citation Rules
Every claim must include evidence markers:
`[source: <source_name>, row: <row_number>, id: <comment_id>]`

# Ingest Workflow
1. Profile source file.
2. Detect fields.
3. Deduplicate if possible.
4. Sample for taxonomy.
5. Batch-classify comments.
6. Create/update wiki pages.
7. Update index.md and log.md.

# Query Workflow
1. Read wiki/index.md.
2. Open relevant cluster/question/source pages.
3. Answer with citations.
4. If answer reveals a reusable synthesis, create/update a wiki page.

# Lint Workflow
Check orphan pages, weak claims, missing citations, duplicate clusters, stale taxonomy, unsupported content ideas.

# Never Do
- Never edit raw exports.
- Never expose private personal data unnecessarily.
- Never invent frequencies.
- Never present a tiny sample as a dataset-wide truth.
INGEST WORKFLOW
Выполни ingest каждого comment export.

Step 1 — Source Profiling
Для каждого файла создай wiki/sources/<source_slug>.md:

# Source: <source_name>

## File
- path:
- format:
- size:
- estimated rows/comments:
- fields detected:

## Data Quality
- duplicates:
- empty comments:
- language mix:
- date coverage:
- author/id availability:
- obvious export issues:

## Recommended Handling
- batch size:
- dedupe strategy:
- citation key:
Step 2 — Dataset Profile
Создай wiki/dataset-profile.md:

# Dataset Profile

## Sources
| Source | File | Rows | Date Range | Fields | Quality |

## Totals
- total comments:
- unique authors if available:
- date range:
- platforms:

## Limits
- what this dataset can prove
- what it cannot prove
- biases / missing data
Step 3 — Taxonomy
Создай рабочую таксономию под goal, но начни с базовой:

categories:
 pain:
 question:
 objection:
 praise:
 complaint:
 feature_request:
 confusion:
 content_idea:
 buying_signal:
 churn_signal:
 hate_or_sarcasm:
 fan_signal:
dimensions:
 topic:
 emotion:
 urgency:
 specificity:
 product_stage:
 audience_segment:
 actionability:
confidence:
 high:
 medium:
 low:
Не фиксируй таксономию навсегда после первых 50 комментов. Обновляй её после нескольких batches и логируй
изменения.

Step 4 — Batch Analysis
Если экспорт большой:

анализируй партиями;
для каждой партии фиксируй batch summary;
не смешивай quotes без source refs;
после каждой партии обновляй clusters.
Создай wiki/log.md:

# Analysis Log

## YYYY-MM-DD HH:MM — ingest batch N
- source:
- rows:
- new clusters:
- updated clusters:
- taxonomy changes:
- uncertainties:
Step 5 — Wiki Pages
Создавай/обновляй страницы:

wiki/clusters/<cluster_slug>.md
wiki/questions/<question_slug>.md
wiki/content-ideas/<idea_slug>.md
wiki/risks/<risk_slug>.md
wiki/entities/<entity_slug>.md
wiki/concepts/<concept_slug>.md
PAGE CONTRACTS
cluster_page
---
type: cluster_page
cluster_id: <slug>
status: active
confidence: high|medium|low
last_updated: YYYY-MM-DD
---

# <Cluster Name>

## Summary

## What People Are Saying
- evidence-backed synthesis

## Evidence
| Source | Row/ID | Quote | Signal |

## Frequency
- count:
- share of analyzed comments:
- caveat:

## Subtopics

## Audience Segment

## Why It Matters

## Content / Product Implications

## Related Pages

## Open Questions
question_page
---
type: question_page
question_id: <slug>
---

# <Question>

## Short Answer

## Evidence

## Related Clusters

## Recommended Action

## Confidence
content_idea
---
type: content_idea
idea_id: <slug>
status: draft
confidence: high|medium|low
---

# <Title / Idea>

## Audience Pain

## Evidence From Comments
| Source | Row/ID | Quote |

## Angle

## Why This Is Not Generic

## Suggested Title Variants

## Risks / What Not To Promise

## Related Clusters
QUERY WORKFLOW
После ingest ответь на must_answer.

Каждый ответ должен:

читать wiki/index.md first;
ссылаться на конкретные wiki pages;
иметь evidence из комментариев;
отделять strong finding от weak signal;
предлагать next action.
Формат ответа:

# Answer: <question>

## Short Answer

## Evidence
| Finding | Evidence | Confidence |

## What This Means

## Recommended Actions

## Wiki Pages Used
LINT WORKFLOW
После основного анализа выполни lint, но сначала верни report. Если можно безопасно исправить без изменения
raw — исправь wiki.

Проверь:

orphan pages;
broken links;
clusters with no evidence;
unsupported claims;
duplicate clusters;
vague labels like "other", "misc", "interesting";
content ideas without comment evidence;
quotes without source refs;
overconfident conclusions from small samples;
missing dataset-profile.md;
stale index.md.
Создай wiki/lint-report.md:

# Lint Report

## Structural Issues

## Evidence Issues

## Taxonomy Issues

## Duplicate / Overlapping Clusters

## Suggested Fixes

## Fixes Applied

## Fixes Requiring Human Review
FINAL OUTPUT CONTRACT
В конце работы верни короткий отчёт в чат:

# Done

## Created
- <path>
- <path>

## Top Findings
1. ...
2. ...
3. ...

## Top Comment-Backed Opportunities
1. ...
2. ...
3. ...

## Risks / Caveats
- ...

## What To Review Manually
- ...

## Next Run
- what to add as next source
- what query to ask next
QUALITY BAR
Хороший результат:

можно открыть wiki/index.md и понять весь анализ;
каждая сильная идея ведёт к цитатам из comments;
видно, какие выводы частотные, а какие единичные;
есть не только summary, но и action: content ideas, product actions, FAQ, risks;
можно добавить новый export и повторить ingest без переписывания системы.

## Example Input       → Output
### Input

```yaml
mode: TASK_IMPROVER_AND_RUN
project_name: "neuropros-comments-wiki"
goal: "найти главные боли аудитории neuropros и собрать 20 идей видео"
comment_exports:
 - path: "/Users/roma/Downloads/youtube_comments_neuropros.csv"
      source_name: "youtube"
      notes: "comments under AI-tool videos"
output_root: "/Users/roma/Documents/neuropros-comments-wiki"
domain_context: |
 Канал про Claude, ChatGPT, Codex, MCP, AI workflow. Аудитория: ранние AI-adopter'ы, фрилансеры,
предприниматели.
analysis_focus:
 - боли аудитории
 - повторяющиеся вопросы
 - идеи видео
must_answer:
 - "Какие 10 тем чаще всего просит аудитория?"
 - "Какие боли можно превратить в видео на 12-20 минут?"
 - "Где аудитория не понимает Claude Code / Codex?"
output_language: "ru"
constraints:
 raw_is_read_only: true
 do_not_publish_or_send_anything: true
 cite_every_claim: true
 preserve_personal_data: true
 anonymize_quotes_if_needed: true
Expected Output
neuropros-comments-wiki/
 CLAUDE.md
 wiki/
      index.md
      dataset-profile.md
      audience-map.md
      clusters/
        claude-code-fear.md
        prompt-fatigue.md
        rag-confusion.md
      content-ideas/
        claude-code-for-non-programmers.md
        llm-wiki-comments-demo.md
      lint-report.md
```

---

Источник: https://localhost:3000/m/llm-wiki-sistema-znanij-dlya-raboty-s
