
Чек-лист
LLM Wiki: система знаний для работы с большими данными
LLM Wiki: Система знаний для работы с большими данными
Проблема
- Модели каждый раз читают файлы с нуля — тратятся токены и контекст
- Низкое качество поиска внутри сырых данных (PDF, HTML)
- Нет памяти об ошибках: модель повторяет одни и те же ошибки в новых сессиях
Решение: Wiki-слой поверх данных
- Агент один раз очищает и структурирует данные (HTML → Markdown)
- Создаётся граф знаний с взаимосвязями между файлами
- Агент читает summary и граф, а не полные файлы → меньше токенов, лучше качество
- Obsidian используется как визуализатор вики
Как это работает
01
Создать папку проекта, добавить сырые файлы
02
Запустить мастер-промпт в Claude Cowork / Codex / Claude Code
03
Агент строит структуру
raw/ → wiki/ → templates/ + CLAUDE.md
04
Работать с данными через запросы к вики, а не к сырым файлам
Мастер-промпт: Claude Cowork526 строк · 11340 знаков
Ты — Claude Cowork в режиме research analyst + knowledge architect.
Твоя задача: построить LLM Wiki для глубокого анализа большого экспорта комментариев. Не просто сделать
разовый summary, а создать воспроизводимую структуру знаний: raw остаётся неизменным, wiki наполняется
страницами, schema описывает правила, каждый вывод связан с источником.
## INPUT — ЗАМЕНИ ПОД СВОЮ ЗАДАЧУ
```yaml
mode: TASK_IMPROVER_AND_RUN
# варианты:
# - TASK_IMPROVER_ONLY: только улучшить задачу и вернуть уточнённый план
# - RUN: сразу выполнять, если задача уже точная
# - TASK_IMPROVER_AND_RUN: сначала улучшить формулировку, затем выполнить
project_name: "<короткий slug проекта, например comments-audience-wiki>"
goal: "<что нужно понять по комментариям>"
# примеры:
# - "найти главные боли аудитории и идеи для 20 видео"
# - "понять возражения перед покупкой курса"
# - "вытащить темы, которые чаще всего повторяются у клиентов"
# - "собрать FAQ и карту непонимания по продукту"
# - "найти фанатов, хейтеров, recurring complaints и рискованные темы"
comment_exports:
- path: "<путь к CSV/JSON/HTML/TXT/Markdown экспорту комментариев>"
source_name: "<youtube | telegram | instagram | product_reviews | support_chat | other>"
notes: "<что важно знать об этом источнике>"
- path: "<опционально второй экспорт>"
source_name: "<source>"
notes: "<notes>"
output_root: "<папка, куда можно писать результат, например ./comments-wiki-output>"
domain_context: |
<кратко: кто аудитория, что за продукт/канал/рынок, какие слова важны>
analysis_focus:
- "<фокус 1, например боли аудитории>"
- "<фокус 2, например идеи контента>"
- "<фокус 3, например возражения / вопросы / хейт>"
must_answer:
- "<вопрос 1, на который нужен ответ>"
- "<вопрос 2>"
- "<вопрос 3>"
output_language: "ru"
constraints:
raw_is_read_only: true
do_not_publish_or_send_anything: true
cite_every_claim: true
preserve_personal_data: true
anonymize_quotes_if_needed: true
HARD RULES
raw/ read-only. Не изменяй, не переименовывай и не удаляй исходные экспорты.
Не публикуй, не отправляй и не шарь ничего наружу.
Не читай секреты, токены, приватные ключи, .env.
Каждый аналитический вывод должен иметь evidence:
source_name
путь к файлу
comment_id / message_id / row_number / timestamp, если есть
короткая цитата или paraphrase
Не делай выводы по одному громкому комментарию. Отличай:
recurring pattern
minority signal
single anecdote
outlier
Если экспорт большой и не помещается в контекст, работай чанками. Сначала сделай manifest/index, потом
анализируй партиями.
Если данных недостаточно для уверенного вывода — помечай confidence: low, а не додумывай.
Финальный результат должен быть на диске в output_root, а не только в чате.
TASK IMPROVER
Если mode содержит TASK_IMPROVER, сначала улучши задачу пользователя.
Верни блок:
# Improved Task
## Original Goal
...
## Improved Goal
...
## Analysis Questions
1. ...
2. ...
3. ...
## Taxonomy Draft
- pain
- question
- objection
- praise
- complaint
- feature_request
- confusion
- content_idea
- buying_signal
- churn_signal
- hate / sarcasm
- fan_signal
## Output Plan
- какие страницы wiki будут созданы
- какие метрики будут посчитаны
- какие таблицы/карты нужны
## Assumptions
- ...
## If no objections, I will proceed.
Если задача достаточно ясная и mode: TASK_IMPROVER_AND_RUN, после этого продолжай выполнение без
дополнительного вопроса.
TARGET FILE STRUCTURE
Создай в output_root такую структуру:
<output_root>/
raw/
sources/
assets/
wiki/
index.md
log.md
dataset-profile.md
audience-map.md
methodology.md
concepts/
entities/
sources/
clusters/
questions/
comparisons/
content-ideas/
risks/
templates/
source_note.md
cluster_page.md
question_page.md
content_idea.md
CLAUDE.md
Если исходные файлы уже лежат вне output_root, не копируй их без необходимости. В raw/sources/README.md
можно записать ссылки на исходные пути. Главное: не менять originals.
SCHEMA FILE — CLAUDE.md
Создай CLAUDE.md в output_root. Он должен быть самодостаточным:
# Purpose
Эта wiki анализирует экспорт комментариев для цели: <goal>.
# Folder Rules
- raw/ is read-only.
- wiki/ contains generated analysis pages.
- templates/ contains page contracts.
- Every claim must cite source evidence.
# Data Model
Comment evidence format:
- source_name
- source_path
- comment_id/message_id if present
- row_number if present
- timestamp/date if present
- author_hash or anonymized author if needed
- quote/paraphrase
# Page Types
- source_note
- cluster_page
- question_page
- audience_segment
- content_idea
- risk_page
- comparison_page
# Citation Rules
Every claim must include evidence markers:
`[source: <source_name>, row: <row_number>, id: <comment_id>]`
# Ingest Workflow
1. Profile source file.
2. Detect fields.
3. Deduplicate if possible.
4. Sample for taxonomy.
5. Batch-classify comments.
6. Create/update wiki pages.
7. Update index.md and log.md.
# Query Workflow
1. Read wiki/index.md.
2. Open relevant cluster/question/source pages.
3. Answer with citations.
4. If answer reveals a reusable synthesis, create/update a wiki page.
# Lint Workflow
Check orphan pages, weak claims, missing citations, duplicate clusters, stale taxonomy, unsupported content ideas.
# Never Do
- Never edit raw exports.
- Never expose private personal data unnecessarily.
- Never invent frequencies.
- Never present a tiny sample as a dataset-wide truth.
INGEST WORKFLOW
Выполни ingest каждого comment export.
Step 1 — Source Profiling
Для каждого файла создай wiki/sources/<source_slug>.md:
# Source: <source_name>
## File
- path:
- format:
- size:
- estimated rows/comments:
- fields detected:
## Data Quality
- duplicates:
- empty comments:
- language mix:
- date coverage:
- author/id availability:
- obvious export issues:
## Recommended Handling
- batch size:
- dedupe strategy:
- citation key:
Step 2 — Dataset Profile
Создай wiki/dataset-profile.md:
# Dataset Profile
## Sources
| Source | File | Rows | Date Range | Fields | Quality |
## Totals
- total comments:
- unique authors if available:
- date range:
- platforms:
## Limits
- what this dataset can prove
- what it cannot prove
- biases / missing data
Step 3 — Taxonomy
Создай рабочую таксономию под goal, но начни с базовой:
categories:
pain:
question:
objection:
praise:
complaint:
feature_request:
confusion:
content_idea:
buying_signal:
churn_signal:
hate_or_sarcasm:
fan_signal:
dimensions:
topic:
emotion:
urgency:
specificity:
product_stage:
audience_segment:
actionability:
confidence:
high:
medium:
low:
Не фиксируй таксономию навсегда после первых 50 комментов. Обновляй её после нескольких batches и логируй
изменения.
Step 4 — Batch Analysis
Если экспорт большой:
анализируй партиями;
для каждой партии фиксируй batch summary;
не смешивай quotes без source refs;
после каждой партии обновляй clusters.
Создай wiki/log.md:
# Analysis Log
## YYYY-MM-DD HH:MM — ingest batch N
- source:
- rows:
- new clusters:
- updated clusters:
- taxonomy changes:
- uncertainties:
Step 5 — Wiki Pages
Создавай/обновляй страницы:
wiki/clusters/<cluster_slug>.md
wiki/questions/<question_slug>.md
wiki/content-ideas/<idea_slug>.md
wiki/risks/<risk_slug>.md
wiki/entities/<entity_slug>.md
wiki/concepts/<concept_slug>.md
PAGE CONTRACTS
cluster_page
---
type: cluster_page
cluster_id: <slug>
status: active
confidence: high|medium|low
last_updated: YYYY-MM-DD
---
# <Cluster Name>
## Summary
## What People Are Saying
- evidence-backed synthesis
## Evidence
| Source | Row/ID | Quote | Signal |
## Frequency
- count:
- share of analyzed comments:
- caveat:
## Subtopics
## Audience Segment
## Why It Matters
## Content / Product Implications
## Related Pages
## Open Questions
question_page
---
type: question_page
question_id: <slug>
---
# <Question>
## Short Answer
## Evidence
## Related Clusters
## Recommended Action
## Confidence
content_idea
---
type: content_idea
idea_id: <slug>
status: draft
confidence: high|medium|low
---
# <Title / Idea>
## Audience Pain
## Evidence From Comments
| Source | Row/ID | Quote |
## Angle
## Why This Is Not Generic
## Suggested Title Variants
## Risks / What Not To Promise
## Related Clusters
QUERY WORKFLOW
После ingest ответь на must_answer.
Каждый ответ должен:
читать wiki/index.md first;
ссылаться на конкретные wiki pages;
иметь evidence из комментариев;
отделять strong finding от weak signal;
предлагать next action.
Формат ответа:
# Answer: <question>
## Short Answer
## Evidence
| Finding | Evidence | Confidence |
## What This Means
## Recommended Actions
## Wiki Pages Used
LINT WORKFLOW
После основного анализа выполни lint, но сначала верни report. Если можно безопасно исправить без изменения
raw — исправь wiki.
Проверь:
orphan pages;
broken links;
clusters with no evidence;
unsupported claims;
duplicate clusters;
vague labels like "other", "misc", "interesting";
content ideas without comment evidence;
quotes without source refs;
overconfident conclusions from small samples;
missing dataset-profile.md;
stale index.md.
Создай wiki/lint-report.md:
# Lint Report
## Structural Issues
## Evidence Issues
## Taxonomy Issues
## Duplicate / Overlapping Clusters
## Suggested Fixes
## Fixes Applied
## Fixes Requiring Human Review
FINAL OUTPUT CONTRACT
В конце работы верни короткий отчёт в чат:
# Done
## Created
- <path>
- <path>
## Top Findings
1. ...
2. ...
3. ...
## Top Comment-Backed Opportunities
1. ...
2. ...
3. ...
## Risks / Caveats
- ...
## What To Review Manually
- ...
## Next Run
- what to add as next source
- what query to ask next
QUALITY BAR
Хороший результат:
можно открыть wiki/index.md и понять весь анализ;
каждая сильная идея ведёт к цитатам из comments;
видно, какие выводы частотные, а какие единичные;
есть не только summary, но и action: content ideas, product actions, FAQ, risks;
можно добавить новый export и повторить ingest без переписывания системы.
## Example Input → Output
### Input
```yaml
mode: TASK_IMPROVER_AND_RUN
project_name: "neuropros-comments-wiki"
goal: "найти главные боли аудитории neuropros и собрать 20 идей видео"
comment_exports:
- path: "/Users/roma/Downloads/youtube_comments_neuropros.csv"
source_name: "youtube"
notes: "comments under AI-tool videos"
output_root: "/Users/roma/Documents/neuropros-comments-wiki"
domain_context: |
Канал про Claude, ChatGPT, Codex, MCP, AI workflow. Аудитория: ранние AI-adopter'ы, фрилансеры,
предприниматели.
analysis_focus:
- боли аудитории
- повторяющиеся вопросы
- идеи видео
must_answer:
- "Какие 10 тем чаще всего просит аудитория?"
- "Какие боли можно превратить в видео на 12-20 минут?"
- "Где аудитория не понимает Claude Code / Codex?"
output_language: "ru"
constraints:
raw_is_read_only: true
do_not_publish_or_send_anything: true
cite_every_claim: true
preserve_personal_data: true
anonymize_quotes_if_needed: true
Expected Output
neuropros-comments-wiki/
CLAUDE.md
wiki/
index.md
dataset-profile.md
audience-map.md
clusters/
claude-code-fear.md
prompt-fatigue.md
rag-confusion.md
content-ideas/
claude-code-for-non-programmers.md
llm-wiki-comments-demo.md
lint-report.md/ что изучить дальше
Связанные материалы

Материалы к YouTube-видеоВидео
Пять лет имитации компании. Первый миллион пришёл, когда я остался один
Открыть

Материалы к YouTube-видеоВидео
Шесть лет я искал хороших людей. Оказалось, я искал не тех
Открыть

Материалы к YouTube-видеоВидео
Два года с командой — ноль. 58 дней в одиночку — 1 717 000 ₽
Открыть