Перейти к содержимому
    Оглавление · Приложения

    Обновлено: 12 августа 2026 г. в 00:00

    Темные данные (Dark Data. Why What We Don’t Know Is Even More Important Than What We Do)

    mid

    Dark Data: Why What We Don't Know Is Even More Important Than What We Do (Темные данные)

    Авторы: David J. Hand
    Издательство: Princeton University Press
    Объем: 2020

    Разбор книги Дэвида Хэнда о темных данных: 15 классов отсутствующей информации, типовые ошибки интерпретации и практики принятия решений в условиях неполных данных.

    Dark Data: Why What We Don't Know Is Even More Important Than What We Do — оригинальная обложкаОригинал

    Источник

    Dark Data (book_cube)

    Двухчастный обзор книги Дэвида Хэнда: главная идея, 15 классов темных данных и практические выводы для менеджмента.

    Перейти на сайт

    Dark Data: Why What We Don't Know Is Even More Important Than What We Do (Темные данные)

    Авторы: David J. Hand
    Издательство: Princeton University Press
    Объем: 2020

    Книга о том, почему для сильных решений важно учитывать не только наблюдаемые данные, но и системно работать с тем, чего в данных нет.

    Dark Data: Why What We Don't Know Is Even More Important Than What We Do — оригинальная обложкаОригинал

    Management / Data / Statistics / Decision-making

    Главный тезис Dark Data: решения почти всегда принимаются на основе того, что мы видим в отчетах, но провалы чаще приходят из-за того, чего в отчетах не видно. Для техлида это практический навык управления неопределенностью, а не только тема для data-science команд.

    1. Карта 15 классов темных данных

    Класс 1

    Известные пропуски (known unknowns)

    Мы знаем, что в наборе есть отсутствующие значения, но продолжаем читать отчет так, будто данные полные.

    Класс 2

    Неизвестные пропуски (unknown unknowns)

    Самая опасная зона: мы не видим, каких данных не хватает, и строим уверенные решения на неполной картине.

    Класс 3

    Выборочные факты

    Критерии включения в выборку сужают реальность. Сюда же относится p-hacking и публикация только удобных результатов.

    Класс 4

    Самоотбор

    Ответившие и не ответившие системно отличаются, но в отчете это часто скрыто за общей средней цифрой.

    Класс 5

    Неизвестный определяющий фактор

    Корреляция выглядит убедительно, но за наблюдаемым эффектом стоит неучтенный фактор или смешение групп.

    Класс 6

    Контрфактуальные данные

    Что бы произошло при другом решении, мы не наблюдаем напрямую. Без этого сложнее оценить причинный эффект.

    Класс 7

    Данные, меняющиеся со временем

    Метрики стареют, процессы и поведение меняются, а модель остается калиброванной на старый контекст.

    Класс 8

    Неверно определяемые данные

    Определения метрик пересматриваются, и временные ряды становятся несопоставимыми без явной пометки.

    Класс 9

    Обобщение данных

    Сохраняем только агрегаты (среднее, медиану, дисперсию) и теряем распределение, хвосты и выбросы.

    Класс 10

    Ошибки измерения и неопределенность

    Погрешности измерений и преобразований форматов тихо искажают выводы, если их не учитывать явно.

    Класс 11

    Искажение обратной связи

    Сама метрика начинает менять поведение системы: люди оптимизируют показатель, а не реальную цель.

    Класс 12

    Информационная асимметрия

    Разные участники видят разные данные и принимают решения с разным качеством информации.

    Класс 13

    Намеренно затемненные данные

    Часть фактов скрывают или подают выборочно, чтобы поддержать нужный нарратив или манипулировать выводами.

    Класс 14

    Фальшивые и синтетические данные

    Синтетика может быть полезной, но в недобросовестном сценарии маскирует мошенничество и шум.

    Класс 15

    Экстраполяция за пределы данных

    Модель уверенно работает в знакомом диапазоне, но ломается при переносе на новые условия.

    2. Что можно применять на практике

    Рандомизированные контролируемые эксперименты

    A/B-тесты и RCT помогают оценивать причинный эффект, а не только корреляции в наблюдаемых данных.

    Симуляции

    Когда прямых наблюдений нет, симуляция сценариев позволяет проверить устойчивость решений на гипотетических траекториях.

    Репликация данных и бутстреппинг

    Повторная выборка показывает диапазон неопределенности и снижает риск переинтерпретации одного наблюдения.

    Байесовский подход

    Априорные распределения и последовательное обновление оценки полезны там, где данных мало или они приходят постепенно.

    Конфиденциальный сбор данных

    Privacy-preserving подходы дают шанс собирать чувствительные сигналы без неприемлемых рисков для пользователей.

    Фонарный эффект в принятии решений

    В финале книги автор напоминает анекдот про поиск ключей под фонарем: мы ищем там, где светло, а не там, где потеряли. Для лидера это прямое предупреждение против решений по удобным, но неполным метрикам.

    3. Типичные антипаттерны

    Считать, что отсутствие данных означает отсутствие проблемы.

    Принимать корреляцию за причинность без проверки скрытых факторов.

    Делать сильные выводы по агрегатам без проверки распределения и хвостов.

    Переносить модель на новый контекст без теста границ применимости.

    Опираться только на то, что легко измерить (фонарный эффект).

    4. Рабочие рекомендации

    Для ключевых решений явно фиксировать: какие данные отсутствуют и как это влияет на риск.

    В review метрик добавлять блоки про bias выборки, самоотбор и изменения определения метрик.

    Перед запуском инициативы проверять хотя бы один контрфактуальный сценарий.

    Использовать интервалы неопределенности и сценарный анализ вместо единственного точечного прогноза.

    Разделять мониторинг метрики и реальную цель, чтобы не попасть в ловушку искажения обратной связи.

    5. Чеклист перед data-driven решением

    1. Что мы точно знаем и что только предполагаем?
    2. Каких данных не хватает и почему они не собраны?
    3. Какие группы/сегменты могли выпасть из наблюдения?
    4. Есть ли скрытый фактор, объясняющий наблюдаемую корреляцию?
    5. Как изменится решение, если предположения окажутся неверны?
    6. Какой минимальный эксперимент снимет самый дорогой риск?

    6. Источники и связанные главы

    Трекинг прохождения выключен. Включите его в настройках.

    Доказательство обучения

    Чтение — только начало. Перенесите идею в рабочий эксперимент и разберите результат.