Москва
Мероприятия
Блог
Войти
main-bg
Блог

Как эффективно управлять ростом обрабатываемых данных

Сегодня компании всех отраслей ежедневно сталкиваются с непрекращающимся ростом объема данных, особенно это касается финансового и логистического сектора. Понятно, что с увеличением этих объемов снижается скорость доступа к данным. Руслан Махмудов, ведущий разработчик Центра Высоких Технологий (ЦВТ) группы компаний Softline, дал рекомендации, позволяющие ускорить работу с СУБД и уже с самого начала не допустить критических ошибок, которые могут приводить не только к замедлению всей системы, но и потере важной информации.

Примечание: все советы относятся к ситуациям, когда данных уже накопилось очень много, но до того, что называется Big Data, ещё далеко. Потому что Big Data — это область со своими СУБД, правилами и законами, там многое из того, что есть в нижеследующем материале, не работает или не имеет смысла.

Текстовые файлы. Когда пока не нужна СУБД?

Когда вы пишите приложения, стоит задуматься о том, чтобы вообще не использовать СУБД. Например, если вам нужно хранить небольшой объем аккаунтов пользователей (логин, пароль, ФИО), номенклатуру товаров, справочники, редактировать которые приходится крайне редко, то для этого необязательно всегда заводить базу — вы можете работать с текстовыми файлами. Существует большое множество хорошо «перевариваемых» форматов (JSON, XML, YAML, CSV, INI) и есть функциональные текстовые редакторы, в которых удобно работать (подсветка, удобный поиск, замены). Если объемы данных небольшие (десятки-сотни мегабайт), то их можно считать в кэш-память и легко и быстро с ними работать — вам не надо будет делать запросы в базу. Эти данные легко поддаются бэкапированию. Кроме того, текстовые файлы могут храниться локально, а в случае с СУБД приходится делать запрос на сервер, соответственно, если падает сеть, то работа приостанавливается, а в случае с текстовыми файлами работу можно продолжать, потому что к ним есть локальный доступ. СУБД требует выделенного сервера и постоянного его обслуживания. В случае же с текстовыми файлами вы тратите меньше ресурсов, тем самым работаете эффективнее, а клиент теряет меньше прибыли.

Ограничения у текстовых файлов

Если файлы очень большие, то редактировать их неудобно, особенно если это приходится делать часто. В ситуациях, когда вы вынуждены делать свою работу самостоятельно за какую-то СУБД и оперировать сложными выборками с фильтрами, про текстовые файлы нужно забыть и принимать решение в пользу СУБД. Но если перед вами стоит задача написать простое приложение, возможно, не стоит ставить ORM и выбирать СУБД, ведь в любом языке программирования предусмотрены библиотеки, чтобы собирать любые данные и легко их редактировать.

СУБД + ORM: не надо ошибаться с первого шага

Подавляющее число проблем, которые всплывают в работе с данными, закладываются на ранних этапах, когда программист выбирает СУБД и ORM и начинает строить модели. К сожалению, зачастую программисты делать этого нормально не умеют. Существует огромное количество проектов, которые испытывают все большие проблемы с данными по мере своего роста, поскольку большое количество ошибок было совершено разработчиками еще на этапе проектирования. В середине нулевых годов изобрели NoSQL-базы данных, и огромное количество людей ударились в эксперименты с ними. Мне сразу показались странными некоторые вещи: например, скриншот взят из самой популярной СУБД MongoDB, на нем видно, что люди на самом деле работают с реляционными структурами. Большое количество тьюториалов, которые встречаются в интернете, были написаны по следующей схеме: сейчас мы возьмем MongoDB, будем вставлять туда JSON-документы, и у нас всё будет работать быстро и красиво. Но видно, что они вставляют туда реляционные JSON-данные, например, каталоги каких-нибудь фильмов. Да, это будет нормально работать, но только первое время. Если строится система, которая предусматривает постоянное накопление данных, то рано или поздно мы столкнемся с тем, что эти реляционные структуры и обрабатывать надо будет по-реляционному, и тут JSON не поможет — проект будет похоронен уже на этапе выбора СУБД.

Как эффективно управлять ростом обрабатываемых данных Softline

Пример реляционных структур из MongoDB

Ограничения NoSQL на примере проекта федеральной сети в г. Воронеж

Разработчики на самом раннем этапе проекта выбрали MongoDB. Но они использовали её неправильно: данные, которые в ней хранили, всё равно оставались, по сути, реляционными. Бизнес-логика приложений работала с ними как с реляционными, а MongoDB в этом плане сильно уступает реляционным СУБД. И когда база выросла до сотен гигабайт, разработчики столкнулись с проблемой — дальше повышать производительность было невозможно, потому что работа с данными занимала очень много времени. DevOps-специалист этой фирмы рассказывал, что в тот момент денег было достаточно. Они просили сторонние компании обработать какие-то данные, когда это требовалось сделать быстро, но никто не мог. Не помогало ничего — ни добавление серверов, ни шардинг, потому что разработчики в самом начале ограничивались NoSQL. Руслан Махмудов, опираясь на собственный опыт, утверждает, что NoSQL-базы действительно показывают хорошие результаты в разных бенчмарках, но у них ограниченная область применения.

Когда на самом деле нужна NoSQL СУБД?

Нечто неструктурированное, например, логи, можно хранить в NoSQL. Если вы работаете с сырыми данными (показания датчиков, терминалов), можете также складывать их в NoSQL. Есть еще пара случаев, когда NoSQL хороша, но в подавляющем большинстве вы все равно будете работать с реляционными структурами. Современные реляционные СУБД умеют эффективно взаимодействовать с JSON, в том числе делать по ним поиск и индексирование.

Критические ошибки

Неявная денормализация

Как эффективно управлять ростом обрабатываемых данных Softline

Синтетический кейс, который встречается довольно часто: создается таблица для какого-нибудь заказа, в котором есть поле «Сумма заказа». Тем не менее у этих заказов в другой таблице есть конкретная расшифровка по позициям, и, если эти позиции сложить, тоже получится сумма заказа. И вроде всё нормально, но рано или поздно суммы в двух таблицах разойдутся по самым разным причинам, потому как функционал приложения обязательно будет усложняться и будут появляться какие-то новые условия (скидки, партнерские программы, возвраты товаров). Эти проблемы характерны для сферы продаж. После этого недовольные клиенты начнут жаловаться на то, что у них не сходятся суммы, а исправить это будет сложно, так как эти цифры будут фигурировать по всей базе. Вы начнете терять деньги.

Float/double для финансового сектора

Если вы работает с деньгами, никогда не используйте такие типы данных, как float/double. Они и называются по-русски «типы данных с плавающей точностью». На скриншоте несколько примеров, когда вы ожидаете, что получится одно значение, а выходит другое: обыкновенное вычитание двух простых чисел приводит к неточному результату. У этих вещественных типов значений есть проблема округления, и их никогда не следует использовать, если вы работаете с деньгами, потому что рано или поздно к вам обратится бухгалтер с вопросом, почему у него суммы расходятся, и уже не на копейки, а на рубли. . Для того, чтобы работать с финансами, в каждой СУБД, языке программирования есть свой специальный тип, у которого таких проблем с округлением нет.

Как эффективно управлять ростом обрабатываемых данных Softline

Неподходящие типы данных

Разработчики порой используют совершенно неподходящие типы данных для хранения каких-либо значений. До сих пор встречаются типы данных, которые хранятся в виде строки (на скрине): "12.06.01" — это 12 июня 2001 года или 6 декабря 2001 года? Из-за таких вещей бизнес-логика приложения обрастает огромным количеством проверок, и все равно в каком-нибудь месте возникает ошибка. Использование чаров типа «Y» и «N» для того, чтобы отмечать какое-то бинарное значение неправильно, лучше применять тип boolean со значениями true/false, потому что рано или поздно кто-то ошибется и напишет «y» с маленьким регистром или не в той раскладке, и искать причину поломки потом придется очень долго.

Как эффективно управлять ростом обрабатываемых данных Softline

Хранение чисел в виде строки

Встречается регулярно. Люди умудряются хранить в виде строки номера телефонов ИНН, СНИЛС, БИК и другие данные, которые по сути являются числами. Числом также являются паспортные данные в РФ, реквизиты документов и даже банковские счета. Хранение в строке — это перерасход ресурсов, и это еще куда ни шло. Самое страшное, что люди порой хранят данные в отформатированном виде, и это непозволительная ошибка не только при работе с базой данных, но и при программировании. Любое приложение, которое мы пишем, состоит из трех звеньев: уровень представления, бизнес-логики и работы с данными. Между этими уровнями должна быть изоляция, чтобы одно в другое не перетекало. Но когда у вас в базе данных значения хранятся так, как нужно для уровня представления, получается, что мы перескакиваем через целый уровень.

Как эффективно управлять ростом обрабатываемых данных Softline

Руслан Махмудов: «Приведу в пример кейс, когда мы вынуждены были хранить номера телефонов в строке в четком виде "+7xxxxxxxxxx" — именно так, строка с плюсом в начале и 11 цифр за ним. В соответствующей таблице под это был отведен тип поля varchar длиной ровно 12 символов согласно бизнес-требованию. На таблице с десятками миллионов записей это был дикий перерасход ресурсов, плюс по номеру телефона часто проходил поиск. Куда выгоднее было бы перевести всё в число, после чего скорость работы запросов увеличилась бы при одновременном уменьшении объёма данных. Мы пытались уговорить заказчика на рефакторинг, но, когда подсчитывали трудозатраты, этот вопрос постоянно отодвигался. Однажды к нам пришли клиенты из Финляндии, где телефонные номера начинаются с +3, и в них 13 символов. В итоге мы в нашу базу загрузили клиентов из Финляндии без номеров телефонов, и в один момент потеряли их всех. Пришлось как-то выкручиваться.

0 или “” вместо NULL

Программисты иногда не умеют настраивать маппинг в ORM, и когда у них нет каких-то данных, в базе появляются значения 0 или пустая строка. Но надо понимать, что 0 — это тоже значение. С точки зрения здравого смысла, если вы не знаете какое-то значение, у вас должен стоять NULL. Если вы будете хранить нули или пустые строки в тех местах, где якобы данных нет, рано или поздно при изменении какого-либо контекста, усложнении бизнес-логики, вы просто не будете понимать, является ли ноль реальным значением или означает отсутствие данных.

Как эффективно управлять ростом обрабатываемых данных Softline

Теги:

Новости, истории и события
Смотреть все
Софтлайн Решения (ГК Softline) и компания «Перспективный мониторинг» открыли киберполигон Ampire в Краснодарском университете МВД России
Новости

Софтлайн Решения (ГК Softline) и компания «Перспективный мониторинг» открыли киберполигон Ampire в Краснодарском университете МВД России

23.06.2026

ГК Softline и ГК «Аквариус» объединяют усилия для обеспечения технологической независимости госсектора и предприятий
Новости

ГК Softline и ГК «Аквариус» объединяют усилия для обеспечения технологической независимости госсектора и предприятий

23.06.2026

ГК Softline представит архитектуру защищенного ИИ и АСУ ТП на РИБ-2026
Новости

ГК Softline представит архитектуру защищенного ИИ и АСУ ТП на РИБ-2026

23.06.2026

ПАО «Софтлайн» продолжит обратный выкуп акций Компании
Новости

ПАО «Софтлайн» продолжит обратный выкуп акций Компании

22.06.2026

Команда ПАО «Софтлайн» приняла участие в Smart-Lab Conf 2026
Новости

Команда ПАО «Софтлайн» приняла участие в Smart-Lab Conf 2026

22.06.2026

«Софтлайн Решения» (ГК Softline) оснастила московский колледж симуляторами БПЛА
Новости

«Софтлайн Решения» (ГК Softline) оснастила московский колледж симуляторами БПЛА

22.06.2026

SL Soft fabricaONE.AI (акционер — ГК Softline) развивает семантический поиск и интеллектуального помощника в платформе Citeck
Новости

SL Soft fabricaONE.AI (акционер — ГК Softline) развивает семантический поиск и интеллектуального помощника в платформе Citeck

22.06.2026

ГК Softline представила инновационные решения на Всероссийском форуме-выставке «ГОСЗАКАЗ»
Новости

ГК Softline представила инновационные решения на Всероссийском форуме-выставке «ГОСЗАКАЗ»

19.06.2026

«Инферит» (кластер «СФ Тех» ГК Softline) и АО «Информатика» создадут комплексное решение для управления ИТ-инфраструктурой
Новости

«Инферит» (кластер «СФ Тех» ГК Softline) и АО «Информатика» создадут комплексное решение для управления ИТ-инфраструктурой

19.06.2026

ГК Softline и Deeray расширяют стратегическое партнерство в сфере ИИ-аналитики клиентских коммуникаций
Новости

ГК Softline и Deeray расширяют стратегическое партнерство в сфере ИИ-аналитики клиентских коммуникаций

19.06.2026

Группа «Борлас» (ГК Softline), включая BeringPro, заняла 1-е место в рэнкинге RAEX в сегменте управленческого ИТ-консалтинга
Новости

Группа «Борлас» (ГК Softline), включая BeringPro, заняла 1-е место в рэнкинге RAEX в сегменте управленческого ИТ-консалтинга

18.06.2026

ActiveCloud запускает комплексное сопровождение кластеров Kubernetes
Новости

ActiveCloud запускает комплексное сопровождение кластеров Kubernetes

18.06.2026

VPG LaserONE (кластер «СФ Тех» ГК Softline) представила отечественные лазерные решения для промышленности, медицины и телекома на выставке технологического лидерства в Совете Федерации
Новости

VPG LaserONE (кластер «СФ Тех» ГК Softline) представила отечественные лазерные решения для промышленности, медицины и телекома на выставке технологического лидерства в Совете Федерации

18.06.2026

ГК Softline представит в Иркутске цифровую лабораторию для подготовки будущих инженеров
Новости

ГК Softline представит в Иркутске цифровую лабораторию для подготовки будущих инженеров

17.06.2026

Академия АйТи fabricaONE.AI (акционер – ГК Softline) и АНО «Астра Академия» пилотируют профессиональную сертификацию ИТ-специалистов для студентов
Новости

Академия АйТи fabricaONE.AI (акционер – ГК Softline) и АНО «Астра Академия» пилотируют профессиональную сертификацию ИТ-специалистов для студентов

16.06.2026

ГК Softline запустила модуль расширенного логирования для платформы BPMSoft
Новости

ГК Softline запустила модуль расширенного логирования для платформы BPMSoft

16.06.2026

ГК Softline адаптирует SimpleOne под собственные бизнес-процессы, выводя ITSM-систему на уровень корпоративного управления услугами (ESM)
Новости

ГК Softline адаптирует SimpleOne под собственные бизнес-процессы, выводя ITSM-систему на уровень корпоративного управления услугами (ESM)

15.06.2026

Bell Integrator FabricaONE.AI (акционер – ГК Softline) привел информационные системы финансовой организации к единому стандарту разработки
Новости

Bell Integrator FabricaONE.AI (акционер – ГК Softline) привел информационные системы финансовой организации к единому стандарту разработки

11.06.2026

Почему промышленный ИИ остается локальным инструментом — и что с этим делать
Блог

Почему промышленный ИИ остается локальным инструментом — и что с этим делать

18.06.2026

Новые ИТ-льготы и запреты, ИИ в судах, дроны в медицине, контроль чипов и возвращение Roblox
Блог

Новые ИТ-льготы и запреты, ИИ в судах, дроны в медицине, контроль чипов и возвращение Roblox

11.06.2026

Облако на OpenStack: готовая замена VMware для бизнеса и госсектора
Блог

Облако на OpenStack: готовая замена VMware для бизнеса и госсектора

09.06.2026

ТОП-5 российских систем видеоконференцсвязи в 2026 году: сравнение особенностей и преимуществ
Блог

ТОП-5 российских систем видеоконференцсвязи в 2026 году: сравнение особенностей и преимуществ

04.06.2026

Как выбрать систему инвентаризации, учета и контроля ИТ-инфраструктуры: обзор 5 российских решений
Блог

Как выбрать систему инвентаризации, учета и контроля ИТ-инфраструктуры: обзор 5 российских решений

01.06.2026

Главные ИТ-новости недели 29.05.2026
Блог

Главные ИТ-новости недели 29.05.2026

29.05.2026

ИИ в образовании 2026: практика, инфраструктура, регулирование
Блог

ИИ в образовании 2026: практика, инфраструктура, регулирование

22.05.2026

Управление программными активами (SAM) — как эффективно распоряжаться ИТ-активами, избежать штрафов и выполнить требования регуляторов
Блог

Управление программными активами (SAM) — как эффективно распоряжаться ИТ-активами, избежать штрафов и выполнить требования регуляторов

19.05.2026

Как меняется инфраструктура образования: опыт российских школ
Блог

Как меняется инфраструктура образования: опыт российских школ

13.05.2026

Главные ИТ-новости недели 08.05.2026
Блог

Главные ИТ-новости недели 08.05.2026

08.05.2026

Электронные подписи в 2026: получить по биометрии, обновить «КриптоПро» и избежать штрафов
Блог

Электронные подписи в 2026: получить по биометрии, обновить «КриптоПро» и избежать штрафов

06.05.2026

Как сократить расходы на облачную инфраструктуру: распределение нагрузок на практике
Блог

Как сократить расходы на облачную инфраструктуру: распределение нагрузок на практике

29.04.2026

ИТ-инфраструктура: как бизнес решает задачи отказоустойчивости и импортозамещения
Блог

ИТ-инфраструктура: как бизнес решает задачи отказоустойчивости и импортозамещения

22.04.2026

Лицензионный хаос: как избежать штрафов и навести порядок в ПО
Блог

Лицензионный хаос: как избежать штрафов и навести порядок в ПО

21.04.2026

Информационная безопасность в проектах «Софтлайн Решений»
Блог

Информационная безопасность в проектах «Софтлайн Решений»

17.04.2026

Главные ИТ-новости недели 10.04.2026
Блог

Главные ИТ-новости недели 10.04.2026

10.04.2026

Цифровые технологии на производстве: от кибербезопасности до облаков — опыт компаний
Блог

Цифровые технологии на производстве: от кибербезопасности до облаков — опыт компаний

08.04.2026

Первый российский PDF-редактор с ИИ-ассистентом: обзор функций
Блог

Первый российский PDF-редактор с ИИ-ассистентом: обзор функций

06.04.2026