Раздел в стадии наполнения. Готовятся описания всех решений.
Документация модуля "SenDev: 152-ФЗ Персональные данные" обновлена до версии 1.1.16. Идут работы по обновлению визуальных материалов

Настройки модуля SenDev: Инозапрет 168-ФЗ

Страница «Настройки (168-ФЗ)» предназначена для управления основными параметрами работы модуля. На ней задаётся, какие данные проверять, как выполнять сканирование, какие словари использовать и как должен работать API.

Эта страница используется для первоначальной настройки модуля и для последующей корректировки его поведения в зависимости от структуры сайта и требований к проверке.

На странице можно:

  • выбрать источники сканирования;
  • настроить фильтрацию и обработку текста;
  • задать параметры производительности;
  • выбрать способ работы со словарями;
  • включить или отключить API;
  • перейти к импорту словарей и документации API.

[Скриншот 1: Блок «Источники сканирования» и фильтрация]

Когда использовать страницу

Страница особенно полезна в следующих случаях:

  • сразу после установки модуля;
  • перед первым запуском сканирования;
  • при изменении структуры сайта;
  • при переходе на другой способ хранения словарей;
  • при необходимости ускорить или сделать проверку более полной;
  • при включении интеграции через API.

Что находится на странице

Страница состоит из нескольких основных блоков:

  • источники сканирования;
  • фильтрация и обработка;
  • производительность;
  • словари;
  • API.

Источники сканирования

В этом разделе определяется, какие данные модуль должен проверять.

Сканировать инфоблоки

Включает проверку содержимого инфоблоков.

Этот параметр полезен, если на сайте основная часть контента размещена именно в инфоблоках: в новостях, каталоге, статьях и других разделах.

Сканировать статические файлы

Включает проверку обычных файлов сайта, например страниц и шаблонов, где содержится текст.

Сканировать highload-блоки

Включает проверку данных из highload-блоков.

Этот параметр нужен, если в highload-блоках хранится текстовая информация, которая тоже должна участвовать в проверке.

Расширения файлов

Позволяет указать, какие типы файлов учитывать при проверке статических материалов.

Это нужно для того, чтобы модуль обрабатывал только те файлы, где действительно ожидается текстовый контент.

Исключаемые пути

Позволяет указать разделы сайта, которые не нужно проверять.

Это удобно, если есть служебные папки или технические разделы, которые не должны участвовать в анализе.

Фильтрация и обработка

Этот блок определяет, как модуль должен обрабатывать текст перед проверкой.

Игнорируемые слова

Позволяет задать слова и обозначения, которые не нужно учитывать при проверке.

Обычно сюда добавляют технические или служебные элементы, которые не относятся к обычному тексту.

Вырезать блоки кода

Если параметр включён, модуль старается не учитывать фрагменты кода при проверке текста.

Это полезно для сайтов, где в материалах могут присутствовать технические вставки, примеры кода или служебные блоки.

Радиус контекста

Определяет объём текста вокруг найденного совпадения, который будет показан в результатах.

Чем больше значение, тем больше текста будет видно рядом с найденным словом.

Производительность

В этом разделе задаются ограничения и параметры, влияющие на скорость и объём проверки.

Максимальная глубина обхода каталогов

Ограничивает, насколько глубоко модуль будет проходить по папкам сайта.

Максимальное количество файлов в сканировании

Позволяет ограничить общее число файлов, которые модуль будет обрабатывать за одну проверку.

Если установлено значение 0, ограничение не применяется.

Шаг: элементов инфоблоков за запрос

Определяет, сколько элементов инфоблоков обрабатывается за один шаг.

Шаг: файлов за запрос

Определяет, сколько файлов обрабатывается за один шаг.

Шаг: строк highload-блоков за запрос

Определяет объём обработки данных из highload-блоков за один шаг.

Максимум строк highload-блоков

Позволяет ограничить общее количество строк из highload-блоков, участвующих в проверке.

Если установлено значение 0, ограничение не применяется.

Этот блок особенно важен для больших сайтов, где нужно подобрать баланс между скоростью работы и полнотой проверки.

Словари

В этом разделе задаются параметры, связанные со словарной базой модуля.

Хранилище словаря

Позволяет выбрать, где модуль будет брать словари для проверки:

  • из базы данных;
  • из файлов.

Если выбран вариант работы через базу данных, словари нужно предварительно импортировать. Для этого на странице есть ссылка «Импортировать словари в БД».

Папка словарей

На странице также показывается путь к папке, где находятся словари модуля.

Нормативные словари

В этом блоке можно выбрать, какие словари будут использоваться при проверке.

Доступны отдельные варианты, например:

  • орфоэпический словарь;
  • орфографический словарь;
  • словарь иностранных слов;
  • толковый словарь.

Пользователь может включать только те словари, которые нужны в рамках текущих правил проверки.

API

В этом разделе находятся параметры, связанные с программным доступом к модулю.

Включить API

Позволяет включить или отключить работу API.

Если API отключено, внешние системы не смогут использовать функции модуля.

API-ключ

Здесь отображается текущий ключ доступа к API, если он уже создан.

Для управления ключом и получения примеров запросов используется ссылка «Документация API».

Как модуль использует эти настройки

Параметры этой страницы общие для массового сканирования и ручных проверок. Источники и ограничения определяют область массового обхода, а словари, игнорируемые слова, белый список и радиус контекста влияют на сам анализ текста. После изменения настроек сделайте небольшую контрольную проверку, прежде чем запускать полный сайт.

Источники сканирования — подробное описание

Сканировать инфоблоки

По умолчанию включено. При полном сканировании модуль проверяет активный контент инфоблоков. В режиме «Раздел инфоблока» эта настройка определяет основной тип проверяемого содержимого. Отключайте её только если инфоблоки заведомо не входят в область контроля.

Сканировать статические файлы

По умолчанию включено. Используется при полном сканировании файловой части сайта. Какие именно файлы попадут в обход, дополнительно определяют «Расширения файлов», «Исключаемые пути», максимальная глубина и максимальное количество файлов.

Сканировать highload-блоки

По умолчанию выключено. Включайте, если в highload-блоках действительно хранится пользовательский текст, который должен проверяться. Этот источник обрабатывается при режиме «Весь сайт»; при проверке отдельного раздела инфоблока или файлового пути он не участвует.

Расширения файлов

По умолчанию: html, htm, php. Значения вводятся через запятую. Это фильтр для массового обхода статических файлов: если нужного расширения нет в списке, такой файл не попадёт в файловую часть сканирования.

Не добавляйте без необходимости архивы, изображения и другие форматы, в которых модуль не ожидает обычный текст. Для офисных документов используйте отдельную страницу «Проверка файлов».

Исключаемые пути

Каждый путь задаётся с новой строки. Стартовый набор исключает служебные каталоги /bitrix/, /upload/ и /local/. Исключения применяются к массовому обходу статических файлов и защищают от проверки технических каталогов.

Если нужно точечно проверить конкретный файл или папку, используйте режим «Отдельная папка/страница» на странице сканирования. Такой запуск предназначен именно для явного пути и не должен заменяться расширением общей области полного обхода.

Фильтрация и обработка — подробное описание

Игнорируемые слова

[Скриншот 2: Параметры производительности и словарей]

Каждое значение вводится с новой строки. По умолчанию сюда включён набор распространённых обозначений языков и технологий: PHP, JS, HTML, CSS, SQL, XML, JSON, YAML, Python, Java, Kotlin, Swift, Ruby, Go, Rust, C, Cpp, CSharp, TypeScript, Bash.

Этот список предназначен для систематических технических слов, которые не нужно показывать в результатах. Не превращайте его в замену белого списка: для брендов и согласованных пользовательских исключений используйте «Белый список», где есть тип, комментарий и возможность временной деактивации.

Вырезать блоки кода

По умолчанию включено. Перед анализом модуль исключает типичные фрагменты кода: блоки <pre>, <code>, fenced-блоки с тройными обратными кавычками и служебные блоки вида [code]. Это снижает количество технических терминов в результате.

Отключайте параметр только если кодовые фрагменты являются частью контролируемого содержимого и их действительно нужно анализировать вместе с обычным текстом.

Радиус контекста

По умолчанию 40, допустимое рабочее значение не может быть меньше 10. Параметр задаёт размер фрагмента вокруг найденного слова в отчётах. Чем выше значение, тем проще понять смысл предложения, но тем больше места занимает каждая строка результата. Для редакторской работы обычно лучше умеренный контекст, а не максимальное значение.

Производительность — что означает каждый параметр

Максимальная глубина обхода каталогов

По умолчанию 4. Ограничивает глубину вложенных папок при массовом поиске статических файлов. Значение 0 означает отсутствие перехода в более глубокие уровни относительно начальной точки обхода. Увеличивайте глубину, если пользовательские страницы действительно лежат глубже.

Максимальное количество файлов в сканировании

По умолчанию 5000. Значение 0 снимает ограничение. На большом проекте лучше сначала оставить разумный предел, проверить продолжительность полного запуска и только затем при необходимости увеличивать его.

Шаг: элементов инфоблоков за запрос

По умолчанию 50, рабочий диапазон — от 5 до 500. Это количество элементов, которое модуль старается обработать за один шаг сканирования.

Шаг: файлов за запрос

По умолчанию 20, рабочий диапазон — от 1 до 500.

Шаг: строк highload-блоков за запрос

По умолчанию 200, рабочий диапазон — от 10 до 5000.

Общее правило для трёх параметров шага одинаковое: меньшее значение уменьшает нагрузку одного шага, но увеличивает количество шагов; большее — ускоряет обработку при достаточных ресурсах, но делает один шаг тяжелее. Если сканирование работает стабильно, менять значения только ради максимума не требуется.

Максимум строк highload-блоков

По умолчанию 0, то есть без общего ограничения. Если highload-блок очень большой, можно временно установить предел для тестового запуска и после проверки поведения увеличить его.

Словари — выбор режима

Хранилище словаря

Доступны варианты База данных и Файлы. Файловый режим использует словари, поставленные в каталоге модуля. Режим БД удобен, когда словарный набор предварительно загружен через страницу «Импорт словарей в БД».

Если выбрана БД, но для текущего нормативного набора там ещё нет данных, а файлы словарей доступны, модуль может автоматически использовать файлы. В «Диагностике» показывается фактический режим. Это защитный вариант для продолжения работы, а не замена корректному импорту.

Нормативные словари

Можно включить один или несколько источников:

  • орфоэпический словарь;
  • орфографический словарь;
  • словарь иностранных слов;
  • оба тома толкового словаря.

Результат проверки зависит от выбранного набора: слово считается подтверждённым, если оно находится в используемых нормативных данных с учётом обработки словоформ. Поэтому изменение состава словарей может заметно изменить список потенциальных совпадений. После изменения набора выполните тест на известном тексте.

API

Включить API

По умолчанию программный доступ выключен. Включайте его только если есть внешняя интеграция, которой действительно нужна проверка текста, URL или файлов.

API-ключ

На странице показывается текущий ключ, если он создан. Создание, копирование и пересоздание удобнее выполнять в разделе «Документация API». После пересоздания старый ключ перестаёт подходить, поэтому его необходимо заменить во всех подключённых системах.

Рекомендуемые настройки для первого запуска

  • оставьте инфоблоки и статические файлы включёнными, если сайт использует оба типа контента;
  • highload-блоки включайте только при наличии текстовых данных, которые действительно нужно контролировать;
  • не удаляйте стартовые исключаемые служебные каталоги без причины;
  • оставьте вырезание кода включённым;
  • не увеличивайте размеры шагов до максимума до первой проверки;
  • выберите нормативные словари по правилам проекта и проверьте их готовность в диагностике;
  • API оставьте выключенным, если интеграция не используется.

Как работать со страницей

Рекомендуемый порядок работы:

  1. Откройте страницу «Настройки (168-ФЗ)».
  2. Выберите источники, которые должны участвовать в проверке.
  3. При необходимости задайте исключаемые пути и список игнорируемых слов.
  4. Настройте параметры обработки текста.
  5. Установите ограничения производительности с учётом объёма сайта.
  6. Выберите способ работы со словарями.
  7. При необходимости перейдите к импорту словарей.
  8. Если планируется интеграция, настройте параметры API.
  9. Нажмите «Сохранить настройки».

Когда стоит менять настройки

Параметры на этой странице стоит пересматривать, если:

  • на сайте появились новые типы контента;
  • изменились разделы, которые нужно проверять;
  • проверка стала слишком долгой или, наоборот, слишком поверхностной;
  • был изменён состав словарей;
  • подключается внешняя интеграция через API.

Что важно учитывать

  • Настройки напрямую влияют на результаты проверки.
  • Чем больше источников включено, тем дольше может выполняться сканирование.
  • Исключаемые пути помогают не тратить ресурсы на служебные разделы.
  • Если выбран режим работы со словарями из базы данных, словари должны быть предварительно импортированы.
  • Изменения вступают в силу после сохранения настроек.
  • Параметры производительности лучше менять осознанно, особенно на больших проектах.

[Скриншот 3: Настройки API и кнопка сохранения]

Итог

Страница «Настройки (168-ФЗ)» — это основной раздел для управления работой модуля. Она позволяет определить, что именно проверять, как обрабатывать текст, какие словари использовать и каким образом подключать API.