Введение
Воздействие шума на организм человека может оказывать негативное влияние, однако жители города непосредственно это могут не ощущать [1, 2]. Обычно для измерения шума в городах применяются стационарные или мобильные наземные средства его измерения, однако они являются дорогостоящими и не позволяют получить полную, объективную картину по зашумленности территории. Также их недостатком является многоступенчатость процесса получения, измерения и анализа шума, что делает данный процесс длительным.
Для решения описанных проблем могут быть использованы беспилотные летательные аппараты (БПЛА). С их помощью сбор аудиоданных становится более мобильным и быстрым, предоставляя возможность охватывать разнообразные участки города, в том числе труднодоступные, в кратчайшие сроки. В [3] приведено начало авторского исследования по оценке зашумленности городских территорий с помощью БПЛА, в котором также рассматривалась следующая проблема: наличие шума винтов дрона в аудиозаписи. Этот шум может сильно искажать полезную информацию, из-за чего невозможно проводить объективный анализ зашумленности территории. Поэтому предварительно необходимо очистить полученные аудиоданные от шума винтов и вибрации самого БПЛА [4]. В данной статье приводятся усовершенствованные методики отделения шума городской среды от шума дрона с использованием математических методов и современных нейросетевых технологий. После очистки звуковая дорожка должна быть проанализирована с точки зрения уровня зашумленности территории, выделения типов шумов [5], их составляющих и предоставления информации в виде отчетов с различными характеристиками. Для автоматизации данных процессов необходима разработка специального программного обеспечения, что будет являться результатом исследования.
Цель исследования – разработать автоматизированную систему для обработки аудиоданных, полученных с использованием БПЛА, и анализа зашумленности городских территорий.
Для достижения поставленной цели был разработан следующий алгоритм:
1) получение аудиофайла по БПЛА (шум улицы + шум от дрона);
2) обработка аудиофайла с помощью математических методов (шум улицы – грубая очистка);
3) обработка аудиофайла с помощью ИИ (шум улицы – тонкая очистка);
4) анализ «очищенного» шума: получение характеристик зашумленности;
5) формирование отчета о зашумленности;
6) формирование шумовой карты.
Материалы и методы исследования
Для обработки аудиосигналов использовались математические методы «грубой очистки» – кратковременное преобразование Фурье и спектральная фильтрация, а также «тонкая очистка» с помощью нейросети, обученной авторами.
Аудиозапись, полученная с использованием БПЛА, содержит в себе несколько компонент:
, (1)
где s[n] – городской шум, d[n] – шум дрона, v[n] – фоновый шум окружающей среды.
Для последующей обработки запись переводится в спектральную область с помощью кратковременного преобразования Фурье [6]:
(2)
где w[n] – окно [7], R – шаг окна, t – индекс временного кадра, f – частота.
Спектральная область используется, потому что в ней задача разделения упрощается, поскольку шум дрона имеет отчетливую гармоническую структуру, состоящую из интенсивных узкополосных пиков.
Гармоническая модель шума дрона будет выглядеть следующим образом:
(3)
где Dharm(t,f) – спектр гармонического шума дрона, Ak(t) – амплитуда k-й гармоники, fk(t) – частота k-й гармоники, δ(f – fk(t)) – дельта-функция, моделирующая узкий спектральный пик, K – количество гармоник, которые необходимо подавить.
Формула (3) позволяет изолировать доминирующий узкополосный шум дрона (частоты пропеллеров) таким образом, чтобы обработка не внесла изменений в аудиозапись городского шума.
Следующий шаг – убрать широкополосный шум [8], который обычно связан с турбулентностью воздуха и вибрациями корпуса БПЛА. Для него оценивают спектральную плотность мощности [9, 10]:
(4)
После этого формируется спектральная маска [11]:
(5)
где |Y(t,f)| – амплитуда спектра текущего кадра.
Если применить такую маску, широкополосная составляющая заметно уменьшается, а полезный сигнал остается:
. (6)
Чтобы обработка была качественнее, дальше используем адаптивный фильтр Винера. Он аккуратно подавляет шум, не влияя на сигнал:
(7)
где ФSS(t,f) – оценка мощности полезной части сигнала.
После этого остаточный шум становится меньше, и на выходе получается уже более чистый спектр:
(8)
Второй этап очищения аудиофайла – использование нейросетевой модели. Благодаря архитектуре phase-aware [12], аудиосигнал рассматривается как двумерная структура, в которой учитываются амплитуда и фазовые особенности. Поэтому нейронная сеть лучше восстанавливает детали, которые могли потеряться на предыдущих этапах обработки.
Нейросеть работает не с исходной волной, а с комплексным спектрограммным представлением [13]. На вход подаются две компоненты спектра – действительная и мнимая части
,
а на выходе модель оценивает комплексную маску, которая доочищает сигнал M(t,f).
Модель не восстанавливает сигнал «с нуля», а дорабатывает уже очищенный спектр, поэтому лучше сохраняет полезные детали и меньше искажает речь/фон:
. (9)
Обучение нейросети идет на парных данных: входное аудио после математической очистки и соответствующее ему аудио, очищенное от шума дрона.
Качество обучения контролируется составной функцией потерь, которая учитывает сразу несколько аспектов:
, (10)
где
– ошибка по действительной и мнимой частям,
– ошибка по модулю спектра,
– штраф за фазовое расхождение,
Lenergy – ошибка по сглаженной энергии кадров.
После удаления шума БПЛА уровень очищенного сигнала удобно оценивать через среднеквадратичное значение (RMS) [14, 15], которое считается по формуле (11) и передает его воспринимаемую громкость:
. (11)
Для удобства интерпретации этот абсолютный показатель переводят в логарифмический масштаб – в децибелы:
. (12)
В процессе исследования для разработки автоматизированной системы анализа шума были использованы следующие библиотеки языка программирования Python, выбранного:
Tkinter – предоставляет базовые средства для создания интерфейса системы;
CustomTkinter – дает доступ к современному оформлению элементов интерфейса;
NumPy – реализует векторные вычисления, расчет спектральных характеристик, массивы;
SciPy – осуществляет фильтрацию, поиск пиков, билинейное преобразование фильтров;
Librosa – загружает аудиоданные, использует кратковременное преобразование Фурье (STFT) и обратное кратковременное преобразование Фурье (STFT);
SoundFile – сохраняет очищенные аудиофайлы в формате WAV;
PyTorch – реализует и запускает нейросеть, построенную на основе архитектуры Phase-Aware;
Matplotlib – осуществляет построение спектров, спектрограмм и карт зашумленности;
Pillow – загружает и отображает графические изображения в интерфейсе;
ReportLab – формирует pdf-отчеты.
Результаты исследования и их обсуждение
В результате проведенного исследования была разработана автоматизированная система, интерфейс главной страницы которой приведен на рис. 1.
Рабочий процесс обработки аудиоданных БПЛА включает три этапа: обработку аудиофайлов, их анализ и формирование отчета. После обработки аудиофайла можно просмотреть, какие этапы он прошел, нажав на кнопку «История обработки» (рис. 2).

Рис. 1. Интерфейс главной страницы системы Примечание: составлен авторами по результатам данного исследования

Рис. 2. Интерфейс окна «История обработки аудиофайлов» Примечание: составлен авторами по результатам данного исследования

Рис. 3. Этап обработки аудиофайла Примечание: составлен авторами по результатам данного исследования

Рис. 4. Результат анализа аудиофайла Примечание: составлен авторами по результатам данного исследования

Рис. 5. Результат этапа «Формирование отчета» Примечание: составлен авторами по результатам данного исследования
На рис. 3 представлен результат обработки файла, включающий пять этапов:
1) загрузка аудиофайла;
2) математическая очистка: STFT, гармоники, субтракция, фильтр Винера;
3) нейросетевая «тонкая» очистка с помощью архитектуры phase-aware;
4) сохранение очищенного файла в выбранную директорию;
5) отображение итогов обработки аудиофайла.
Второй этап «Анализ аудиофайлов» (рис. 4) отображает следующие полученные характеристики уровня звука:
– RMS – средняя мощность цифрового аудиосигнала (если RMS ближе к 1, запись очень громкая);
– LAeq – средний уровень шума за все время записи;
– LAFmax – максимальный уровень шума;
– LCpeak – максимальный мгновенный пик шума;
– доминирующая частота,
– норматив и соответствие того, что показатель находится в норме;
– превышение – показатель того, насколько шум выше допустимого уровня;
– составляющие шумов – распределение энергии аудиосигнала по частотным диапазонам и др.
Последним этапом является формирование отчета (рис. 5), который выгружается в pdf-формате.
Таким образом разработанная система выполняет полный цикл обрабоки аудиофайлов: от загрузки до формирования отчета с различными характеристиками шума.
Заключение
Разработанное ПО успешно прошло тестирование на реальных аудиозаписях городской среды и показало качественные результаты по «очистке» шума с помощью математических методов и использования обученной авторами нейронной сети.
Результаты анализа шума представлены в виде pdf-отчета, включающего средние и максимальные характеристики уровня шума, а также его разделение на типы шумов, что имеет важное практическое значение при экологическом мониторинге города и составлении его шумовой карты.
Конфликт интересов
Финансирование
Библиографическая ссылка
Бакаева О.А., Буткина А.А., Ледяйкин Н.В. РАЗРАБОТКА АВТОМАТИЗИРОВАННОЙ СИСТЕМЫ ДЛЯ АНАЛИЗА ГОРОДСКОГО ШУМА С ИСПОЛЬЗОВАНИЕМ БЕСПИЛОТНЫХ ЛЕТАТЕЛЬНЫХ АППАРАТОВ // Современные наукоемкие технологии. 2026. № 7. С. 25-30;URL: https://top-technologies.ru/ru/article/view?id=40856 (дата обращения: 12.08.2026).



