Обучение/База знаний·Обзор·24 июля 2026 г.

Умный детектор чужих территорий: новая технология для надёжного интернета будущего

На arXiv опубликована статья о фреймворке WMFM-OOD для обнаружения данных вне распределения в беспроводных мультимодальных фундаментальных моделях для интегрированного зондирования и связи в 6G.

ИИ-новостник

ПоделитьсяВКонтактеTelegramMAX

23 июля 2026 года на платформе arXiv появилась препринтная статья, посвящённая проблеме обнаружения данных вне распределения (Out-of-Distribution Detection) в беспроводных мультимодальных фундаментальных моделях для технологии 6G ISAC.

Почему это важно для 6G?

Сети 6G будут сами управлять сигналами — направлять лучи к телефонам, определять, где находятся люди и машины (это и есть ISAC — интеграция связи и зондирования). Если ИИ ошибется в незнакомой среде, это может привести к:

  • обрывам связи,

  • неверному позиционированию (например, машина экстренной помощи получит неправильные координаты),

  • авариям в системах, где важна безопасность.

WMFM-OOD — это первая линия защиты: она не исправляет ошибки, но говорит, что ошибки возможны, и не дает модели принимать решения «наугад».

Работа выполнена авторами Mohammad Farzanullah, Akram Bin Sediq, Ali Afana и Melike Erol-Kantarci. Статья относится к категории cs.NI (Networking and Internet Architecture) и отмечена как представленная на конференции IEEE VTC 2026 Fall.

Авторы описывают интеграцию фундаментальных моделей, таких как Wireless Multimodal Foundation Model (WMFM), в сети 6G. Эти модели обеспечивают единый подход к интегрированному зондированию и связи (ISAC), используя обобщённые представления для одновременной оптимизации передачи данных и восприятия окружающей среды.

В статье предложен фреймворк WMFM-OOD, который строит геометрические прототипы базовых станций в совместном латентном пространстве и применяет температурно-масштабированный вероятностный механизм оценки. Метод протестирован на наборе данных DeepVerse6G.

Согласно описанию, WMFM-OOD достигает значения AUROC 0,8824 и снижает показатель FPR95 примерно на 17 % по сравнению с некалиброванными базовыми подходами в оптимальном температурном режиме.

Статья содержит четыре рисунка и доступна в формате PDF на arXiv.

Перевод статьи от редакции Технологии Победы:

Название: Обнаружение распределений, выходящих за пределы обучающей выборки, в беспроводных мультимодальных фундаментальных моделях для 6G ISAC

Авторы: Мохаммад Фарзануллах*, Акрам Бин Сейди†, Али Афана† и Мелике Эрол-Кантарыч*

* Школа электротехники и компьютерных наук, Оттавский университет, Оттава, Онтарио, Канада

† Ericsson Inc., Оттава, Онтарио, Канада

Эл. почта: {mfarz086, melike.erolkantarci}@uottawa.ca, {akram.bin.seidi, ali.afana}@ericsson.com

Аннотация — Интеграция фундаментальных моделей (Foundation Models, FMs), таких как Беспроводная Мультимодальная Фундаментальная Модель (WMFM), в сети 6G обеспечивает единую структуру для Интегрированного Зондирования и Связи (ISAC), используя обобщенные представления для одновременной оптимизации передачи данных и восприятия окружающей среды. Однако развертывание таких моделей, управляемых данными, в критически важной инфраструктуре затруднено проблемой распределений, выходящих за пределы обучающей выборки (Out-of-Distribution, OOD), что представляет фундаментальную угрозу для надежности системы. Стандартные FM работают в предположении о замкнутом мире, что делает их уязвимыми для скрытых отказов при развертывании в невидимых радио-средах. Чтобы устранить этот пробел в надежности и обеспечить доверительное управление сетью, мы предлагаем WMFM-OOD, надежную метрическую структуру для обнаружения OOD. В отличие от традиционных методов, которые полагаются на необработанные показатели совместимости, WMFM-OOD конструирует геометрические Прототипы Базовых Станций (BS) в совместном латентном пространстве для захвата структуры многообразия допустимых радио-сред. Используя механизм вероятностной оценки с температурным масштабированием, наш подход эффективно различает внутри-выборочные (In-Distribution, ID) и аномалии с ковариатным сдвигом. Мы проверяем структуру на наборе данных DeepVerse6G. Экспериментальные результаты показывают, что WMFM-OOD значительно превосходит некалиброванные базовые модели, достигая площади под рабочей характеристической кривой (AUROC) 0.8824 и снижая частоту ложных срабатываний при 95% истинно-положительных срабатываний (FPR95) примерно на 17% в оптимальном температурном режиме, обеспечивая тем самым начальный уровень чувствительности обнаружения для смягчения катастрофических отказов модели без полного нарушения доступности сети.

Индексные термины — Обнаружение распределений, выходящих за пределы обучающей выборки, Фундаментальные модели, Мультимодальные данные, Интегрированные зондирование и связь.

---

### I. Введение

Эволюция беспроводных сетей в сторону шестого поколения (6G) предполагает интерфейс, основанный на искусственном интеллекте (ИИ), где основные функции физического уровня, такие как оценка канала, формирование диаграммы направленности и позиционирование, все чаще реализуются с помощью глубоких нейронных сетей (DNN), а не жестких аналитических моделей. Этот сдвиг парадигмы особенно важен для систем Интегрированного Зондирования и Связи (ISAC). В отличие от традиционных сетей, ISAC использует единую аппаратную и спектральную структуру для выполнения двойных функций: высокоскоростной передачи данных и высокоточного зондирования окружающей среды (например, обнаружения и локализации целей, подобно радару). В таких сложных сценариях интеграция мультимодальных данных незаменима. Например, включение дополнительного визуального контекста от камер может компенсировать присущую разреженность и шум беспроводных каналов. Этот мультимодальный синергизм обеспечивает надежное понимание окружающей среды и точное согласование лучей там, где методы, использующие только радиочастотный (RF) диапазон, обычно терпят неудачу [1].

Недавно появление Фундаментальных Моделей (FM) в беспроводной области ускорило этот переход [2]. Эти модели служат универсальными предварительно обученными архитектурами, способными улавливать сложные нелинейные закономерности электромагнитной среды в различных частотных диапазонах и сценариях развертывания. Изучая обобщенные представления беспроводного канала, FM могут быть эффективно донастроены для широкого круга последующих задач, таких как сжатие обратной связи по информации о состоянии канала (CSI), прогнозирующее формирование диаграммы направленности и управление помехами, часто требуя значительно меньше специфичных для сайта данных, чем традиционные подходы глубокого обучения. Например, Беспроводная Мультимодальная Фундаментальная Модель (WMFM) [3] использует контрастное обучение для согласования RF-сигналов с визуальными модальностями, создавая общее латентное представление, которое поддерживает разнообразные последующие задачи с высокой эффективностью использования данных.

Однако зависимость от согласованных межмодальных представлений создает отчетливые уязвимости при столкновении с проблемой распределений, выходящих за пределы обучающей выборки (OOD) [4]. Стандартные DNN работают в предположении о замкнутом мире, где обучающие и тестовые данные взяты из одинаковых распределений. В реальных развертываниях 6G, однако, это предположение регулярно нарушается [5]. Практические среды постоянно изменяются под воздействием динамических факторов, таких как меняющаяся статистика каналов, мобильность пользователей и эволюционирующие топологии сети. Следовательно, предварительно обученные FM могут столкнуться с новыми профилями рассеяния, где изученные межмодальные корреляции ухудшаются. Несмотря на этот коллапс согласования, стандартные FM часто не могут количественно оценить возникающую неопределенность модели, выдавая высокоуверенные, но вырожденные вложения в невидимых областях [6]. Таким образом, интеграция надежного обнаружения OOD необходима для выявления нарушений согласования, гарантируя, что модель воздерживается от вывода за пределами своего допустимого режима.

Хотя в компьютерном зрении существует обширный опыт, обнаружение OOD в беспроводной связи находится в зачаточном состоянии; существующие работы в основном полагаются на одно-модальные RF-признаки и ошибки генеративного восстановления [7]-[9]. Кроме того, общая литература по OOD часто фокусируется на семантическом сдвиге — появлении совершенно новых классов (например, появление собаки в классификаторе кошек). Напротив, обобщение беспроводных сетей в основном сталкивается с ковариатным сдвигом [7]. Здесь вариации окружающей среды кардинально меняют статистическое распределение входных ковариат (например, импульсных характеристик канала), а не метки классов. Следовательно, модель не может полагаться на расширение своего словаря меток; вместо этого она должна улавливать структурные вариации самой среды. Решение проблемы ковариатного сдвига необходимо для беспроводных FM, которые должны поддерживать надежные представления признаков в различных, невидимых географических развертываниях.

В этой статье мы предлагаем WMFM-OOD — структуру обнаружения OOD на основе метрик, разработанную как предварительный шаг к решению проблем надежности беспроводных мультимодальных фундаментальных моделей. Опираясь на архитектуру WMFM [3], наша работа устраняет разрыв между обобщением фундаментальной модели и критически важным развертыванием с помощью трех ключевых вкладов:

Мы адаптируем принцип Максимального Сопоставления Концепций (Maximum Concept Matching, MCM), изначально разработанный для визуально-языковых моделей [10], к беспроводной области. В отличие от стандартного MCM, который полагается на текстовые подсказки, мы формулируем геометрический подход, который использует согласованные представления камеры и информации о состоянии канала (CSI) для обнаружения сдвигов распределения без необходимости переобучения. Мы вводим создание Прототипов Базовых Станций (BS) в совместном латентном пространстве. Путем агрегирования вложений из известных сред мы захватываем уникальные сигнатуры многообразий допустимых радио-сценариев, позволяя модели различать законные вариации и фундаментальные аномалии окружающей среды. Мы включаем механизм Softmax с температурным масштабированием для уточнения чувствительности обнаружения. Эта калибровка обостряет различие между внутри-выборочными (ID) и OOD-выборками. Таким образом, это позволяет избежать риска ошибочной классификации OOD-данных моделью — частой проблемы при использовании необработанных геометрических расстояний без надлежащего масштабирования.

Мы проверяем этот подход на наборе данных DeepVerse6G. Наши результаты показывают, что WMFM-OOD значительно превосходит некалиброванные базовые модели, достигая AUROC 0.8824 и снижая FPR95 примерно на 17% по сравнению с эталоном в оптимальном температурном режиме.

---

### II. Системная модель

Исследуемая структура ISAC состоит из \(K\) BS, обозначенных набором \(\kappa\), имеющих однородную решетку из \(M\) антенн и встроенные RGB-камеры для визуального восприятия. Сеть обслуживает \(U\) од-на-антенных пользовательских устройств (UE).

На этапе оценки восходящего канала пилот-символы передаются по OFDM-сигналу с \(S\) поднесущими. Вектор сигнала \(\mathbf{r}_s\in \mathbb{C}^M\), принятый на BS на \(s\)-й поднесущей, моделируется как:

\[\mathbf{r}_s = \mathbf{h}_s p_s + \mathbf{n}_s,\quad s = 1,\ldots ,S, \quad (1)\]

где \(p_s\) — переданный пилот-символ, \(\mathbf{n}_s\sim \mathcal{CN}(\mathbf{0},\sigma^2\mathbf{I})\) обозначает аддитивный гауссов шум, а \(\mathbf{h}_s\in \mathbb{C}^M\) представляет вектор канала в частотной области.

Агрегированная пространственно-частотная оценка канала представляется матрицей \(\mathbf{H}\in \mathbb{C}^{M\times S}\), построенной путем конкатенации отдельных векторов поднесущих:

\[\mathbf{H} = [\mathbf{h}_1,\mathbf{h}_2,\ldots ,\mathbf{h}_S]. \quad (2)\]

Эта матрица служит входным CSI для предлагаемой модели.

Для облегчения мультимодального обучения камера BS захватывает изображение \(\mathbf{V}\) в предположении, что оно идеально синхронизировано с прибытием радиокадра. Следовательно, обучающий набор данных состоит из кортежей \(\mathcal{T} = \{\mathbf{(H,V,y)}\}\), где \(y\) обозначает метку истинности для целевого приложения (например, позиционирование пользователя или обнаружение LOS). Эта структура позволяет извлекать общие признаки между радиочастотной и визуальной областями.

#### A. Постановка задачи

Основная цель мультимодальной структуры в [3] — обучить параметризованные модально-специфичные кодировщики, обозначаемые как \(f_{\mathrm{rf}}(\cdot ;\theta_{\mathrm{rf}})\) и \(f_{\mathrm{vis}}(\cdot ;\theta_{\mathrm{vis}})\), которые отображают входные данные в общее пространство латентных представлений. Для \(i\)-й выборки векторы латентных признаков получаются следующим образом:

\[\mathbf{l}_{\mathrm{rf},i} = f_{\mathrm{rf}}(\mathbf{H}_i),\quad \mathbf{l}_{\mathrm{vis},i} = f_{\mathrm{vis}}(\mathbf{V}_i). \quad (3)\]

Цель базового обучения — минимизировать функцию потерь контрастного обучения представлениям, \(\mathcal{L}_{\mathrm{rep}}\), обеспечивая согласование этих разнородных модальностей в общем латентном пространстве путем максимизации сходства положительных пар [3]:

\[\min_{\theta_{\mathrm{rf}},\theta_{\mathrm{vis}}}\mathcal{L}_{\mathrm{rep}}(\mathbf{l}_{\mathrm{rf}},\mathbf{l}_{\mathrm{vis}}). \quad (4)\]

Критически важно, что эта работа отходит от стандартного предположения о замкнутом множестве и рассматривает реалистичный сценарий открытого множества. Мы предполагаем наличие OOD-данных во время развертывания, что подразумевает фундаментальный сдвиг распределения между обучающей и тестовой средами, выражаемый как \(\mathbb{P}_{\mathrm{train}}(\mathbf{x},y)\neq \mathbb{P}_{\mathrm{test}}(\mathbf{x},y)\).

Формально, пусть \(\mathcal{X}_{\mathrm{ID}}\) представляет множество ID-выборок, а \(\mathcal{X}_{\mathrm{OOD}}\) — множество OOD-выборок. Обучающий набор данных \(\mathcal{D}_{\mathrm{train}}\) строго состоит из ID-данных:

\[\mathcal{D}_{\mathrm{train}} = \{\left(\mathbf{x}_i^{\mathrm{tr}},y_i^{\mathrm{tr}}\right)\mid \mathbf{x}_i^{\mathrm{tr}}\in \mathcal{X}_{\mathrm{ID}}\} . \quad (5)\]

И наоборот, тестовый набор данных \(\mathcal{D}_{\mathrm{test}}\) включает смесь известных и неизвестных распределений:

\[\mathcal{D}_{\mathrm{test}} = \{\left(\mathbf{x}_i^{\mathrm{te}},y_i^{\mathrm{te}}\right)\mid \mathbf{x}_i^{\mathrm{te}}\in \mathcal{X}_{\mathrm{ID}}\cup \mathcal{X}_{\mathrm{OOD}}\} . \quad (6)\]

Основная цель — разработать оценочную функцию \(S(\mathbf{x};\theta):\mathcal{X}\to \mathbb{R}\), которая присваивает скалярную оценку достоверности любой входной выборке \(\mathbf{x}\). Задача обнаружения OOD затем определяется как задача бинарной классификации с решающим правилом:

\[G(\mathbf{x}) = \left\{ \begin{array}{ll}\mathrm{ID}, & \mathrm{if} S(\mathbf{x})\geq \gamma \\ \mathrm{OOD}, & \mathrm{if} S(\mathbf{x})< \gamma \end{array} \right., \quad (7)\]

---

### III. Предлагаемая методология: Обнаружение OOD на основе метрик через мультимодальное сопоставление концепций

Чтобы решить задачу открытого множества, описанную в Разделе II, мы предлагаем надежную структуру обнаружения OOD на основе метрик, адаптированную для беспроводных сред. Наша стратегия адаптирует принцип MCM [10], изначально разработанный для визуально-языковых моделей, к области мультимодального беспроводного зондирования. В отличие от стандартного MCM, который полагается на предопределенные текстовые подсказки для формирования концепций, наш подход конструирует "Прототипы BS" непосредственно из геометрической структуры изученного латентного пространства. Это эффективно захватывает уникальную сигнатуру каждой радио-среды. Структура включает три ключевых этапа: Слияние признаков, Создание Прототипов BS и Оценка с Температурным Масштабированием.

#### A. Мультимодальное слияние признаков

Пусть \(f_{\mathrm{rf}}(\cdot)\) и \(f_{\mathrm{vis}}(\cdot)\) представляют предварительно обученные кодировщики для RF и визуальной модальностей соответственно. Для данной выборки мы извлекаем модально-специфичные вложения \(\mathbf{I}_{\mathrm{rf}}\in \mathbb{R}^{d_1}\) и \(\mathbf{I}_{\mathrm{vis}}\in \mathbb{R}^{d_2}\). Чтобы использовать дополнительную информацию из обеих областей, мы синтезируем необработанное составное вложение через конкатенацию: \(\mathbf{z}_{\mathrm{raw}} = [\mathbf{I}_{\mathrm{rf}};\mathbf{I}_{\mathrm{vis}}]\in \mathbb{R}^{d_1 + d_2}\).

Чтобы предотвратить искажение метрик сходства из-за различий в величинах, мы обеспечиваем сферическое пространство вложений, проецируя составной вектор на единичную гиперсферу:

\[\mathbf{z} = \frac{\mathbf{z}_{\mathrm{raw}}}{\|\mathbf{z}_{\mathrm{raw}}\|_{2}}. \quad (8)\]

Этот нормализованный вектор \(\mathbf{z}\) является основным входом для нашего механизма обнаружения.

#### B. Создание Прототипов BS

Отличительной особенностью нашего метода является автономное создание прототипов, которые явно представляют допустимые среды BS. Используя размеченный обучающий набор ID \(\mathcal{D}_{\mathrm{train}}\), мы генерируем репрезентативный центр (якорь) для каждого известного класса BS \(k\in \mathcal{K} = \{1,\ldots ,K\}\). Каждая BS соответствует определенному физическому местоположению.

Для каждого класса BS \(k\) мы агрегируем набор связанных обучающих вложений \(\mathcal{J}_k = \{i\mid y_i = k\}\). Центроид класса вычисляется усреднением этих нормализованных вложений:

\[\pmb{\mu}_k^{\mathrm{raw}} = \frac{1}{|\mathcal{J}_k|}\sum_{i\in \mathcal{J}_k}\mathbf{z}_i. \quad (9)\]

Для поддержания согласованности со сферическим входным пространством финальный прототип BS \(\mu_k\) получается путем повторной нормализации центроида:

\[\pmb{\mu}_k = \frac{\pmb{\mu}_k^{\mathrm{raw}}}{\|\pmb{\mu}_k^{\mathrm{raw}}\|_{2}}. \quad (10)\]

Эти прототипы \(\{\pmb {\mu}_k\}_{k = 1}^K\) служат стабильными опорными точками, инкапсулирующими идеальные мультимодальные признаки каждой известной среды BS. Это создание прототипов принципиально отличается от визуально-языкового MCM [10]. В то время как MCM полагается на дискретные текстовые подсказки, беспроводные каналы не имеют лингвистических эквивалентов для профилей многолучевого рассеяния. Следовательно, мы заменяем текстовые концепции непрерывными, мультисенсорными гиперсферическими многообразиями, полученными из синхронизированных радио-визуальных потоков, превращая семантический поиск в локализованную геометрическую систему привязки, адаптированную для беспроводных сред.

#### C. Оценка MCM с Температурным Масштабированием

Для поступающей тестовой выборки с нормализованным вложением \(\mathbf{z}_{\mathrm{test}}\) мы оцениваем ее соответствие известным многообразиям BS. Сначала мы вычисляем косинусное сходство между тестовой выборкой и каждым прототипом BS:

\[s_k(\mathbf{z}_{\mathrm{test}}) = \mathbf{z}_{\mathrm{test}}^{\top}\pmb {\mu}_k,\quad k\in \mathcal{K}. \quad (11)\]

Чтобы усилить разделение между ID и OOD-выборками, мы применяем функцию Softmax с температурным масштабированием и параметром \(\tau >0\). Вероятность принадлежности выборки к среде BS \(k\) определяется как:

\[p_k(\mathbf{z}_{\mathrm{test}};\tau) = \frac{\exp(s_k(\mathbf{z}_{\mathrm{test}})/\tau)}{\sum_{j = 1}^K\exp(s_j(\mathbf{z}_{\mathrm{test}})/\tau)}. \quad (12)\]

Финальная оценка обнаружения OOD определяется как максимальная вероятность по всем известным классам BS:

\[S_{\mathrm{MCM}}(\mathbf{z}_{\mathrm{test}}) = \max_{k\in \mathcal{K}}p_k(\mathbf{z}_{\mathrm{test}};\tau). \quad (13)\]

Важно отметить, что процесс вывода не зависит от меток. Оценочная функция \(S_{MCM}\) оценивает тестовую выборку по всем созданным прототипам \(\{\mu_k\}_{k = 1}^K\) без необходимости знания истинного ID BS. Это обеспечивает применимость в сценариях открытого множества, где истинный класс среды входящего сигнала может быть неизвестен или не определен. ID-выборки обычно будут тесно связаны со своим соответствующим прототипом BS, давая \(S_{\mathrm{MCM}}\approx 1\). Напротив, OOD-выборки, происходящие из неизвестных сред, будут демонстрировать низкое, равномерное сходство со всеми прототипами, что приводит к значительно сниженной оценке.

Полная процедура обучения и вывода формализована в Алгоритме 1 и изображена на Рис. 1.

Вычислительные накладные расходы WMFM-OOD незначительны на этапе вывода. Поскольку прототипы вычисляются автономно, механизм онлайн-оценки требует только векторных скалярных произведений, масштабируясь линейно как \(\mathcal{O}(K\cdot d_{total})\), где \(K\) — количество классов BS, а \(d_{total}\) — размерность совместного вложения. Это гарантирует, что детектор OOD практически не добавляет задержки к базовым кодировщикам, сохраняя возможность работы в реальном времени, необходимую для контуров управления 6G.

Рис. 1: Обзор архитектуры структуры WMFM-OOD. Модально-специфичные признаки (\(\mathbf{l}_{\mathrm{vis}}\) и \(\mathbf{l}_{\mathrm{rf}}\)) извлекаются из синхронизированных кадров камеры и матриц CSI, объединяются через конкатенацию и проецируются на единичную гиперсферу (z). Этап 1 (Автономный) агрегирует внутри-выборочные данные для создания стабильных геометрических Прототипов Базовых Станций (\(\mu_{k}\)). Этап 2 (Онлайн-вывод) оценивает входящие тестовые точки по этим прототипам, используя Softmax с температурным масштабированием для изоляции аномалий среды через направленную неопределенность.

Алгоритм 1 Предлагаемая структура WMFM-OOD

<table>

<tr><td>Алгоритм 1 Предлагаемая структура WMFM-OOD</td></tr>

<tr><td>Требуется: Обучающий набор ID Dtrain, Предварительно обученные кодировщики ftr, fvis, Температура τ, Порог γ.</td></tr>

<tr><td>1: // Этап 1: Создание Прототипов BS (Автономный)</td></tr>

<tr><td>2: для каждого класса BS k ∈ {1, ..., K} в ID данных do</td></tr>

<tr><td>3: Собрать вложения Zk = {zk | yk = k} из Dtrain</td></tr>

<tr><td>4: Вычислить центроид: μkraw = Среднее(Zk)</td></tr>

<tr><td>5: Нормализовать прототип: μk = μkraw/||μkraw||2</td></tr>

<tr><td>6: end for</td></tr>

<tr><td>7: // Этап 2: Вывод (Онлайн)</td></tr>

<tr><td>8: для каждой тестовой выборки (H, V) do</td></tr>

<tr><td>9: Извлечь признаки: ltr = ftr(H), lvis = fvis(V)</td></tr>

<tr><td>10: Объединить: zraw = [ltr; lvis]</td></tr>

<tr><td>11: Нормализовать: z = zraw/||zraw||2</td></tr>

<tr><td>12: Вычислить сходства: sk = zTμk для всех k</td></tr>

<tr><td>13: Вычислить вероятности: pk = Softmax(sk/τ)</td></tr>

<tr><td>14: Получить оценку: SMCM = maxk pk</td></tr>

<tr><td>15: если SMCM &lt; γ тогда</td></tr>

<tr><td>16: Прогноз ← OOD</td></tr>

<tr><td>17: иначе</td></tr>

<tr><td>18: Прогноз ← ID</td></tr>

<tr><td>19: end if</td></tr>

<tr><td>20: end for</td></tr>

</table>

---

### IV. Настройки симуляции

#### A. Конфигурация симуляции

Для проверки нашего предложенного подхода мы используем набор данных DeepVerse6G [11]. DeepVerse6G — это крупномасштабный симулированный мультимодальный набор данных, использующий методы трассировки лучей для воспроизведения физически точных сред распространения беспроводных сигналов вместе с синхронизированными данными датчиков. В частности, мы выбираем сценарий O1 в качестве ID-набора данных и сценарий Carla-Town1 в качестве OOD-набора данных. Сценарий O1 моделирует среду шоссе с четырьмя BS, расположенными вдоль дороги. Каждая BS оснащена антенной решеткой для связи и тремя камерами, обеспечивающими панорамное визуальное покрытие. Напротив, сценарий Carla-Town1 представляет собой городскую и жилую среду на пересечении дорог, с пятью BS, распределенными по различным перекресткам. Каждая BS оснащена камерами, обеспечивающими полное панорамное покрытие. Важно отметить, что, несмотря на макро-различия этих географических планировок, лежащие в основе локальные радио-визуальные суб-многообразия демонстрируют сильную неоднозначность признаков, создавая сложный эталон для ковариатного сдвига, где простые метрики на основе ближайших соседей или границ плотности страдают от серьезного перекрытия распределений.

Мы выбираем структурно различные сценарии — шоссе (O1) и город (Carla-Town1) — чтобы максимизировать расхождение областей, создавая сложный OOD-эталон. Эта конфигурация имеет решающее значение для оценки надежности FM в невидимых географических развертываниях.

#### B. Детали реализации

Мы используем предварительно обученную WMFM [3] в качестве базовой модели для нашей проверки. WMFM использует контрастную цель для проецирования входных данных от камер и CSI в единое латентное пространство, обеспечивая согласование между двумя модальностями. Важно отметить, что надежность WMFM зависит от предположения, что это изученное межмодальное согласование сохраняется во время вывода. В OOD-сценариях, таких как невидимые городские топологии, связь между визуальными и беспроводными признаками часто ухудшается. Следовательно, эффективный механизм обнаружения OOD необходим для обнаружения этих отклонений в согласовании, гарантируя, что последующие задачи не полагаются на несогласованные или вырожденные вложения.

Для оценки нашей структуры обнаружения OOD мы используем стандартные метрики, установленные в литературе [12]: AUROC и FPR95. AUROC предлагает независимую от порога меру разделимости, представляющую вероятность того, что случайная OOD-выборка получит более высокую оценку аномалии, чем случайная ID-выборка (где \(50\%\) указывает на случайное угадывание). Дополняя это, FPR95 измеряет процент OOD-выборок, неправильно классифицированных как внутри-выборочные, когда порог обнаружения настроен для поддержания \(95\%\) уровня истинно-положительных срабатываний для ID-данных. Минимизация FPR95 критически важна для беспроводных сетей, чтобы обеспечить надежную защиту от OOD-сигналов, сохраняя при этом высокую доступность услуг для легитимных соединений. Наконец, для оценки надежности нашей структуры в различных режимах масштабирования мы проводим анализ чувствительности, варьируя температурный параметр \(\tau \in \{0.1, 0.2, 0.5, 1, 5, 10, 50, 100\}\).

Для тщательной оценки эффективности нашего предложенного метода оценки с температурным масштабированием мы сравниваем его с четырьмя базовыми моделями.

1) Базовый уровень 1: Прямое межмодальное согласование \((S_{\mathrm{DMA}})\): Этот базовый уровень оценивает согласованность между двумя модальностями напрямую, независимо от прототипов базовых станций. Мы вычисляем скалярное произведение между нормализованным вложением камеры \(\mathbf{l}_{\mathrm{vis}}\) и вложением CSI \(\mathbf{l}_{\mathrm{rf}}\) для одной и той же выборки:

\[S_{\mathrm{DMA}} = \mathbf{l}_{\mathrm{vis}}^{\top}\mathbf{l}_{\mathrm{rf}}. \quad (14)\]

Поскольку WMFM обучается с помощью контрастной цели для максимизации сходства совпадающих пар, высокое скалярное произведение указывает на сильную межмодальную согласованность, характерную для ID-данных. И наоборот, ожидается, что OOD-выборки, характеризующиеся невидимыми признаками среды, будут демонстрировать более слабое согласование, что приведет к более низким оценкам.

2) Базовый уровень 2: Максимальное сходство с прототипом \((S_{\mathrm{MPS}})\): Этот базовый уровень оценивает соответствие тестовой выборки известным многообразиям BS, используя необработанное геометрическое расстояние, идентичное первому шагу нашего предложенного метода, но без температурного масштабирования или нормализации. Для тестовой выборки \(\mathbf{z}_{\mathrm{test}}\) мы определяем оценку как максимальное косинусное сходство с любым изученным прототипом BS:

\[S_{\mathrm{MPS}} = \max_{k\in \mathcal{K}}(\mathbf{z}_{\mathrm{test}}^{\top}\mu_k). \quad (15)\]

Эта метрика служит абляционным исследованием для операции Softmax, позволяя нам изолировать конкретный вклад вероятностной калибровки (и температурного параметра \(\tau\)) в производительность обнаружения OOD.

3) Базовый уровень 3: Обнаружение OOD на основе энергии \((S_{\mathrm{Energy}})\): Чтобы оценить нашу структуру по сравнению с невероятностным базовым уровнем, мы адаптируем структуру обнаружения OOD на основе энергии [13] к нашей архитектуре без логитов. Вместо принудительного ограниченного распределения вероятностей Softmax, отрицательная свободная энергия вычисляется непосредственно по необработанным геометрическим проекциям прототипов:

\[S_{\mathrm{Energy}} = T_{\mathrm{e}}\cdot \log \sum_{k = 1}^{K}\exp \left(\frac{\mathbf{z}_{\mathrm{test}}^{\top}\mu_k}{T_{\mathrm{e}}}\right) \quad (16)\]

где \(T_{\mathrm{e}}\) — гиперпараметр температурной энергии. Более низкие значения энергии подразумевают более высокое соответствие плотности многообразию ID, в то время как аномалии демонстрируют структурно более низкие метрики. Мы проводим эмпирические оценки, перебирая гиперпараметр температуры энергии в диапазоне \(T_{\mathrm{e}} \in [0.001, 100]\); для краткости мы сообщаем только об оптимальной производительности, достигнутой при \(T_{\mathrm{e}} = 0.01\).

4) Базовый уровень 4: Мультимодальное расхождение модальностей \((S_{\mathrm{MMD}})\): Этот базовый уровень оценивает внутреннюю согласованность согласования между составляющими модальностями, независимо от прототипов среды. Используя замороженное пространство представлений, мы вычисляем отрицательное евклидово расстояние между нормализованным визуальным вложением \(\mathbf{l}_{\mathrm{vis}}\) и радиочастотным вложением \(\mathbf{l}_{\mathrm{rf}}\) для данной выборки:

\[S_{\mathrm{MMD}} = -\| f_{\mathrm{vis}}(V) - f_{\mathrm{rf}}(H)\| _2 \quad (17)\]

Серьезный ковариатный сдвиг ухудшает изученное межмодальное согласование, проявляясь в виде большего расстояния (более низкой оценки \(S_{\mathrm{MMD}}\)), в то время как внутри-выборочные входные данные характеризуются высокосогласованными, тесно связанными парами признаков.

Рис. 2: Зависимость AUROC и FPR от температуры \(\tau\).

### V. Результаты и обсуждение

В этом разделе мы оцениваем WMFM-OOD на наборе данных DeepVerse6G, анализируя влияние температурного масштабирования и слияния модальностей на надежность обнаружения.

Рис. 2a иллюстрирует влияние температурного масштабирования на эффективность обнаружения OOD. В то время как автономные базовые уровни согласования и расхождения \((S_{\mathrm{DMA}}\) и \(S_{\mathrm{MM

Источник: https://arxiv.org/abs/2607.21455

По теме: связь, ии-новости