The Sound of Risk: A Multimodal Physics-Informed Acoustic Model for Forecasting Market Volatility and Enhancing Market Interpretability
2508.18653v1
cs.LG, cs.AI, cs.SD, eess.AS, 62P05, 68T0, I.2.7; J.4
2025-08-28
Авторы:
Xiaoliang Chen, Xin Yu, Le Chang, Teng Jing, Jiashuai He, Ze Wang, Yangjun Luo, Xingyu Chen, Jiayue Liang, Yuchen Wang, Jiaying Xie
Резюме на русском
## Контекст
Информационные ассимметрии на финансовых рынках часто усиливаются стратегически выстроенными корпоративными нарративами, что снижает эффективность традиционных текстовых анализов. В этой статье предлагается новый многомодальный подход для оценки финансового риска, который объединяет текстовую чувственность с паралингвистическими признаками, полученными из динамики голосовых складок экзекутивного штаба на заседаниях по выручке. Основой этого подхода является Физико-Информированная Акустическая Модель (PIAM), которая использует нелинейную акустику для отделения семантических признаков из RAW звуковых данных, подвергнутых деформациям, таким как сигнальное срезание. Данный подход позволяет детально изучать эмоциональную статистику и риск на финансовых рынках.
## Метод
Многомодальная модель использует текстовую чувственность из текстов докладов и паралингвистические признаки из звуковых сигналов. Звуковые сигналы анализируются с помощью PIAM, которая применяет нелинейную акустику для извлечения эмоциональных признаков. Результаты анализа проектируются в пространство Affective State Label (ASL), состоящее из трех измерений: Tension (напряженность), Stability (стабильность) и Arousal (возбужденность). Эти признаки используются для оценки синхронных динамик в эмоциональном состоянии экзекутивного штаба. Данные были получены из 1 795 вызовов по выручке, объемом примерно 1 800 часов.
## Результаты
Эксперименты показали, что риск на финансовых рынках может быть эффективно определен с помощью звуковых сигналов, а не только на основе текстовых данных. Многомодальная модель позиционируется как более точная в предсказании риска на рынке, чем модели, основанные только на тексте. Особое внимание уделено измерению уровня уверенности в эмоциональной динамике, в частности, отличительным признаком является возбуждение, вызванное переходом от скриптованного доклада к неорганизованному обмену во время Q&A секции. Было показано, что модель демонстрирует значительное превосходство над моделью, основанной только на финансовых данных.
## Значимость
Этот подход может быть применен в системах мониторинга рынков, финансовом анализе и понимании рыночных динамик. Он предлагает преимущества в улучшении возможностей прогнозирования и риск-менеджмента. Кроме того, предложенный подход может иметь влияние на регулирование финансовых рынков и повышение уровня прозрачности.
## Выводы
Выводы основываются на предложенной многомодальной модели, которая демонстрирует преимущества в прогнозировании финансового риска, опираясь на эмо
Abstract
Information asymmetry in financial markets, often amplified by strategically
crafted corporate narratives, undermines the effectiveness of conventional
textual analysis. We propose a novel multimodal framework for financial risk
assessment that integrates textual sentiment with paralinguistic cues derived
from executive vocal tract dynamics in earnings calls. Central to this
framework is the Physics-Informed Acoustic Model (PIAM), which applies
nonlinear acoustics to robustly extract emotional signatures from raw
teleconference sound subject to distortions such as signal clipping. Both
acoustic and textual emotional states are projected onto an interpretable
three-dimensional Affective State Label (ASL) space-Tension, Stability, and
Arousal. Using a dataset of 1,795 earnings calls (approximately 1,800 hours),
we construct features capturing dynamic shifts in executive affect between
scripted presentation and spontaneous Q&A exchanges. Our key finding reveals a
pronounced divergence in predictive capacity: while multimodal features do not
forecast directional stock returns, they explain up to 43.8% of the
out-of-sample variance in 30-day realized volatility. Importantly, volatility
predictions are strongly driven by emotional dynamics during executive
transitions from scripted to spontaneous speech, particularly reduced textual
stability and heightened acoustic instability from CFOs, and significant
arousal variability from CEOs. An ablation study confirms that our multimodal
approach substantially outperforms a financials-only baseline, underscoring the
complementary contributions of acoustic and textual modalities. By decoding
latent markers of uncertainty from verifiable biometric signals, our
methodology provides investors and regulators a powerful tool for enhancing
market interpretability and identifying hidden corporate uncertainty.