The Sound of Risk: A Multimodal Physics-Informed Acoustic Model for Forecasting Market Volatility and Enhancing Market Interpretability

2508.18653v1 cs.LG, cs.AI, cs.SD, eess.AS, 62P05, 68T0, I.2.7; J.4 2025-08-28

Авторы:

Xiaoliang Chen, Xin Yu, Le Chang, Teng Jing, Jiashuai He, Ze Wang, Yangjun Luo, Xingyu Chen, Jiayue Liang, Yuchen Wang, Jiaying Xie

Резюме на русском

## Контекст Информационные ассимметрии на финансовых рынках часто усиливаются стратегически выстроенными корпоративными нарративами, что снижает эффективность традиционных текстовых анализов. В этой статье предлагается новый многомодальный подход для оценки финансового риска, который объединяет текстовую чувственность с паралингвистическими признаками, полученными из динамики голосовых складок экзекутивного штаба на заседаниях по выручке. Основой этого подхода является Физико-Информированная Акустическая Модель (PIAM), которая использует нелинейную акустику для отделения семантических признаков из RAW звуковых данных, подвергнутых деформациям, таким как сигнальное срезание. Данный подход позволяет детально изучать эмоциональную статистику и риск на финансовых рынках. ## Метод Многомодальная модель использует текстовую чувственность из текстов докладов и паралингвистические признаки из звуковых сигналов. Звуковые сигналы анализируются с помощью PIAM, которая применяет нелинейную акустику для извлечения эмоциональных признаков. Результаты анализа проектируются в пространство Affective State Label (ASL), состоящее из трех измерений: Tension (напряженность), Stability (стабильность) и Arousal (возбужденность). Эти признаки используются для оценки синхронных динамик в эмоциональном состоянии экзекутивного штаба. Данные были получены из 1 795 вызовов по выручке, объемом примерно 1 800 часов. ## Результаты Эксперименты показали, что риск на финансовых рынках может быть эффективно определен с помощью звуковых сигналов, а не только на основе текстовых данных. Многомодальная модель позиционируется как более точная в предсказании риска на рынке, чем модели, основанные только на тексте. Особое внимание уделено измерению уровня уверенности в эмоциональной динамике, в частности, отличительным признаком является возбуждение, вызванное переходом от скриптованного доклада к неорганизованному обмену во время Q&A секции. Было показано, что модель демонстрирует значительное превосходство над моделью, основанной только на финансовых данных. ## Значимость Этот подход может быть применен в системах мониторинга рынков, финансовом анализе и понимании рыночных динамик. Он предлагает преимущества в улучшении возможностей прогнозирования и риск-менеджмента. Кроме того, предложенный подход может иметь влияние на регулирование финансовых рынков и повышение уровня прозрачности. ## Выводы Выводы основываются на предложенной многомодальной модели, которая демонстрирует преимущества в прогнозировании финансового риска, опираясь на эмо

Abstract

Information asymmetry in financial markets, often amplified by strategically crafted corporate narratives, undermines the effectiveness of conventional textual analysis. We propose a novel multimodal framework for financial risk assessment that integrates textual sentiment with paralinguistic cues derived from executive vocal tract dynamics in earnings calls. Central to this framework is the Physics-Informed Acoustic Model (PIAM), which applies nonlinear acoustics to robustly extract emotional signatures from raw teleconference sound subject to distortions such as signal clipping. Both acoustic and textual emotional states are projected onto an interpretable three-dimensional Affective State Label (ASL) space-Tension, Stability, and Arousal. Using a dataset of 1,795 earnings calls (approximately 1,800 hours), we construct features capturing dynamic shifts in executive affect between scripted presentation and spontaneous Q&A exchanges. Our key finding reveals a pronounced divergence in predictive capacity: while multimodal features do not forecast directional stock returns, they explain up to 43.8% of the out-of-sample variance in 30-day realized volatility. Importantly, volatility predictions are strongly driven by emotional dynamics during executive transitions from scripted to spontaneous speech, particularly reduced textual stability and heightened acoustic instability from CFOs, and significant arousal variability from CEOs. An ablation study confirms that our multimodal approach substantially outperforms a financials-only baseline, underscoring the complementary contributions of acoustic and textual modalities. By decoding latent markers of uncertainty from verifiable biometric signals, our methodology provides investors and regulators a powerful tool for enhancing market interpretability and identifying hidden corporate uncertainty.

Ссылки и действия

Читать на arXiv Скачать PDF

Дополнительные ресурсы:

Резюме на русском

Abstract

Ссылки и действия

Навигация