Open this publication in new window or tab >>2024 (English)In: Annales de l'I.H.P. Probabilites et statistiques, ISSN 0246-0203, E-ISSN 1778-7017, Vol. 60, no 2, p. 1048-1076Article in journal (Refereed) Published
Abstract [en]
In this paper, we show the central limit theorem for the logarithmic determinant of the sample correlation matrix R constructed from the (p×n)(p×n)-dimensional data matrix X containing independent and identically distributed random entries with mean zero, variance one and infinite fourth moments. Precisely, we show that for p/n→γ∈(0,1) as n,p→∞ the logarithmic law
log(1-p/n)+p-p/n%7D%7B%5Csqrt%7B-2log(1-p/n)-2p/n%7D%7D%20%7B%5Coverset%20d%7B%5Crightarrow%7D%7DN(0,1))
is still valid if the entries of the data matrix X follow a symmetric distribution with a regularly varying tail of index α∈(3,4). The latter assumptions seem to be crucial, which is justified by the simulations: if the entries of X have the infinite absolute third moment and/or their distribution is not symmetric, the logarithmic law is not valid anymore. The derived results highlight that the logarithmic determinant of the sample correlation matrix is a very stable and flexible statistic for heavy-tailed big data and open a novel way of analysis of high-dimensional random matrices with self-normalized entries.
Abstract [fr]
Dans cet article, nous démontrons le théorème de la limite centrale pour le déterminant logarithmique d’une matrice de corrélation R construite à partir d’une matrice de données X de taille (p×n)(p×n) contenant des entrées indépendantes d’espérance 0, variance 1 et quatrième moment infini. Plus précisément, nous démontrons que dans le régime p/n→γ∈(0,1) quand n,p→∞ la loi logarithmique
log(1-p/n)+p-p/n%7D%7B%5Csqrt%7B-2log(1-p/n)-2p/n%7D%7D%20%7B%5Coverset%20d%7B%5Crightarrow%7D%7DN(0,1))
est toujours valable si les entrées de la matrice de données X suivent une distribution symétrique avec une queue à variation régulière d’indice α∈(3,4). Ces dernières conditions semblent être cruciales, ce qui est justifié par les simulations : si les entrées de X n’ont pas de troisième moment et/ou si leur distribution n’est pas symétrique, la loi logarithmique n’est plus valable. Les résultats obtenus mettent en évidence que le déterminant logarithmique d’une matrice de corrélation est une statistique très stable et flexible pour les données massives à queue lourde et ouvrent une nouvelle voie pour analyser les grandes matrices aléatoires avec entrées auto-normalisées.
Keywords
Sample correlation matrix, Logarithmic determinant, Random matrix theory, Heavy tails, Infinite fourth moment
National Category
Probability Theory and Statistics
Research subject
Mathematical Statistics
Identifiers
urn:nbn:se:su:diva-226669 (URN)10.1214/23-AIHP1368 (DOI)001250209000012 ()2-s2.0-85196278449 (Scopus ID)
2024-02-142024-02-142024-11-22Bibliographically approved