Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data



1
Pemahaman intuitif teorema Halmos-Savage
The Halmos-Savage Teorema mengatakan bahwa untuk model statistik didominasi (Ω,A,P)(Ω,A,P)(\Omega, \mathscr A, \mathscr P) statistik T:(Ω,A,P)→(Ω′,A′)T:(Ω,A,P)→(Ω′,A′)T: (\Omega, \mathscr A, \mathscr P)\to(\Omega', \mathscr A') adalah cukup jika (dan hanya jika) untuk semua {P∈P}{P∈P}\{P \in \mathscr{P} \} ada TTT versi yang dapat diukur dari turunan Radon Nikodym dPdP∗dPdP∗\frac{dP}{dP*} manadP∗dP∗dP*adalah ukuran istimewa sehinggaP∗=∑∞i=1PiciP∗=∑i=1∞PiciP*=\sum_{i=1}^\infty …

1
Apa arti sumbu pada t-SNE?
Saat ini saya mencoba untuk membungkus kepala saya dengan matematika t-SNE . Sayangnya, masih ada satu pertanyaan yang tidak dapat saya jawab dengan memuaskan: Apa arti sebenarnya dari sumbu dalam grafik t-SNE? Jika saya akan memberikan presentasi tentang topik ini atau memasukkannya ke dalam publikasi apa pun: Bagaimana saya memberi …


3
Mengapa beberapa (jika tidak semua) tes hipotesis parametrik menggunakan pengambilan sampel acak?
Tes seperti Z, t, dan beberapa lainnya mengasumsikan bahwa data didasarkan pada pengambilan sampel acak. Mengapa? Misalkan saya sedang melakukan penelitian eksperimental, di mana saya lebih peduli untuk validitas internal daripada yang eksternal. Jadi, jika sampel saya mungkin sedikit bias, oke, karena saya telah menerima untuk tidak menyimpulkan hipotesis untuk …

5
Menentukan ukuran sampel sebelum memulai percobaan atau menjalankan percobaan tanpa batas?
Saya mempelajari statistik bertahun-tahun yang lalu dan telah melupakan semuanya sehingga ini mungkin tampak seperti pertanyaan konseptual umum daripada yang spesifik tetapi di sini adalah masalah saya. Saya bekerja untuk situs web e-commerce sebagai Desainer UX. Kami memiliki kerangka kerja pengujian A / B yang dibangun bertahun-tahun lalu dan saya …


2
Bagaimana membenarkan tingkat kesalahan false-positif / false-negative yang dipilih dan rasio biaya yang mendasarinya?
Konteks Sekelompok ilmuwan sosial dan ahli statistik ( Benjamin et al., 2017 ) baru-baru ini menyarankan bahwa tingkat false-positive tipikal ( = .05) digunakan sebagai ambang batas untuk menentukan "signifikansi statistik" perlu disesuaikan dengan ambang batas yang lebih konservatif. ( = .005). Sekelompok ilmuwan sosial dan ahli statistik yang bersaing …

5
ketikadansecara independen
XXX dan adalah variabel acak yang didistribusikan secara independen di mana dan . Apa distribusi ?YYYX∼χ2(n−1)X∼χ(n−1)2X\sim\chi^2_{(n-1)}Y∼Beta(n2−1,n2−1)Y∼Beta(n2−1,n2−1)Y\sim\text{Beta}\left(\frac{n}{2}-1,\frac{n}{2}-1\right)Z=(2Y−1)X−−√Z=(2Y−1)XZ=(2Y-1)\sqrt X Kepadatan sambungan diberikan oleh(X,Y)(X,Y)(X,Y) fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}f_{X,Y}(x,y)=f_X(x)f_Y(y)=\frac{e^{-\frac{x}{2}}x^{\frac{n-1}{2}-1}}{2^{\frac{n-1}{2}}\Gamma\left(\frac{n-1}{2}\right)}\cdot\frac{y^{\frac{n}{2}-2}(1-y)^{\frac{n}{2}-2}}{B\left(\frac{n}{2}-1,\frac{n}{2}-1\right)}\mathbf1_{\{x>0\,,\,00\,,\,|z|

1
Matriks berupa backpropagation dengan normalisasi batch
Normalisasi batch telah dikreditkan dengan peningkatan kinerja substansial dalam jaring saraf yang dalam. Banyak materi di internet menunjukkan cara mengimplementasikannya berdasarkan aktivasi-demi-aktivasi. Saya sudah menerapkan backprop menggunakan aljabar matriks, dan mengingat bahwa saya bekerja dalam bahasa tingkat tinggi (sambil mengandalkan Rcpp(dan akhirnya GPU) untuk perkalian matriks padat), merobek semuanya dan …

3
Bagaimana memprogram simulasi Monte Carlo dari paradoks kotak Bertrand?
Masalah berikut telah diposting di Halaman Facebook Mensa International: \quad\quad\quad\quad\quad\quad\quad\quad Posting itu sendiri menerima 1000+ komentar tetapi saya tidak akan membahas detail tentang perdebatan di sana karena saya tahu ini adalah paradoks kotak Bertrand dan jawabannya adalah . Apa yang membuat saya tertarik di sini adalah bagaimana seseorang menjawab masalah …

3
Peneliti 1 menjalankan 1000 regresi, peneliti 2 menjalankan hanya 1, keduanya mendapatkan hasil yang sama - haruskah mereka membuat kesimpulan yang berbeda?
Bayangkan seorang peneliti sedang mengeksplorasi dataset dan menjalankan 1000 regresi yang berbeda dan ia menemukan satu hubungan yang menarik di antara mereka. Sekarang bayangkan peneliti lain dengan data yang sama hanya menjalankan 1 regresi, dan ternyata itu sama dengan yang peneliti lain lakukan untuk menemukan 1000 regresi. Peneliti 2 tidak …

1
Generalized additive models (GAMs), interaksi, dan kovariat
Saya telah menjelajahi sejumlah alat untuk perkiraan, dan telah menemukan Generalized Additive Models (GAMs) memiliki potensi paling besar untuk tujuan ini. GAM itu luar biasa! Mereka memungkinkan untuk model yang rumit untuk ditentukan dengan sangat ringkas. Namun, kejelasan yang sama itu membuat saya kebingungan, khususnya terkait dengan bagaimana GAM memahami …
12 r  modeling  gam  mgcv 

1
Apakah
Kolega saya ingin menganalisis beberapa data setelah mengubah variabel respons dengan menaikkannya menjadi kekuatan (yaitu,y0,125).1818\frac18y0.125y0.125y^{0.125} Saya tidak nyaman dengan ini, tetapi berjuang untuk mengartikulasikan mengapa. Saya tidak dapat memikirkan alasan mekanistik untuk transformasi ini. Saya juga belum pernah melihatnya sebelumnya, dan saya khawatir mungkin itu mengembang tingkat kesalahan Tipe I …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.