Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Permintaan referensi: Statistik klasik untuk para ilmuwan data yang bekerja
Saya seorang ilmuwan data yang bekerja dengan pengalaman yang solid dalam regresi, algoritma tipe pembelajaran mesin lainnya, dan pemrograman (baik untuk analisis data dan pengembangan perangkat lunak umum). Sebagian besar kehidupan kerja saya difokuskan pada pembuatan model untuk akurasi prediktif (bekerja di bawah berbagai kendala bisnis), dan membangun jaringan pipa …

3
Kapan Anda akan menggunakan PCA daripada LDA dalam klasifikasi?
Saya membaca artikel ini tentang perbedaan antara Analisis Komponen Utama dan Analisis Diskriminan Berganda (Analisis Diskriminan Linier), dan saya mencoba memahami mengapa Anda akan menggunakan PCA daripada MDA / LDA. Penjelasannya dirangkum sebagai berikut: secara kasar berbicara dalam PCA kami mencoba untuk menemukan sumbu dengan varian maksimum di mana data …

2
Bandingkan signifikansi statistik dari perbedaan antara dua regresi polinomial dalam R
Jadi pertama-tama saya melakukan riset di forum ini, dan saya tahu pertanyaan yang sangat mirip telah ditanyakan tetapi biasanya mereka belum dijawab dengan benar atau kadang-kadang jawabannya tidak cukup detail untuk saya pahami. Jadi kali ini pertanyaan saya adalah: Saya punya dua set data, masing-masing, saya melakukan regresi polinomial seperti: …

1
Takik plot kotak vs. Interval Tukey-Kramer
Dokumen bantuan "takik" ( atau teks asli ) dari boxplot di 'R' memberikan yang berikut: Jika takik dua plot tidak tumpang tindih ini adalah 'bukti kuat' bahwa kedua median berbeda (Chambers et al, 1983, hal. 62). Lihat boxplot.stats untuk perhitungan yang digunakan. dan ' boxplot.stats ' memberikan yang berikut: Takik …

1
Merencanakan nilai prediksi dalam deret waktu ARIMA di R
Kemungkinan ada lebih dari satu kesalahpahaman serius dalam pertanyaan ini, tetapi ini tidak dimaksudkan untuk membuat perhitungannya benar, tetapi lebih untuk memotivasi pembelajaran deret waktu dengan beberapa fokus dalam pikiran. Dalam mencoba memahami penerapan deret waktu, tampaknya seolah-olah tren data membuat prediksi nilai masa depan menjadi tidak masuk akal. Misalnya, …

1
Bagaimana cara mendapatkan "nilai eigen" (persentase dari varian yang dijelaskan) dari vektor yang bukan vektor eigen PCA?
Saya ingin memahami bagaimana saya bisa mendapatkan persentase varians dari kumpulan data, bukan di ruang koordinat yang disediakan oleh PCA, tetapi terhadap serangkaian vektor (rotasi) yang sedikit berbeda. set.seed(1234) xx <- rnorm(1000) yy <- xx * 0.5 + rnorm(1000, sd = 0.6) vecs <- cbind(xx, yy) plot(vecs, xlim = c(-4, …

1
Splines periodik agar sesuai dengan data periodik
Dalam komentar untuk pertanyaan ini , pengguna @whuber mengutip kemungkinan menggunakan versi splines periodik agar sesuai dengan data periodik. Saya ingin tahu lebih banyak tentang metode ini, khususnya persamaan yang mendefinisikan splines, dan bagaimana menerapkannya dalam praktik (saya sebagian besar Rpengguna, tetapi saya bisa puas dengan MATLAB atau Python, jika …

2
Kemungkinan lima anak di kelas yang sama memiliki nama yang sama
Di forum penamaan bayi, calon orang tua mengulangi beberapa versi Ketakutan Jennifer mereka sepanjang waktu: "Saya tidak ingin anak saya menjadi salah satu dari 5 di kelasnya dengan namanya." Masalahnya, tidak ada nama yang mendekati popularitas semacam itu lagi, dan bahkan pada puncak kegemaran Jennifer, Anda tidak mendapatkan lima dari …

3
Mengapa taksiran CV dari Uji Kesalahan Meremehkan Kesalahan Tes Aktual?
Ini adalah pemahaman saya bahwa estimasi validasi silang k-fold dari kesalahan tes biasanya meremehkan kesalahan tes yang sebenarnya. Saya bingung mengapa ini masalahnya. Saya mengerti mengapa kesalahan pelatihan biasanya lebih rendah dari kesalahan pengujian - karena Anda melatih model pada data yang sama dengan yang Anda perkirakan kesalahannya! Tapi itu …

2
Harapan
Biarkan X1X1X_1 , X2X2X_2 , ⋯⋯\cdots , Xd∼N(0,1)Xd∼N(0,1)X_d \sim \mathcal{N}(0, 1) dan menjadi independen. Apa harapan X41(X21+⋯+X2d)2X14(X12+⋯+Xd2)2\frac{X_1^4}{(X_1^2 + \cdots + X_d^2)^2} ? Mudah untuk menemukan E(X21X21+⋯+X2d)=1dE(X12X12+⋯+Xd2)=1d\mathbb{E}\left(\frac{X_1^2}{X_1^2 + \cdots + X_d^2}\right) = \frac{1}{d} oleh simetri. Tapi saya tidak tahu bagaimana menemukan harapanX41(X21+⋯+X2d)2X14(X12+⋯+Xd2)2\frac{X_1^4}{(X_1^2 + \cdots + X_d^2)^2} . Bisakah Anda memberikan beberapa …

1
Nilai yang diharapkan dari rasio maksimum dan variabel normal
Misalkan yang IID dari dan membiarkan menyatakan 'th elemen terkecil dari . Bagaimana seseorang dapat mengikat maksimum yang diharapkan dari rasio antara dua elemen berturut-turut dalam ? Artinya, bagaimana Anda bisa menghitung upperbound pada:X1,...,XnX1,...,XnX_1,...,X_nN(μ,σ2)N(μ,σ2)N(\mu,\sigma^2)X(i)X(i)X_{(i)}iiiX1,...,XnX1,...,XnX_1,...,X_nX(i)X(i)X_{(i)} E[maxi=1,...,n−1(X(i+1)X(i))]E[maxi=1,...,n−1(X(i+1)X(i))]E\left[\max\limits_{i=1,...,n-1}\left(\frac{X_{(i+1)}}{X_{(i)}}\right)\right] Literatur yang telah saya dapat temukan sebagian besar difokuskan pada rasio antara dua variabel acak …

2
Prasyarat matematika dan statistik untuk memahami filter partikel?
Saat ini saya mencoba memahami filter partikel dan kemungkinan penggunaannya dalam keuangan dan saya berjuang sedikit. Apa prasyarat matematika dan statistik yang harus saya tinjau kembali (berasal dari latar belakang keuangan kuantitatif) untuk (i) membuat dasar-dasar filter partikel dapat diakses, dan (ii) untuk kemudian memahaminya secara menyeluruh? Saya memiliki pengetahuan …


1
Tampilkan taksiran konvergen ke persentil melalui statistik pesanan
Biarkan menjadi urutan variabel acak iid yang disampel dari distribusi stabil alpha , dengan parameter .X1,X2,…,X3nX1,X2,…,X3nX_1, X_2, \ldots, X_{3n}α=1.5,β=0,c=1.0,μ=1.0α=1.5,β=0,c=1.0,μ=1.0\alpha = 1.5, \; \beta = 0, \; c = 1.0, \; \mu = 1.0 Sekarang perhatikan urutan , di mana , untuk .Y1,Y2,…,YnY1,Y2,…,YnY_1, Y_2, \ldots, Y_{n}Yj+1=X3j+1X3j+2X3j+3−1Yj+1=X3j+1X3j+2X3j+3−1Y_{j+1} = X_{3j+1}X_{3j+2}X_{3j+3} - 1j=0,…,n−1j=0,…,n−1j=0, \ldots, …

3
Apakah mungkin untuk melatih jaringan saraf untuk menggambar dengan gaya tertentu?
Apakah mungkin untuk melatih jaringan saraf untuk menggambar dengan gaya tertentu? (Jadi itu mengambil gambar dan menggambar ulang dengan gaya yang dilatihnya.) Apakah ada teknologi yang disetujui untuk hal semacam itu? Saya tahu tentang algoritma DeepArt. Adalah baik untuk mengisi gambar utama dengan pola tertentu (misalnya, gambar vangoghify), tetapi saya …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.