Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Membagi data menjadi N kelompok yang sama
Saya memiliki kerangka data yang berisi nilai di 4 kolom: Sebagai contoh: ID, price, click count,rating Yang ingin saya lakukan adalah "memecah" kerangka data ini menjadi N grup yang berbeda di mana setiap grup akan memiliki jumlah baris yang sama dengan distribusi harga, jumlah klik dan atribut penilaian yang sama. …
11 r  distributions 

1
Bagaimana saya bisa menghitung dalam bentuk tertutup?
Bagaimana seseorang dapat mengevaluasi harapan CDF normal kuadrat dalam bentuk tertutup? E[Φ(aZ+b)2]=∫∞−∞Φ(az+b)2ϕ(z)dzE[Φ(aZ+b)2]=∫−∞∞Φ(az+b)2ϕ(z)dz\mathbb{E}\left[\Phi\left(aZ+b\right)^{2}\right] = \int_{-\infty}^{\infty}\Phi\left(az+b\right)^{2}\phi(z)\,dz Di sini, , adalah bilangan real, , dan dan adalah fungsi kepadatan dan distribusi dari variabel acak normal standar, masing-masing.b Z ∼ N ( 0 , 1 ) ϕ ( ⋅ ) Φ ( ⋅ )aaabbbZ∼N(0,1)Z∼N(0,1)Z\sim\mathcal{N}(0,1)ϕ(⋅)ϕ(⋅)\phi(\cdot)Φ(⋅)Φ(⋅)\Phi(\cdot)

3
Pengklasifikasi dengan presisi yang disesuaikan vs pengingatan
Saya sedang mengerjakan masalah klasifikasi biner di mana jauh lebih penting untuk tidak memiliki false positive; cukup banyak negatif palsu ok. Saya telah menggunakan banyak pengklasifikasi di sklearn misalnya, tetapi saya pikir tidak satupun dari mereka memiliki kemampuan untuk menyesuaikan tradeoff presisi-recall secara eksplisit (mereka menghasilkan hasil yang cukup bagus …

2
Pertanyaan tentang Continuous Bag of Words
Saya mengalami kesulitan memahami kalimat ini: Arsitektur yang diusulkan pertama mirip dengan NNLM feedforward, di mana lapisan tersembunyi non-linear dihapus dan lapisan proyeksi dibagi untuk semua kata (bukan hanya matriks proyeksi); dengan demikian, semua kata diproyeksikan ke posisi yang sama (vektornya dirata-ratakan). Apa lapisan proyeksi vs matriks proyeksi? Apa artinya …


2
Mengapa kita harus menghapus musiman dari rangkaian waktu?
Saat bekerja dengan deret waktu, kami terkadang mendeteksi dan menghapus musiman menggunakan analisis spektral. Saya seorang pemula dalam rangkaian waktu, dan saya bingung mengapa orang ingin menghapus musiman dari rangkaian waktu asli? Tidak menghapus musiman mengubah data asli? Apa manfaat yang kita dapatkan dengan membangun rangkaian waktu dengan menghapus musiman?

2
Distribusi apa yang diasumsikan oleh uji Fisher?
Dalam pekerjaan saya, saya telah melihat beberapa kegunaan uji eksak Fisher, dan saya bertanya-tanya seberapa cocok dengan data saya. Melihat beberapa sumber saya mengerti bagaimana menghitung statistik, tetapi tidak pernah melihat penjelasan yang jelas dan formal dari hipotesis nol yang diasumsikan. Bisakah seseorang tolong jelaskan atau rujuk saya ke penjelasan …

2
Mengapa konvolusi bekerja?
Jadi saya tahu bahwa jika kita ingin menemukan distribusi probabilitas dari sejumlah variabel acak independen , kita dapat menghitungnya dari distribusi probabilitas dan , dengan mengatakanX+YX+YX + YXXXYYY fX+Y(a)=∫∞x=−∞fX,Y(X=x,Y=a−x) dx=∫∞x=−∞fX(x)fY(a−x) dxfX+Y(a)=∫x=−∞∞fX,Y(X=x,Y=a−x) dx=∫x=−∞∞fX(x)fY(a−x) dxf_{X + Y}(a) = \int_{x = -\infty}^{\infty} f_{X, Y}(X = x, Y = a - x)~dx = \int_{x …

1
Referensi dan Praktik terbaik untuk menyetel benih di Generasi Angka Acak pseudo
Dalam dokumen ini , yang berkaitan dengan perintah "set seed", orang-orang Stata mendiskusikan masalah yang terkait dengan pengaturan benih ketika menghasilkan angka pseudo-acak. Yang penting "jangan" adalah "jangan gunakan secara berurutan urutan bilangan asli sebagai biji, karena ini memiliki pola dan membahayakan keacakan semu". Satu-satunya "do" bercanda seperempat bercanda , …

2
Apa itu distribusi peluang log?
Saya membaca buku teks tentang pembelajaran mesin (Data Mining oleh Witten, et al., 2011) dan menemukan bagian ini: ... Selain itu, distribusi yang berbeda dapat digunakan. Meskipun distribusi normal biasanya merupakan pilihan yang baik untuk atribut numerik, itu tidak cocok untuk atribut yang memiliki minimum yang telah ditentukan tetapi tidak …

3
Apakah AUC yang baik untuk kurva presisi-recall?
Karena saya memiliki dataset yang sangat tidak seimbang (hasil positif 9%), saya memutuskan kurva presisi-recall lebih tepat daripada kurva ROC. Saya memperoleh ukuran ringkasan analog dari area di bawah kurva PR (0,49, jika Anda tertarik) tetapi tidak yakin bagaimana menafsirkannya. Saya pernah mendengar bahwa 0,8 atau di atas adalah AUC …

2
Bagaimana melakukan analisis residual untuk prediktor independen biner / dikotomi dalam regresi linier?
Saya melakukan regresi linier berganda di bawah ini dalam R untuk memprediksi pengembalian dana yang dikelola. reg <- lm(formula=RET~GRI+SAT+MBA+AGE+TEN, data=rawdata) Di sini hanya GRI & MBA yang merupakan prediktor biner / dikotomis; prediktor yang tersisa bersifat kontinu. Saya menggunakan kode ini untuk menghasilkan plot sisa untuk variabel biner. plot(rawdata$GRI, reg$residuals) …


2
Apakah mungkin untuk menerima hipotesis alternatif?
Saya mengetahui beberapa pertanyaan terkait di sini (misalnya, terminologi pengujian Hipotesis seputar nol , Apakah mungkin untuk membuktikan hipotesis nol? ) Tetapi saya tidak tahu jawaban pasti untuk pertanyaan saya di bawah ini. Misalkan tes hipotesis di mana kita ingin menguji apakah koin itu adil atau tidak. Kami memiliki dua …


Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.