Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

2
Apakah transformasi log merupakan teknik yang valid untuk menguji-t data yang tidak normal?
Dalam meninjau sebuah makalah, penulis menyatakan, "Variabel hasil kontinyu yang menunjukkan distribusi miring diubah, menggunakan logaritma alami, sebelum uji t dilakukan untuk memenuhi asumsi prasyarat normalitas." Apakah ini cara yang dapat diterima untuk menganalisis data yang tidak normal, terutama jika distribusi yang mendasarinya tidak selalu lognormal? Ini mungkin pertanyaan yang …

2
Memperbarui probabilitas klasifikasi dalam regresi logistik melalui waktu
Saya sedang membangun model prediktif yang memperkirakan probabilitas keberhasilan siswa di akhir semester. Saya secara khusus tertarik pada apakah siswa berhasil atau gagal, di mana kesuksesan biasanya didefinisikan sebagai menyelesaikan kursus dan mencapai 70% atau lebih poin dari total poin yang mungkin. Ketika saya menggunakan model, estimasi probabilitas keberhasilan perlu …


2
Bagaimana cara memprediksi kapan peristiwa berikutnya terjadi, berdasarkan waktu kejadian sebelumnya?
Saya seorang siswa sekolah menengah dan saya sedang mengerjakan proyek pemrograman komputer, tetapi saya tidak memiliki banyak pengalaman dalam statistik dan pemodelan data di luar kursus statistik SMA, jadi saya agak bingung. Pada dasarnya, saya memiliki daftar yang cukup besar (anggap itu cukup besar untuk memenuhi asumsi untuk setiap tes …

3
Pembelajaran semi-diawasi, pembelajaran aktif dan pembelajaran mendalam untuk klasifikasi
Suntingan terakhir dengan semua sumber daya diperbarui: Untuk sebuah proyek, saya menerapkan algoritma pembelajaran mesin untuk klasifikasi. Tantangan: Data berlabel yang cukup terbatas dan lebih banyak lagi data yang tidak berlabel. Tujuan: Terapkan klasifikasi semi-terawasi Terapkan proses pelabelan yang semi-diawasi (dikenal sebagai pembelajaran aktif) Saya telah menemukan banyak informasi dari …


5
Analog 2D deviasi standar?
Pertimbangkan eksperimen berikut: sekelompok orang diberikan daftar kota, dan diminta untuk menandai lokasi yang sesuai pada peta dunia (jika tidak berlabel). Untuk setiap kota, Anda akan mendapatkan sebaran poin yang secara kasar berpusat di kota masing-masing. Beberapa kota, katakanlah Istanbul, akan menunjukkan penyebaran kurang dari yang lain, kata Moskow. Mari …

2
Apa distribusi perbedaan dua-t-distribusi
... dan mengapa ? Dengan asumsi , adalah variabel acak independen dengan mean dan varians masing-masing. Buku statistik dasar saya memberi tahu saya bahwa distribusi memiliki properti berikut:X 2 μ 1 , μ 2 σ 2 1 , σ 2 2 X 1 - X 2X1X1X_1X2X2X_2μ1, μ2μ1,μ2\mu_1,\mu_2σ21, σ22σ12,σ22\sigma^2_1,\sigma^2_2X1- X2X1-X2X_1-X_2 E( …

4
Bagaimana cara menghitung interval kepercayaan rata-rata mean?
Bayangkan Anda mengulang percobaan tiga kali. Dalam setiap percobaan, Anda mengumpulkan pengukuran rangkap tiga. Rangkap tiga cenderung saling berdekatan, dibandingkan dengan perbedaan antara tiga cara eksperimental. Menghitung nilai tengah berarti cukup mudah. Tetapi bagaimana seseorang bisa menghitung interval kepercayaan untuk grand mean? Contoh data: Eksperimen 1: 34, 41, 39 Eksperimen …


1
Apa pendapat masyarakat tentang Kuadran Keempat?
Nassim Taleb, dari ketenaran Black Swan (atau keburukan), telah menguraikan konsep dan mengembangkan apa yang ia sebut "peta batas Statistik" . Argumen dasarnya adalah bahwa ada satu jenis masalah keputusan di mana penggunaan model statistik apa pun berbahaya. Ini akan menjadi masalah keputusan di mana konsekuensi membuat keputusan yang salah …

7
Mean dari jendela geser di R
Saya memiliki vektor nilai yang ingin saya laporkan rata-rata di jendela sepanjang slide yang lebih kecil. Misalnya, untuk vektor dengan nilai berikut: 4, 5, 7, 3, 9, 8 Ukuran jendela 3 dan slide 2 akan melakukan hal berikut: (4+5+7)/3 = 5.33 (7+3+9)/3 = 6.33 (9+8)/3 = 5.67 Dan kembalikan vektor …
19 r 


4
Kapan saya harus menggunakan autoencoder variasional sebagai lawan dari autoencoder?
Saya mengerti struktur dasar autoencoder variasional dan autoencoder normal (deterministik) dan matematika di belakangnya, tetapi kapan dan mengapa saya lebih suka satu jenis autoencoder dari yang lain? Yang bisa saya pikirkan adalah distribusi sebelumnya variabel laten dari autoencoder variasional memungkinkan kita untuk mengambil sampel variabel laten dan kemudian membangun gambar …

2
Mengapa perlu untuk mengambil sampel dari distribusi posterior jika kita sudah TAHU distribusi posterior?
Pemahaman saya adalah bahwa ketika menggunakan pendekatan Bayesian untuk memperkirakan nilai parameter: Distribusi posterior adalah kombinasi dari distribusi sebelumnya dan distribusi kemungkinan. Kami mensimulasikan ini dengan menghasilkan sampel dari distribusi posterior (misalnya, menggunakan algoritma Metropolis-Hasting untuk menghasilkan nilai, dan menerimanya jika mereka berada di atas ambang batas probabilitas tertentu untuk …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.