Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data


2
Penyaringan kolaboratif melalui faktorisasi matriks dengan fungsi kehilangan logistik
Pertimbangkan masalah pemfilteran kolaboratif. Kami memiliki matriks ukuran #user * # item. jika pengguna saya suka barang j, jika pengguna saya tidak suka barang j danjika tidak ada data tentang pasangan (i, j). Kami ingin memprediksi untuk pengguna mendatang, pasangan barang.M.M.MM.saya , j= 1M.saya,j=1M_{i,j} = 1M.saya , j= 0M.saya,j=0M_{i,j} = …

2
Belajar dari data relasional
Pengaturan Banyak algoritma beroperasi pada satu relasi atau tabel, sementara banyak database dunia nyata menyimpan informasi dalam beberapa tabel (Domingos, 2003). Pertanyaan Jenis algoritma apa yang dipelajari dengan baik dari beberapa tabel (relasional). Secara khusus, saya tertarik pada algoritma yang berlaku untuk tugas-tugas regresi dan klasifikasi (bukan yang berorientasi analisis …

3
Masuk membalik ketika menambahkan satu variabel lagi dalam regresi dan dengan besarnya jauh lebih besar
Pengaturan dasar: model regresi: mana C adalah vektor variabel kontrol.y=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy = \text{constant} +\beta_1x_1+\beta_2x_2+\beta_3x_3+\beta_4x_4+\alpha C+\epsilon Saya tertarik pada dan berharap β 1 dan β 2 menjadi negatif. Namun, ada masalah multikolinieritas dalam model, koefisien korelasi diberikan oleh, corr ( x 1 , x 2 ) = 0,9345, corr ( x 1 …

4
Box Cox Transforms untuk regresi
Saya mencoba menyesuaikan model linier pada beberapa data hanya dengan satu prediktor (katakanlah (x, y)). Data sedemikian rupa sehingga untuk nilai x yang kecil, nilai y memberikan kesesuaian yang ketat dengan garis lurus, namun begitu nilai x meningkat, nilai y menjadi lebih tidak stabil. Berikut adalah contoh dari data tersebut …

1
Bagaimana cara menormalkan data sensor accelerometer saya?
Saya bekerja dengan satu set besar data accelerometer yang dikumpulkan dengan beberapa sensor yang dikenakan oleh banyak subjek. Sayangnya, tidak ada orang di sini yang tahu spesifikasi teknis perangkat dan saya pikir mereka tidak pernah dikalibrasi ulang. Saya tidak punya banyak info tentang perangkat. Saya sedang mengerjakan tesis master saya, …

5
Apakah preclustering membantu membangun model prediksi yang lebih baik?
Untuk tugas pemodelan churn saya sedang mempertimbangkan: Hitung k cluster untuk data Buat model k untuk masing-masing cluster secara terpisah. Alasan untuk itu adalah, bahwa tidak ada yang dapat dibuktikan, bahwa populasi pelanggan adalah homogen, sehingga masuk akal untuk menganggap bahwa proses menghasilkan data mungkin berbeda untuk "kelompok" yang berbeda. …

1
Parellel antara LSA dan pLSA
Dalam makalah asli pLSA penulis, Thomas Hoffman, menggambar paralel antara struktur data pLSA dan LSA yang ingin saya diskusikan dengan Anda. Latar Belakang: Mengambil inspirasi Pengambilan Informasi misalkan kita memiliki koleksi dokumen dan kosakata istilahNNND={d1,d2,....,dN}D={d1,d2,....,dN}D = \lbrace d_1, d_2, ...., d_N \rbraceMMMΩ={ω1,ω2,...,ωM}Ω={ω1,ω2,...,ωM}\Omega = \lbrace \omega_1, \omega_2, ..., \omega_M \rbrace Sebuah …

2
Asumsi ketergantungan Benjamini-Hochberg dibenarkan?
Saya memiliki kumpulan data di mana saya menguji perbedaan yang signifikan antara tiga populasi sehubungan dengan sekitar 50 variabel yang berbeda. Saya melakukan ini menggunakan tes Kruskal-Wallis, di satu sisi, dan dengan uji rasio kemungkinan cocok model GLM bersarang (dengan dan tanpa populasi sebagai variabel independen), di sisi lain. Sebagai …

2
Variabel miring dalam PCA atau analisis faktor
Saya ingin melakukan analisis komponen utama (analisis faktor) pada SPSS berdasarkan 22 variabel. Namun, beberapa variabel saya sangat miring (skewness dihitung dari SPSS berkisar 2-80!). Jadi inilah pertanyaanku: Haruskah saya menjaga variabel miring seperti itu atau saya bisa mengubah variabel pada analisis komponen utama? Jika ya, bagaimana saya menafsirkan skor …

4
Cara memplot data harian 20 tahun dalam deret waktu
Saya memiliki dataset berikut: https://dl.dropbox.com/u/22681355/ORACLE.csv dan ingin merencanakan perubahan harian di 'Buka' dengan 'Tanggal', jadi saya melakukan hal berikut: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") dan saya mendapatkan yang berikut ini: Sekarang ini jelas bukan plot terbaik yang pernah ada, jadi saya bertanya-tanya apa metode yang tepat untuk digunakan …

2
Distribusi pada himpunan bagian dari
Saya ingin tahu apakah ada jenis distribusi standar pada himpunan bilangan bulat . Secara ekuivalen, kita dapat menyatakan ini sebagai distribusi pada vektor panjang dari hasil biner, misalnya jika maka sesuai dengan vektor .{1,2,...,J}{1,2,...,J}\{1, 2, ..., J\}JJJJ=5J=5J = 5{1,3,5}{1,3,5}\{1, 3, 5\}(1,0,1,0,1)(1,0,1,0,1)(1, 0, 1, 0, 1) Idealnya yang saya cari adalah …

1
Referensi statistik frekuensi untuk seseorang yang berpengalaman dalam teori probabilitas modern
Berasal dari latar belakang yang keras dalam analisis dan teori probabilitas modern, saya menemukan statistik Bayesian langsung dan mudah dipahami, dan statistik kerap kali sangat membingungkan dan tidak intuitif. Tampaknya kerap kali benar-benar melakukan statistik bayesian, kecuali dengan "prior rahasia" yang tidak termotivasi dengan baik atau didefinisikan dengan cermat. Di …

3
Interval kepercayaan vs ukuran sampel?
Saya benar-benar baru dalam statistik dan bidang interval kepercayaan. Jadi ini mungkin sangat sepele atau bahkan terdengar bodoh. Saya akan sangat menghargai jika Anda dapat membantu saya memahami atau mengarahkan saya ke beberapa literatur / teks / blog yang menjelaskan hal ini dengan lebih baik. Saya melihat di berbagai situs …

3
Membandingkan tingkat kejadian
Saya ingin membandingkan dengan tingkat kejadian antara dua kelompok (satu tanpa penyakit dan satu dengan). Saya berencana untuk menghitung rasio tingkat kejadian (IRR), yaitu tingkat kejadian kelompok B / tingkat kejadian kelompok A, dan kemudian menguji apakah tingkat ini sama dengan 1, dan akhirnya menghitung interval CI 95% untuk IRR. …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.