Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

1
Konsistensi 2SLS dengan variabel endogen Binary
Saya telah membaca bahwa estimator 2SLS masih konsisten bahkan dengan variabel endogen biner ( http://www.stata.com/statalist/archive/2004-07/msg00699.html ). Pada tahap pertama, model perawatan probit akan dijalankan alih-alih model linier. Apakah ada bukti formal untuk menunjukkan bahwa 2SLS masih konsisten bahkan ketika tahap 1 adalah model probit atau logit? Juga bagaimana jika hasilnya …

2
Mengapa Adaboost dengan Pohon Keputusan?
Saya telah membaca sedikit tentang meningkatkan algoritma untuk tugas klasifikasi dan Adaboost pada khususnya. Saya memahami bahwa tujuan Adaboost adalah untuk mengambil beberapa "pelajar yang lemah" dan, melalui serangkaian iterasi pada data pelatihan, mendorong pengklasifikasi untuk belajar memprediksi kelas yang modelnya berulang kali membuat kesalahan. Namun, saya bertanya-tanya mengapa begitu …


2
Output dari Scikit SVM dalam klasifikasi multiclass selalu memberikan label yang sama
Saat ini saya menggunakan Scikit belajar dengan kode berikut: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') dan kemudian cocok dan memprediksi untuk satu set data dengan 7 label berbeda. Saya mendapat hasil yang aneh. Tidak peduli teknik validasi silang mana yang saya gunakan label prediksi pada set validasi akan …

2
Regresi dengan variabel independen terbalik
Anggaplah saya memiliki -vektor dari variabel dependen, dan -vektor dari variabel independen. Ketika diplot terhadap , saya melihat bahwa ada hubungan linear (tren naik) di antara keduanya. Sekarang, ini juga berarti bahwa ada tren penurunan linear antara dan .Y N X Y 1NNNYYYNNNXXXYYY YX1X1X\frac{1}{X}YYYXXX Sekarang, jika saya menjalankan regresi: dan …

3
Bagaimana cara mengekstrak informasi dari matriks sebar ketika Anda memiliki N besar, data diskrit, & banyak variabel?
Saya bermain-main dengan dataset kanker payudara dan membuat sebar semua atribut untuk mendapatkan ide yang paling berpengaruh dalam memprediksi kelas malignant(biru) dari benign(merah). Saya mengerti bahwa baris mewakili sumbu x dan kolom mewakili sumbu y tetapi saya tidak dapat melihat pengamatan apa yang dapat saya lakukan tentang data atau atribut …

1
Bingung tentang penjelasan visual vektor eigen: bagaimana set data yang berbeda secara visual dapat memiliki vektor eigen yang sama?
Banyak buku teks statistik memberikan ilustrasi intuitif tentang apa vektor eigen dari matriks kovarians: Vektor u dan z membentuk vektor eigen (well, eigenaxes). Ini masuk akal. Tetapi satu hal yang membingungkan saya adalah bahwa kita mengekstrak vektor eigen dari matriks korelasi , bukan data mentah. Lebih lanjut, dataset mentah yang …



3
K-means pada persamaan cosinus vs. Euclidean distance (LSA)
Saya menggunakan analisis semantik laten untuk mewakili kumpulan dokumen di ruang dimensi yang lebih rendah. Saya ingin mengelompokkan dokumen-dokumen ini menjadi dua kelompok menggunakan k-means. Beberapa tahun yang lalu, saya melakukan ini menggunakan gensim Python dan menulis algoritma k-means saya sendiri. Saya menentukan cluster centroid menggunakan jarak Euclidean, tetapi kemudian …



1
Mungkinkah ditunjukkan secara statistik bahwa mobil digunakan sebagai senjata pembunuh?
Saya mendengar sebuah cerita baru-baru ini di mana seseorang mengatakan jika mereka ingin membunuh seseorang (dan lolos begitu saja) mereka akan melakukannya dengan mobil mereka. Mereka mengutip berbagai statistik tentang jumlah kematian terkait-otomatis (termasuk mobil-di-pejalan kaki) ditambah dengan statistik tambahan tentang jumlah pengemudi yang benar-benar dijatuhi hukuman untuk segala jenis …

2
Bagaimana memilih pelatihan, validasi silang, dan ukuran set uji untuk data ukuran sampel kecil?
Asumsikan saya memiliki ukuran sampel yang kecil, misalnya N = 100, dan dua kelas. Bagaimana saya harus memilih pelatihan, validasi silang, dan ukuran set tes untuk pembelajaran mesin? Saya akan memilih secara intuitif Pelatihan menetapkan ukuran 50 Validasi silang mengatur ukuran 25, dan Ukuran tes 25. Tapi mungkin ini lebih …

3
Model campuran 2-Gaussian inferensi dengan MCMC dan PyMC
Masalah Saya ingin menyesuaikan parameter model populasi campuran 2-Gaussian sederhana. Mengingat semua hype di sekitar metode Bayesian saya ingin mengerti jika untuk masalah ini kesimpulan Bayesian adalah alat yang lebih baik daripada metode pemasangan tradisional. Sejauh ini MCMC berkinerja sangat buruk dalam contoh mainan ini, tapi mungkin saya hanya mengabaikan …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.