Statistik dan Big Data

T&J untuk orang-orang yang tertarik dalam statistik, pembelajaran mesin, analisis data, penambangan data, dan visualisasi data

4
Bagaimana melakukan uji-t Student yang hanya memiliki ukuran sampel, rata-rata sampel dan rata-rata populasi yang diketahui?
Mahasiswa -test membutuhkan deviasi standar sampel . Namun, bagaimana saya menghitung ketika hanya ukuran sampel dan rata-rata sampel yang diketahui?s stttssssss Misalnya, jika ukuran sampel dan rata-rata sampel 112 , maka saya akan mencoba membuat daftar 49 sampel identik dengan nilai masing-masing 112 . Diharapkan, standar deviasi sampel adalah 0 …

2
Apakah standardisasi sebelum Lasso benar-benar diperlukan?
Saya telah membaca tiga alasan utama untuk menstandarkan variabel sebelum sesuatu seperti Lassoregresi: 1) Interpretabilitas koefisien. 2) Kemampuan untuk menentukan peringkat kepentingan koefisien dengan besarnya relatif estimasi koefisien pasca penyusutan. 3) Tidak perlu mencegat. Tetapi saya bertanya-tanya tentang hal yang paling penting. Apakah kita memiliki alasan untuk berpikir bahwa standardisasi …



1
Mengapa glmnet menggunakan jaring elastis “naif” dari kertas asli Zou & Hastie?
Kertas jaring elastis asli Zou & Hastie (2005) Regularisasi dan pemilihan variabel melalui jaring elastis memperkenalkan fungsi kerugian bersih elastis untuk regresi linier (di sini saya berasumsi semua variabel berpusat dan diskalakan ke varian unit): tetapi menyebutnya "jaring elastis naif". Mereka berpendapat bahwa itu melakukan penyusutan ganda (laso dan punggungan), …

1
Bisakah derajat kebebasan menjadi angka non-integer?
Ketika saya menggunakan GAM, itu memberi saya sisa DF adalah (baris terakhir dalam kode). Apa artinya? Melampaui contoh GAM, Secara umum, bisakah jumlah derajat kebebasan menjadi angka yang bukan bilangan bulat?26.626.626.6 > library(gam) > summary(gam(mpg~lo(wt),data=mtcars)) Call: gam(formula = mpg ~ lo(wt), data = mtcars) Deviance Residuals: Min 1Q Median 3Q …
27 r  degrees-of-freedom  gam  machine-learning  pca  lasso  probability  self-study  bootstrap  expected-value  regression  machine-learning  linear-model  probability  simulation  random-generation  machine-learning  distributions  svm  libsvm  classification  pca  multivariate-analysis  feature-selection  archaeology  r  regression  dataset  simulation  r  regression  time-series  forecasting  predictive-models  r  mean  sem  lavaan  machine-learning  regularization  regression  conv-neural-network  convolution  classification  deep-learning  conv-neural-network  regression  categorical-data  econometrics  r  confirmatory-factor  scale-invariance  self-study  unbiased-estimator  mse  regression  residuals  sampling  random-variable  sample  probability  random-variable  convergence  r  survival  weibull  references  autocorrelation  hypothesis-testing  distributions  correlation  regression  statistical-significance  regression-coefficients  univariate  categorical-data  chi-squared  regression  machine-learning  multiple-regression  categorical-data  linear-model  pca  factor-analysis  factor-rotation  classification  scikit-learn  logistic  p-value  regression  panel-data  multilevel-analysis  variance  bootstrap  bias  probability  r  distributions  interquartile  time-series  hypothesis-testing  normal-distribution  normality-assumption  kurtosis  arima  panel-data  stata  clustered-standard-errors  machine-learning  optimization  lasso  multivariate-analysis  ancova  machine-learning  cross-validation 


3
Apa dampak dari memilih fungsi kerugian yang berbeda dalam klasifikasi untuk memperkirakan kerugian 0-1
Kita tahu bahwa beberapa fungsi obyektif lebih mudah dioptimalkan dan ada juga yang sulit. Dan ada banyak fungsi kerugian yang ingin kita gunakan tetapi sulit digunakan, misalnya kerugian 0-1. Jadi kami menemukan beberapa fungsi kehilangan proxy untuk melakukan pekerjaan. Misalnya, kami menggunakan kehilangan engsel atau kehilangan logistik untuk "memperkirakan" kehilangan …

3
Asal usul istilah "regularisasi"
Ketika saya memperkenalkan konsep kepada murid-murid saya, saya sering merasa senang memberi tahu mereka dari mana asal usul istilah itu ("regresi", misalnya, adalah istilah dengan asal yang menarik). Saya belum dapat menemukan sejarah / latar belakang istilah "regularisasi" dalam pembelajaran statistik / mesin. Jadi, apa asal usul istilah regularisasi ?

2
Apakah kesamaan cosinus identik dengan jarak euclidean yang dinormalisasi-l2?
Identik makna, bahwa itu akan menghasilkan hasil yang identik untuk kesamaan peringkat antara vektor u dan satu set vektor V . Saya memiliki model ruang vektor yang memiliki ukuran jarak (jarak euclidean, kesamaan cosinus) dan teknik normalisasi (tidak ada, l1, l2) sebagai parameter. Dari pemahaman saya, hasil dari pengaturan [cosinus, …

9
Kapan korelasi dapat berguna tanpa sebab-akibat?
Pepatah hewan peliharaan dari banyak ahli statistik adalah "Korelasi tidak menyiratkan sebab-akibat." Ini memang benar, tetapi satu hal yang TIDAK TERLIHAT di sini adalah bahwa korelasi memiliki sedikit atau tidak ada nilai. Apakah ini benar? Apakah tidak berguna memiliki pengetahuan bahwa dua variabel berkorelasi? Saya tidak bisa membayangkan itu masalahnya. …

3
Tidak bisakah model pembelajaran yang dalam sekarang bisa ditafsirkan? Apakah fitur simpul?
Untuk model statistik dan pembelajaran mesin, ada beberapa tingkat interpretabilitas: 1) algoritma secara keseluruhan, 2) bagian dari algoritma secara umum 3) bagian dari algoritma pada input tertentu, dan tiga level ini dibagi menjadi dua bagian masing-masing, satu untuk pelatihan dan satu untuk evaluasi fungsi. Dua bagian terakhir jauh lebih dekat …


2
Mengapa jalan acak saling terkait?
Saya telah mengamati bahwa, rata-rata, nilai absolut dari koefisien korelasi Pearson adalah hampir konstan untuk setiap pasangan jalan acak independen, terlepas dari panjang jalan.0.560.42 Adakah yang bisa menjelaskan fenomena ini? Saya berharap korelasinya menjadi lebih kecil dengan meningkatnya panjang berjalan, seperti dengan urutan acak. Untuk percobaan saya, saya menggunakan jalan …

2
Apakah variasi sama dengan varians?
Ini adalah pertanyaan pertama saya tentang Cross Validated di sini, jadi tolong bantu saya meskipun itu sepele :-) Pertama-tama, pertanyaannya mungkin merupakan hasil dari perbedaan bahasa atau mungkin saya memiliki kekurangan nyata dalam statistik. Namun demikian, ini dia: Dalam statistik populasi, apakah variasi dan variasi adalah istilah yang sama? Jika …

Dengan menggunakan situs kami, Anda mengakui telah membaca dan memahami Kebijakan Cookie dan Kebijakan Privasi kami.
Licensed under cc by-sa 3.0 with attribution required.