Apa yang ingin Anda lakukan tidak ada karena, karena kurangnya kata yang lebih baik, cacat secara matematis.
Tetapi pertama-tama, saya akan menekankan mengapa menurut saya premis pertanyaan Anda masuk akal. Saya kemudian akan mencoba menjelaskan mengapa saya pikir kesimpulan yang Anda ambil dari mereka didasarkan pada kesalahpahaman model logistik dan, akhirnya, saya akan menyarankan pendekatan alternatif.
Saya akan menunjukkan pengamatannAnda(huruf tebal menunjukkan vektor) yang terletak diruangpdimensi (entri pertama x{(xxi,yi)}ni=1npxxip<nyi∈[0,1]f(xxi)=f(xx′iββ)xx′iββnp
Anda benar bahwa jika Anda bermaksud menggunakan TVD sebagai kriteria untuk mengevaluasi model yang sesuai, maka masuk akal untuk mengharapkan kecocokan Anda untuk mengoptimalkan kriteria yang sama di antara semua kandidat yang mungkin, pada data Anda. Karenanya
ββ∗=argminββ∈Rp||yy−f(xx′iββ)||1
Masalahnya adalah istilah error :
dan jika kita menegakkan (kami hanya ingin model kita menjadi asimtotik berisi ), kemudian, harus menjadi heteroskedastic . Ini karena dapat mengambil dua nilai, 0 dan 1. Oleh karena itu, diberikan
, juga hanya dapat mengambil dua nilai: ketika , yang terjadi dengan probabilitas , dan ketikaϵi=yi−f(xx′iββ)E(ϵϵ)=0ϵi yixxiϵi1−f(xx′iββ)yi=1f(xx′iββ)−f(xx′iββ)yi=1, yang terjadi dengan probabilitas .1−f(xx′iββ)
Pertimbangan ini secara bersama menyiratkan bahwa:
var(ϵϵ)=E(ϵϵ2)=(1−f(xx′ββ))2f(xx′ββ)+(−f(xx′ββ))2(1−f(xx′ββ))=(1−f(xx′ββ))f(xx′ββ)=E(yy|xx)E(1−yy|xx)
karenanya tidak konstan tetapi berbentuk parabola cekung dan dimaksimalkan ketika sedemikian rupa sehingga .var(ϵϵ)xxE(y|xx)≈.5
Ini melekat heteroskedastisitas dari residual memiliki konsekuensi . Ini menyiratkan antara lain bahwa ketika meminimalkan fungsi kehilangan , Anda secara asimptot merupakan bagian dari bobot sampel Anda. Yaitu, yang cocok tidak cocok dengan data sama sekali tetapi hanya sebagian yang terkumpul di sekitar tempat-tempat di mana sedemikian rupa sehingga . Intinya, ini adalah titik data paling tidak informatif dalam sampel Anda : mereka sesuai dengan pengamatan yang komponen kebisingannya terbesar. Karenanya, kecocokan Anda ditarik ke , misalnya dibuat tidak relevan.l1ββ∗xxE(yy|xx)≈.5ββ∗=ββ:f(xx′ββ)≈.5
Salah satu solusi, seperti yang jelas dari paparan di atas adalah dengan menjatuhkan persyaratan ketidakberpihakan. Cara populer untuk bias estimator (dengan beberapa interpretasi Bayesian terlampir) adalah dengan memasukkan istilah penyusutan. Jika kami skala responsnya:
y+i=2(yi−.5),1≤i≤n
dan, untuk kemanfaatan komputasi, ganti dengan fungsi monoton lainnya --it akan nyaman bagi sekuel untuk menunjukkan komponen pertama dari vektor parameter sebagai dan yang - dan termasuk istilah penyusutan (misalnya salah satu bentuk ), masalah optimisasi yang dihasilkan menjadi:f(xx′ββ)g(xx,[c,γγ])=xx′[c,γγ]cp−1γγ||γγ||2
[c∗,γγ∗]=argmin[[c,γγ]∈Rp∑i=1nmax(0,1−y+ixx′i[[c,γγ])+12||γγ||2
Perhatikan bahwa dalam masalah optimisasi baru (juga cembung) ini, penalti untuk pengamatan yang diklasifikasikan dengan benar adalah 0 dan tumbuh secara linier dengan untuk yang tidak diklasifikasikan - seperti dalam kerugian. Solusi untuk masalah optimasi kedua ini adalah koefisien linear svm (dengan pemisahan sempurna). Berbeda dengan , masuk akal untuk mempelajari dari data dengan penalti jenis TVD ('type' karena istilah bias) . Akibatnya, solusi ini diterapkan secara luas. Lihat misalnya paket R LiblineaR .xx′[[c,γ]l1 β[c∗,γγ∗] [ c ∗ , γββ∗[c∗,γγ∗]