HOME 首頁(yè)
SERVICE 服務(wù)產(chǎn)品
XINMEITI 新媒體代運(yùn)營(yíng)
CASE 服務(wù)案例
NEWS 熱點(diǎn)資訊
ABOUT 關(guān)于我們
CONTACT 聯(lián)系我們
創(chuàng)意嶺
讓品牌有溫度、有情感
專(zhuān)注品牌策劃15年

    分類(lèi)和回歸的主要算法(分類(lèi)和回歸的主要算法是)

    發(fā)布時(shí)間:2023-04-08 13:17:28     稿源: 創(chuàng)意嶺    閱讀: 52        

    大家好!今天讓創(chuàng)意嶺的小編來(lái)大家介紹下關(guān)于分類(lèi)和回歸的主要算法的問(wèn)題,以下是小編對(duì)此問(wèn)題的歸納整理,讓我們一起來(lái)看看吧。

    開(kāi)始之前先推薦一個(gè)非常厲害的Ai人工智能工具,一鍵生成原創(chuàng)文章、方案、文案、工作計(jì)劃、工作報(bào)告、論文、代碼、作文、做題和對(duì)話答疑等等

    只需要輸入關(guān)鍵詞,就能返回你想要的內(nèi)容,越精準(zhǔn),寫(xiě)出的就越詳細(xì),有微信小程序端、在線網(wǎng)頁(yè)版、PC客戶端

    官網(wǎng):https://ai.de1919.com。

    創(chuàng)意嶺作為行業(yè)內(nèi)優(yōu)秀的企業(yè),服務(wù)客戶遍布全球各地,如需了解SEO相關(guān)業(yè)務(wù)請(qǐng)撥打電話175-8598-2043,或添加微信:1454722008

    本文目錄:

    分類(lèi)和回歸的主要算法(分類(lèi)和回歸的主要算法是)

    一、分類(lèi)和聚類(lèi)的區(qū)別及各自的常見(jiàn)算法

    學(xué)習(xí)數(shù)據(jù)挖掘的朋友,對(duì)分類(lèi)算法和聚類(lèi)算法都很熟悉。無(wú)論是分類(lèi)算法還是聚類(lèi)算法,都有許多具體的算法來(lái)實(shí)現(xiàn)具體的數(shù)據(jù)分析需求。很多時(shí)候,我們難以判斷選擇分類(lèi)或者聚類(lèi)的場(chǎng)合是什么。我們最直觀的概念是,分類(lèi)和聚類(lèi)都是把某個(gè)被分析的對(duì)象劃分到某個(gè)類(lèi)里面,所以覺(jué)得這兩種方法實(shí)際上是差不多一回事。然而當(dāng)我們學(xué)習(xí)了許多具體算法之后再回來(lái)看,分類(lèi)和聚類(lèi)所實(shí)現(xiàn)的數(shù)據(jù)分析功能實(shí)際上是大相徑庭的,他們之間不僅僅有算法上的具體差異,更重要的是,甚至他們的應(yīng)用領(lǐng)域和所解決的具體問(wèn)題都不一樣。

    1.類(lèi)別是否預(yù)先定義是最直觀區(qū)別

    算法書(shū)上往往這樣解釋二者的區(qū)別:分類(lèi)是把某個(gè)對(duì)象劃分到某個(gè)具體的已經(jīng)定義的類(lèi)別當(dāng)中,而聚類(lèi)是把一些對(duì)象按照具體特征組織到若干個(gè)類(lèi)別里。雖然都是把某個(gè)對(duì)象劃分到某個(gè)類(lèi)別中,但是分類(lèi)的類(lèi)別是已經(jīng)預(yù)定義的,而聚類(lèi)操作時(shí),某個(gè)對(duì)象所屬的類(lèi)別卻不是預(yù)定義的。所以,對(duì)象所屬類(lèi)別是否為事先,是二者的最基本區(qū)別。而這個(gè)區(qū)別,僅僅是從算法實(shí)現(xiàn)流程來(lái)看的。

    2.二者解決的具體問(wèn)題不一樣

    分類(lèi)算法的基本功能是做預(yù)測(cè)。我們已知某個(gè)實(shí)體的具體特征,然后想判斷這個(gè)實(shí)體具體屬于哪一類(lèi),或者根據(jù)一些已知條件來(lái)估計(jì)感興趣的參數(shù)。比如:我們已知某個(gè)人存款金額是10000元,這個(gè)人沒(méi)有結(jié)婚,并且有一輛車(chē),沒(méi)有固定住房,然后我們估計(jì)判斷這個(gè)人是否會(huì)涉嫌信用欺詐問(wèn)題。這就是最典型的分類(lèi)問(wèn)題,預(yù)測(cè)的結(jié)果為離散值,當(dāng)預(yù)測(cè)結(jié)果為連續(xù)值時(shí),分類(lèi)算法可以退化為計(jì)量經(jīng)濟(jì)學(xué)中常見(jiàn)的回歸模型。分類(lèi)算法的根本目標(biāo)是發(fā)現(xiàn)新的模式、新的知識(shí),與數(shù)據(jù)挖掘數(shù)據(jù)分析的根本目標(biāo)是一致的。

    聚類(lèi)算法的功能是降維。假如待分析的對(duì)象很多,我們需要?dú)w歸類(lèi),劃劃簡(jiǎn),從而提高數(shù)據(jù)分析的效率,這就用到了聚類(lèi)的算法。很多智能的搜索引擎,會(huì)將返回的結(jié)果,根據(jù)文本的相似程度進(jìn)行聚類(lèi),相似的結(jié)果聚在一起,用戶就很容易找到他們需要的內(nèi)容。聚類(lèi)方法只能起到降低被分析問(wèn)題的復(fù)雜程度的作用,即降維,一百個(gè)對(duì)象的分析問(wèn)題可以轉(zhuǎn)化為十個(gè)對(duì)象類(lèi)的分析問(wèn)題。聚類(lèi)的目標(biāo)不是發(fā)現(xiàn)知識(shí),而是化簡(jiǎn)問(wèn)題,聚類(lèi)算法并不直接解決數(shù)據(jù)分析的問(wèn)題,而最多算是數(shù)據(jù)預(yù)處理的過(guò)程。

    3.有監(jiān)督和無(wú)監(jiān)督

    分類(lèi)是有監(jiān)督的算法,而聚類(lèi)是無(wú)監(jiān)督的算法。有監(jiān)督的算法并不是實(shí)時(shí)的,需要給定一些數(shù)據(jù)對(duì)模型進(jìn)行訓(xùn)練,有了模型就能預(yù)測(cè)。新的待估計(jì)的對(duì)象來(lái)了的時(shí)候,套進(jìn)模型,就得到了分類(lèi)結(jié)果。而聚類(lèi)算法是實(shí)時(shí)的,換句話說(shuō)是一次性的,給定統(tǒng)計(jì)指標(biāo),根據(jù)對(duì)象與對(duì)象之間的相關(guān)性,把對(duì)象分為若干類(lèi)。分類(lèi)算法中,對(duì)象所屬的類(lèi)別取決于訓(xùn)練出來(lái)的模型,間接地取決于訓(xùn)練集中的數(shù)據(jù)。而聚類(lèi)算法中,對(duì)象所屬的類(lèi)別,則取決于待分析的其他數(shù)據(jù)對(duì)象。

    4.數(shù)據(jù)處理的順序不同

    分類(lèi)算法中,待分析的數(shù)據(jù)是一個(gè)一個(gè)處理的,分類(lèi)的過(guò)程,就像給數(shù)據(jù)貼標(biāo)簽的過(guò)程,來(lái)一個(gè)數(shù)據(jù),我放到模型里,然后貼個(gè)標(biāo)簽。

    聚類(lèi)算法中,待分析的數(shù)據(jù)同時(shí)處理,來(lái)一堆數(shù)據(jù)過(guò)來(lái),同時(shí)給分成幾小堆。

    因此,數(shù)據(jù)分類(lèi)算法和數(shù)據(jù)聚類(lèi)算法的最大區(qū)別是時(shí)效性問(wèn)題。在已有數(shù)據(jù)模型的條件下,數(shù)據(jù)分類(lèi)的效率往往比數(shù)據(jù)聚類(lèi)的效率要高很多,因?yàn)橐淮沃皇且粋€(gè)對(duì)象被處理,而對(duì)于聚類(lèi)結(jié)果來(lái)說(shuō),每當(dāng)加入一個(gè)新的分析對(duì)象,類(lèi)別結(jié)果都有可能發(fā)生改變,因此很有必要重新對(duì)所有的待分析對(duì)象進(jìn)行計(jì)算處理。

    5.典型的分類(lèi)算法與聚類(lèi)算法

    典型的分類(lèi)算法有:決策樹(shù),神經(jīng)網(wǎng)絡(luò),支持向量機(jī)模型,Logistic回歸分析,以及核估計(jì)等等。

    聚類(lèi)的方法有,基于鏈接關(guān)系的聚類(lèi)算法,基于中心度的聚類(lèi)算法,基于統(tǒng)計(jì)分布的聚類(lèi)算法以及基于密度的聚類(lèi)算法等等。

    二、02-21:LR算法

    LR算法

    回頭看LR算法真是異常簡(jiǎn)單啊

    但是算法背后的數(shù)學(xué)原理想講清楚也不容易

    LR算法可以解決分類(lèi)和回歸問(wèn)題

    整個(gè)過(guò)程重點(diǎn)在于選擇特征,以及特征離散化。

    ---特征、特征權(quán)重、預(yù)測(cè)值、預(yù)測(cè)分類(lèi)

    重要函數(shù),見(jiàn)微知著:雖然是最簡(jiǎn)單的LR模型但是也是完整地完成整個(gè)做一個(gè)模型的流程。

    1、激活函數(shù): 

    sigmoid 1/(1+e^(-x))

    對(duì)應(yīng)softmax:

    2、損失函數(shù):

    交叉熵 loss     -[ylog(p)+(1-y)log(1-p)]

    3、梯度下降:

    sigmoid函數(shù)的導(dǎo)數(shù)是:x(1-x)

    softmax的梯度求導(dǎo):

    4、參數(shù)更新:

    softmax函數(shù)的參數(shù)更新過(guò)程:

    softmax的公式:

    e(wx)/(sum(e(wx))

    參數(shù)更新的整體過(guò)程都為:

    w=w-a.求導(dǎo)

    得求導(dǎo)求到參數(shù)w的部分:

    即為:

    w=w-a.(求導(dǎo)結(jié)果).x

    todo:

    使用tensorflow完成lr模型,也是說(shuō)一個(gè)最簡(jiǎn)單的lr模型,也是完成一個(gè)完整的模型~

    參考資料

    1、常見(jiàn)的損失函數(shù)(loss function)總結(jié)

    https://zhuanlan.zhihu.com/p/58883095

    2、softmax的log似然代價(jià)函數(shù)(公式求導(dǎo))

    https://blog.csdn.net/u014313009/article/details/51045303

    三、有哪些簡(jiǎn)單的將回歸方法運(yùn)用到分類(lèi)問(wèn)題上的算法?

    Logistics Regression是比較經(jīng)典的對(duì)二分響應(yīng)變量的建模和預(yù)測(cè)的統(tǒng)計(jì)方法。理論什么的都相對(duì)比較完善,結(jié)果也容易解釋?zhuān)话銇?lái)說(shuō)回歸模型是廣義線性的。而支撐向量機(jī)則模型更復(fù)雜,是非線性的。

    四、每個(gè)數(shù)據(jù)科學(xué)人都應(yīng)該知道的7種回歸技術(shù)

    介紹 線性回歸和邏輯回歸通常是人們?cè)跀?shù)據(jù)科學(xué)中學(xué)習(xí)的第一種算法。由于它們的受歡迎程度,許多分析師甚至認(rèn)為它們是唯一的回歸形式。哪兒些稍微有工作經(jīng)驗(yàn)的人也會(huì)認(rèn)為它們是所有回歸分析形式的中最重要的。

    事實(shí)是,有無(wú)數(shù)種形式的回歸可以使用。每種形式的回歸都有其自身的重要性和最適合應(yīng)用的特定場(chǎng)景。在本文中,我會(huì)以簡(jiǎn)單的方式解釋了數(shù)據(jù)科學(xué)中最常用的7種回歸形式。通過(guò)這篇文章,我也希望人們能夠?qū)貧w的廣度有一個(gè)概念,而不是僅僅對(duì)他們遇到的每個(gè)問(wèn)題應(yīng)都用線性/邏輯回歸,并希望他們能夠使用這么多的回歸技術(shù)!

    如果您是數(shù)據(jù)科學(xué)的新手,并且正在尋找一個(gè)開(kāi)始學(xué)習(xí)的地方,那么“ 數(shù)據(jù)科學(xué) ”課程是一個(gè)很好的起點(diǎn)!它涵蓋了Python,統(tǒng)計(jì)和預(yù)測(cè)建模的核心主題,它是你進(jìn)入數(shù)據(jù)科學(xué)的第一步的完美方法。

    什么是回歸分析?

    回歸分析是預(yù)測(cè)建模技術(shù)的一種技術(shù),它研究依賴(lài)(目標(biāo))和自變量(預(yù)測(cè)變量)之間的關(guān)系。該技術(shù)用于預(yù)測(cè),時(shí)間序列建模和查找變量之間的因果關(guān)系。例如,通過(guò)回歸可以最好地研究魯莽駕駛與駕駛員發(fā)生道路交通事故數(shù)量之間的關(guān)系。

    回歸分析是建模和分析數(shù)據(jù)的重要工具。在這里,我們將曲線/直線線擬合到數(shù)據(jù)點(diǎn),使得數(shù)據(jù)點(diǎn)距曲線或直線的距離之間的差異最小化。我將在接下來(lái)的章節(jié)中詳細(xì)解釋這一點(diǎn)。

    為什么我們使用回歸分析?

    如上所述,回歸分析是估計(jì)兩個(gè)或更多變量之間的關(guān)系。讓我們通過(guò)一個(gè)簡(jiǎn)單的例子來(lái)理解這一點(diǎn):

    比方說(shuō),你想根據(jù)當(dāng)前的經(jīng)濟(jì)狀況估算公司的銷(xiāo)售增長(zhǎng)率。您有最近的公司數(shù)據(jù)表明銷(xiāo)售增長(zhǎng)約為經(jīng)濟(jì)增長(zhǎng)的2.5倍。利用這種洞察力,我們可以根據(jù)當(dāng)前和過(guò)去的信息預(yù)測(cè)公司的未來(lái)銷(xiāo)售情況。

    使用回歸分析有許多好處。如下:

    它表明因變量和自變量之間的顯著關(guān)系。 它表示多個(gè)自變量對(duì)一個(gè)因變量的影響強(qiáng)度。

    回歸分析還允許我們比較不同尺度上測(cè)量的變量的影響,例如價(jià)格變化的影響和促銷(xiāo)活動(dòng)的數(shù)量。這些優(yōu)勢(shì)有助于市場(chǎng)研究人員/數(shù)據(jù)分析師/數(shù)據(jù)科學(xué)家消除和評(píng)估用于構(gòu)建預(yù)測(cè)模型的最佳變量集。

    我們有多少種回歸技術(shù)?

    我們有各種各樣的回歸技術(shù)可用用于預(yù)測(cè)。這些技術(shù)主要由三個(gè)指標(biāo)(自變量的數(shù)量,因變量的類(lèi)型和回歸線的形狀)驅(qū)動(dòng)。我們將在以下部分詳細(xì)討論它們。

    對(duì)于創(chuàng)造性的,如果您覺(jué)得需要使用上述參數(shù)的組合,您甚至可以制作新的回歸,以前人們沒(méi)有使用過(guò)。但在開(kāi)始之前,讓我們了解最常用的回歸:

    1.線性回歸

    它是最廣為人知的建模技術(shù)之一。線性回歸通常是人們?cè)趯W(xué)習(xí)預(yù)測(cè)建模時(shí)最先選擇的幾個(gè)方法之一。在該方法中,因變量是連續(xù)的,自變量可以是連續(xù)的或離散的,并且回歸線的性質(zhì)是線性的。

    線性回歸使用最佳擬合直線(也稱(chēng)為回歸線)在因變量(Y)和一個(gè)或多個(gè)自變量(X)之間建立關(guān)系。

    它由方程Y = a + b * X + e表示,其中a是截距,b是直線的斜率,e是誤差項(xiàng)。該等式可以根據(jù)給定的預(yù)測(cè)變量預(yù)測(cè)目標(biāo)變量的值。

    簡(jiǎn)單線性回歸和多元線性回歸之間的區(qū)別在于,多元線性回歸具有(> 1)個(gè)獨(dú)立變量,而簡(jiǎn)單線性回歸只有1個(gè)獨(dú)立變量?,F(xiàn)在的問(wèn)題是“我們?nèi)绾潍@得最佳擬合線?”。

    如何獲得最佳擬合線(a和b的值)?

    這項(xiàng)任務(wù)可以通過(guò)最小二乘法輕松完成。它是用于擬合回歸線的最常用方法。它通過(guò)最小化每個(gè)數(shù)據(jù)點(diǎn)到直線的垂直偏差的平方和來(lái)計(jì)算觀測(cè)數(shù)據(jù)的最佳擬合線。因?yàn)槠钍紫纫椒?,所以?dāng)相加時(shí),正值和負(fù)值之間不會(huì)抵消。

    我們可以使用度量的R平方來(lái)評(píng)估模型性能 。

    重點(diǎn): 自變量和因變量之間必須存在線性關(guān)系 多元回歸存在多重共線性,自相關(guān),異方差等問(wèn)題。 線性回歸對(duì)異常值非常敏感。它可以極大地影響回歸線并最終影響預(yù)測(cè)值。 多重共線性可以增加系數(shù)估計(jì)的方差,并使估計(jì)對(duì)模型中的微小變化非常敏感。結(jié)果是系數(shù)估計(jì)不穩(wěn)定 在多個(gè)獨(dú)立變量的情況下,我們可以選擇正向選擇,逆向淘汰和逐步方法來(lái)選擇最重要的自變量。 2. 邏輯回歸

    邏輯回歸方法用于查找事件成功的概率和失敗的概率。當(dāng)因變量本質(zhì)上是二進(jìn)制(0/1,真/假,是/否)時(shí),我們應(yīng)該使用邏輯回歸。這里Y值的范圍從0到1,它可以用下面的等式表示。

    odds = p /(1-p)=事件發(fā)生概率/非事件發(fā)生概率 ln(賠率)= ln(p /(1-p)) logit(p)= ln(p /(1-p))= b0 + b1X1 + b2X2 + b3X3 .... + bkXk

    以上,p是存在感興趣特征的概率。這時(shí)候你應(yīng)該要問(wèn)一個(gè)問(wèn)題就是“為什么我們要在等式中使用對(duì)數(shù)log?”。

    由于我們?cè)谶@里使用的是二項(xiàng)分布(因變量),我們需要選擇最適合此分布的鏈接函數(shù)。而且,它是logit函數(shù)。在上面的等式中,選擇此參數(shù)是為了以最大化觀察樣本值的可能性,而不是最小化平方誤差的總和(如在普通回歸中一樣)。

    重點(diǎn): 它被廣泛用于分類(lèi)問(wèn)題 邏輯回歸不需要依賴(lài)因變量和自變量之間的線性關(guān)系。它可以處理各種類(lèi)型的關(guān)系,因?yàn)樗鼘⒎蔷€性對(duì)數(shù)變換應(yīng)用于預(yù)測(cè)的優(yōu)勢(shì)比 為避免過(guò)度擬合和欠擬合,我們應(yīng)該包括所有重要的變量。確保這種做法的一個(gè)好方法是使用逐步方法來(lái)估計(jì)邏輯回歸 它需要較大樣本量,因?yàn)樵跇颖玖枯^小時(shí),最大似然估計(jì)的效率低于普通的最小二乘法 自變量不應(yīng)相互關(guān)聯(lián),即不具有多重共線性。但是,我們可以選擇在分析和模型中包含分類(lèi)變量的交互作用。 如果因變量的值是序數(shù),那么它被稱(chēng)為序數(shù)邏輯回歸 如果因變量是多類(lèi)的,那么它被稱(chēng)為多元邏輯回歸。 3.多項(xiàng)式回歸

    如果自變量的冪大于1,則回歸方程是多項(xiàng)式回歸方程。下面的等式表示多項(xiàng)式方程:

    Y = A + B * X ^ 2

    在這種回歸技術(shù)中,最佳擬合線不是直線。它是一條與數(shù)據(jù)點(diǎn)吻合的曲線。

    重點(diǎn): 雖然可能存在擬合更高次多項(xiàng)式以獲得更低誤差的誘惑,但這可能會(huì)導(dǎo)致過(guò)度擬合。始終繪制關(guān)系圖以查看是否匹配,并專(zhuān)注于確保曲線符合問(wèn)題的本質(zhì)。以下是繪圖如何幫助的示例: 特別注意的是末端的曲線,看看這些形狀和趨勢(shì)是否有意義。較高的多項(xiàng)式最終會(huì)產(chǎn)生奇怪的結(jié)果。 4.逐步回歸

    當(dāng)我們處理多個(gè)自變量時(shí),會(huì)使用這種形式的回歸。在這種技術(shù)中,自變量的選擇是在自動(dòng)過(guò)程的幫助下完成的,這個(gè)過(guò)程是不需要人為的去進(jìn)行干預(yù)的。

    通過(guò)觀察R方、t檢驗(yàn)和AIC指標(biāo)等統(tǒng)計(jì)值來(lái)識(shí)別重要變量,可以實(shí)現(xiàn)這一壯舉。逐步回歸基本上適合回歸模型,通過(guò)基于指定的標(biāo)準(zhǔn)一次一個(gè)地添加/刪除協(xié)變量。下面列出了一些最常用的逐步回歸方法:

    標(biāo)準(zhǔn)逐步回歸做兩件事。它根據(jù)每個(gè)步驟的需要添加和刪除預(yù)測(cè)變量。 正向選擇從模型中最重要的預(yù)測(cè)變量開(kāi)始,并為每個(gè)步驟添加變量。 向后消除從模型中的所有預(yù)測(cè)變量開(kāi)始,并刪除每個(gè)步驟的最不重要的變量。

    該建模技術(shù)的目的是以最少的預(yù)測(cè)變量來(lái)最大化預(yù)測(cè)能力。它是處理數(shù)據(jù)集更高維度的方法之一。

    5.嶺回歸

    嶺回歸是一種在數(shù)據(jù)存在多重共線性(自變量高度相關(guān))時(shí)使用的技術(shù)。在多重共線性中,即使最小二乘估計(jì)(OLS)是無(wú)偏的,但它們的方差也很大,這使得觀測(cè)值偏離真實(shí)值。通過(guò)在回歸估計(jì)中增加一定程度的偏差,嶺回歸可以減少標(biāo)準(zhǔn)誤差。

    上面,我們看到了線性回歸的方程。還記得嘛?它可以表示為:

    y = a + b * x

    這個(gè)方程也有一個(gè)誤差項(xiàng)。完整的等式變?yōu)椋?

    y = a + b * x + e(誤差項(xiàng)),[誤差項(xiàng)是校正觀測(cè)值和預(yù)測(cè)值之間預(yù)測(cè)誤差所需的值] 表示多個(gè)自變量,=> y = a + y = a + b1x1 + b2x2 + .... + e。

    在線性方程中,預(yù)測(cè)誤差可以分解為兩個(gè)子分量。首先是由于偏差,第二是由于方差。由于這兩個(gè)或兩個(gè)組件中的任何一個(gè),都可能發(fā)生預(yù)測(cè)錯(cuò)誤。在這里,我們將討論由于方差引起的錯(cuò)誤。

    嶺回歸通過(guò)收縮參數(shù) λ(lambda)解決了多重共線性問(wèn)題 ??聪旅娴姆匠?。

    在這個(gè)方程中,我們有兩個(gè)組成部分。第一個(gè)是最小二乘項(xiàng),另一個(gè)是β2 (β平方)總和的λ,其中β是系數(shù)。這被添加到最小二乘項(xiàng),以便縮小參數(shù)以具有非常低的方差。

    重點(diǎn): 該回歸的假設(shè)與最小二乘回歸相同,但不假設(shè)正態(tài)性 它會(huì)縮小系數(shù)的值,但不會(huì)達(dá)到零,這表明沒(méi)有特征選擇功能 這是一種正則化方法,并使用l2正則化。 6.Lasso回歸

    類(lèi)似于嶺回歸,Lasso(最小絕對(duì)收縮和選擇算子)也會(huì)對(duì)回歸系數(shù)的絕對(duì)大小進(jìn)行限制。此外,它還能夠降低線性回歸模型的可變性并提高其準(zhǔn)確性。請(qǐng)看下面的方程:

    Lasso回歸與嶺回歸的不同之處在于,它在懲罰函數(shù)中使用絕對(duì)值而不是平方。這導(dǎo)致懲罰(或等效地約束估計(jì)值的絕對(duì)值的總和)值,從而導(dǎo)致一些參數(shù)估計(jì)值恰好為零。應(yīng)用的懲罰越大,估計(jì)值就會(huì)縮小到絕對(duì)零值。這導(dǎo)致從給定的n個(gè)變量中進(jìn)行變量選擇。

    重點(diǎn): 該回歸的假設(shè)與最小二乘回歸相同,但不假設(shè)正態(tài)性 它將系數(shù)縮小到零(恰好為零),這肯定有助于特征選擇 這是一種正則化方法并使用l1正則化 如果預(yù)測(cè)變量高度相關(guān),則Lasso僅選取其中一個(gè)并將其他預(yù)測(cè)縮減為零 7.彈性網(wǎng)絡(luò)回歸

    彈性網(wǎng)絡(luò)回歸是Lasso回歸和嶺回歸技術(shù)的混合體。它使用L1和L2先驗(yàn)作為正則化器進(jìn)行訓(xùn)練。當(dāng)存在多個(gè)相關(guān)的特征時(shí),彈性網(wǎng)絡(luò)是很有用的。Lasso可能隨機(jī)選擇其中一種,而彈性網(wǎng)很可能同時(shí)選擇兩個(gè)。

    在Lasso回歸和嶺回歸之間進(jìn)行權(quán)衡的一個(gè)實(shí)際優(yōu)勢(shì)是,它允許彈性網(wǎng)絡(luò)在旋轉(zhuǎn)下繼承嶺回歸的一些穩(wěn)定性。

    重點(diǎn): 在變量高度相關(guān)的情況下,它鼓勵(lì)群體效應(yīng) 所選變量的數(shù)量沒(méi)有限制 它會(huì)受到雙重收縮的影響 如何選擇正確的回歸模型?

    當(dāng)你只知道一兩種技術(shù)時(shí),生活通常是很簡(jiǎn)單的。我所知道的其中一個(gè)培訓(xùn)機(jī)構(gòu)告訴他們的學(xué)生 - 如果結(jié)果是連續(xù)的 - 那就用線性回歸。如果是二進(jìn)制的 - 那就用邏輯回歸!但是,我們可以使用的選項(xiàng)數(shù)量越多,選擇正確的選項(xiàng)就越困難?;貧w模型也會(huì)發(fā)生類(lèi)似的情況。

    在多種類(lèi)型的回歸模型中,基于自變量和因變量的類(lèi)型,數(shù)據(jù)中的維度以及數(shù)據(jù)的其他基本特征來(lái)選擇最適合的回歸方法是很重要的。以下是應(yīng)該選擇正確的回歸模型的關(guān)鍵因素:

    數(shù)據(jù)挖掘是構(gòu)建預(yù)測(cè)模型的必然部分。在選擇正確的模型之前,應(yīng)該首先確定變量之間的相關(guān)系數(shù)和影響 為了比較不同模型的擬合優(yōu)度,我們可以分析不同的指標(biāo),如參數(shù)的統(tǒng)計(jì)顯著性,R方,調(diào)整后的R方,AIC指標(biāo),BIC指標(biāo)和誤差項(xiàng)。另一個(gè)是Mallow的Cp標(biāo)準(zhǔn)。這基本上通過(guò)將模型與所有可能的子模型(仔細(xì)選擇它們)進(jìn)行比較,來(lái)檢查模型中可能存在的偏差。 交叉驗(yàn)證是評(píng)估用于預(yù)測(cè)的模型的最佳方式。在這里,可以將數(shù)據(jù)集分為兩組(訓(xùn)練和驗(yàn)證)。觀測(cè)值和預(yù)測(cè)值之間的簡(jiǎn)單均方差可以衡量預(yù)測(cè)的準(zhǔn)確性。 如果你的數(shù)據(jù)集有多個(gè)混淆變量,則不應(yīng)選擇自動(dòng)模型選擇方法,因?yàn)槟悴粫?huì)希望同時(shí)將它們放在模型中。 這也取決于你的目標(biāo)。與具有高度統(tǒng)計(jì)意義的模型相比,功能較弱的模型更容易實(shí)現(xiàn)。 回歸正則化方法(Lasso回歸,嶺回歸和彈性網(wǎng)絡(luò)回歸)在數(shù)據(jù)集中各變量之間具有高維度和多重共線性的情況下運(yùn)行良好。 結(jié)束語(yǔ)

    到現(xiàn)在為止,我希望你已經(jīng)對(duì)回歸有所了解??紤]數(shù)據(jù)條件來(lái)應(yīng)用這些回歸技術(shù)。找出使用哪種技術(shù)的最佳技巧之一就是檢查變量族,即離散變量還是連續(xù)變量。

    在本文中,我討論了7種類(lèi)型的回歸以及與每種技術(shù)相關(guān)的一些關(guān)鍵事實(shí)。作為這個(gè)行業(yè)的新人,我建議你學(xué)習(xí)這些技術(shù),然后在你的模型中實(shí)現(xiàn)它們。

    -以上就是作者推薦的七種數(shù)據(jù)科學(xué)人必知必會(huì)的七種回歸模型,如果大家對(duì)這七種模型感興趣,那就自己動(dòng)手去實(shí)驗(yàn)一下吧,只知道理論是不夠的,要多動(dòng)手實(shí)驗(yàn),才能真正的掌握這些模型。

    7 Types of Regression Techniques you should know!

    以上就是關(guān)于分類(lèi)和回歸的主要算法相關(guān)問(wèn)題的回答。希望能幫到你,如有更多相關(guān)問(wèn)題,您也可以聯(lián)系我們的客服進(jìn)行咨詢(xún),客服也會(huì)為您講解更多精彩的知識(shí)和內(nèi)容。


    推薦閱讀:

    文創(chuàng)產(chǎn)品的分類(lèi)方式(文創(chuàng)產(chǎn)品的分類(lèi)方式有)

    廣告的行業(yè)分類(lèi)(廣告的行業(yè)分類(lèi)有哪些)

    小紅書(shū)怎么分組(小紅書(shū)怎么做合集分類(lèi))

    福州短視頻拍攝公司(福州短視頻拍攝公司有哪些)

    2017快遞排行榜(2020快遞排行榜)