在進入本文前,想先談blog偽專家、偽達人現象。由於網路資訊流通快速、大量專業者分享其專長領域經驗,讓許多blogger變的像媒體名嘴一般,上知天文下知地理無所不談,許多以往看似需要特定專業者才能談的主題,似乎這些blogger也能侃侃而談,而且還虎虎生風、三人成虎,讀者一不小心就會被他們唬了!例如這一篇「民調很馬虎,《天下》真丟人」,當相關新聞剛出現時,這篇被UDN掛在新聞底下的關聯閱讀,我得承認這位作者真的很會寫作文,天花亂綴加油添醋,好像他真的很懂民調這個產業。
雖然我常批評民調業,也不是專家,頂多是個追求專業極致的職人,我都不敢說遠見不具專業及公信力了(事實上遠見民調中心的負責人是國內產業界少數在統計及調查方法上扎根很深的人,而他們的專業表現在自創的民心指數以及競選指標上!),那位作者僅從天下一個調查開始談,就把幾個國內媒體民調中心批評的一無是處;也僅依靠網路剪貼而得的文章,就儼然成為統計大師,煞有其事的講起抽樣誤差與樣本數的關係。在這邊我要說,挖金憨慢講話,但是挖尚實在,有關民調的事問我就對了,請不要再相信沒有根據的說法。(雖然我很努力的要在這篇文章回到第一段談到的主旨,但仔細一看那篇離譜的文章恐怕沒辦法了XDD)
一、關於民調中心概況及專業雖然我常批評民調業,也不是專家,頂多是個追求專業極致的職人,我都不敢說遠見不具專業及公信力了(事實上遠見民調中心的負責人是國內產業界少數在統計及調查方法上扎根很深的人,而他們的專業表現在自創的民心指數以及競選指標上!),那位作者僅從天下一個調查開始談,就把幾個國內媒體民調中心批評的一無是處;也僅依靠網路剪貼而得的文章,就儼然成為統計大師,煞有其事的講起抽樣誤差與樣本數的關係。在這邊我要說,挖金憨慢講話,但是挖尚實在,有關民調的事問我就對了,請不要再相信沒有根據的說法。(雖然我很努力的要在這篇文章回到第一段談到的主旨,但仔細一看那篇離譜的文章恐怕沒辦法了XDD)
那篇「民調很馬虎,《天下》真丟人」(以下簡稱
最好笑的是這幾段:
為什麼咬呢?是因為他們的貪腐問題,還是特定的台獨立場,讓蔡衍明很不爽?都不是。如果我們回顧當時見諸該報的報導,原因立馬呼之欲出,旺旺中時的砲打綠營,是因為爭奪民調可信度的市場商機──此即蔡衍明的揮師民進黨內部民調,正是在於他們侵犯了米果集團的利益。至於自由時報,那豈可不打得彼等鼠輩頭都抬不起來?銀文的寫作策略是樹立中立形象藍綠都批,動不動就搬出圈內、內行型塑權威,這點很高明,因為不是這個產業的人無從得知他說的事實有多少。旺旺炮打綠營是因為爭奪可信度市場商機?這大概是我從業以來聽過最好笑的笑話,姑且不論他寫的中文太高深讓駑鈍如我看不太懂,自由時報民調從來不是以市場商機為目的,所謂的不存在民調中心,前文也已經說過,只要從抽樣母體界定、抽樣方法、問項設計、訪員訓練等步驟符合調查研究方法要求,就能獲得具備一定信度、效度的民意調查,人家就是辦公室大、閒置空間多,能夠動員到足夠的訪員進行調查,甘卿何事?
雖然如此,自由時報的根本不存在民調中心,在圈內早就不是新聞,只是大家心照不宣罷了。而民進黨的內部民調,就連楊秋興,許添財都跳出來指控黨中央作假,做到他們身上去。
所謂DPP內部民調作假,在選前許、楊就透過媒體放話要指定大學民調心執行,當時我也在噗浪上討論所謂的大學民調中心不是就比較中立,一再重伸DPP在選舉民調上已經建立標準作業流程,只要符合其規定者,調查出來的數字不會差太多,而DPP黨內初選機制也是各陣營同意的,豈有選輸就翻臉之理?
這段也很好笑,
但內行人都知道,所有的民調數據,最多只有「參考值」,而無「準確值」如果他說的「參考值」是經過調查所得的「估計值」,「準確值」是實際的事件發生率,那麼執行民調所得的估計值就是用來估計事件發生機率,「估計值」和事件發生機率相比之下,不就會有「估計值」的準確度?(對不起,我認真了 XD)
接下來銀文就是站在執政者立場,批評遠見是庶民百姓不會看的小眾市場雜誌、沒有公信力,不能對每月公佈政府施政滿意度、不能對政府說三道四...這也滿傻 眼的,遠見的目標市場本來就不是「庶民百姓」(用引號表示個人不會用這種封建時代的辭彙),是「台灣知識份子與各界意見領袖」,每期發行8、9萬份,各種 專題都有機會成為報紙頭條,這樣難道不值得注意?
二、關於樣本數與抽樣誤差
銀文後面說的樣本數與抽樣誤差的關係,引自某篇文章,該文又是參考聯合報民調中心吳克昌2007年的報導,為了避免浪費大家生命,這邊也不引用了,請務必忘掉銀文所有內容,而吳克昌的概念也有不清之處。
對母體、樣本、抽樣與母體代表性有興趣者,推薦您先看在下之前的一篇小文 淺談:民調中的樣本代表性檢定與加權處理,先假定讀者您們接受,透過「嚴謹的抽樣設計所得的樣本可以代表母體」這個概念。而簡單隨機抽樣的抽樣誤差的計算方式,在95%信心水準下是 1.96 √[(p(1-p)*(N-n))/(n*(N-1))] ,當中p為某項調查數據的百分比,N為母體總數,n為樣本數目,一般所謂1068份有效樣本超樣誤差不超過正負3個百分點,就是依照這個公式得來的。
所以在95%信心水準下,當
N=300時抽樣誤差為5.7%,
N=400時抽樣誤差為5.0%,
N=800時抽樣誤差為3.5%,
N=1,068時抽樣誤差為3.0%,
N=2,000時抽樣誤差為2.2%,
N=4,000時抽樣誤差為1.5%
...
N=10,000時抽樣誤差為0.98%,
N=20,000時抽樣誤差為0.69%,
由此可知,樣本數多寡會決定抽樣誤差範圍,當樣本數超過1,068份以後,誤差範圍縮減的幅度就越來越小,但耗費的調查成本卻可能是等比增加的。換句話說從研究者/業主的角度而言,是先決定可以忍受的抽樣誤差範圍以及調查成本,再去決定某調查要抽取多少有效樣本,沒有所謂有水準的抽樣誤差就小於3%的說法。
而2007年的吳文完全忽略了在下前文所提不同母體無法比較的問題,對於抽樣誤差也有誤解,忽略了從點估計變成區間估計,抽樣誤差估計要用實際發生機率P去計算的問題,這點目前國內民調界只耳聞遠見雜誌戴立安曾經提到,香港大學民意中心主任鍾庭耀博士則有專文討論,例如若某人支持度為5%,就算樣本少到300個,某人5%支持度區間估計值其實是介於2.5%至7.5%之間,而非點估計的-0.7%至10.7%。
所以單從樣本數的角度來說,天下雜誌縣市排名調查的抽樣誤差,的確是要用個別縣市的樣本數去估計,因為根本就是次母體的概念,至於那些批評樣本過小、不準的政治性語言,就不評論了。
(待續)
新新聞1229期編輯台報告:民調是真實的謊言嗎?
回覆刪除1.為什麼是兩個母體阿?這不是同一個母體中不同的次群體?譬如我調查台灣地區子女對父母教養方式的知覺態度,這些父母就等於那些市長阿?
回覆刪除2.為自由時報辯護的例子也很怪,「訪員訓練等步驟符合調查研究方法要求,就能獲得具備一定信度、效度的民意調查,人家就是辦公室大、閒置空間多,能夠動員到足夠的訪員進行調查,甘卿何事?」,如果作者看過有經驗的訪員跟沒經驗的訪員所訪問出來的品質差異,我想作者可能就不會這麼樂觀了,更何況還有其他調查過程中需要標準化的東西根本不是一個臨時辦公室可以馬上建立的。
3.作者引用香港的的那篇專訪沒什麼太大意義,我所接觸過的國際上的民意調查機構所釋放出來的資料,根本就很少採用那個方法,不是說那個方法錯,隨便找幾本public opinion相關期刊,就可以跟你點出目前抽樣方法還存在哪些問題,問題是,你要花多少的成本去解決那個問題?
4.爆一個掛,作者一剛開始所舉出來的幾個民意機構,其中有一個還會要求研究員改數據。
版主回覆:(2010-10-11 12:02:08)
1.你還是沒有把母體以及評估標的問題弄清楚,之前在PLURK上就討論過了,
a.台北市民對總統的評價,和高雄市民對總統的評價,兩者能否比較,有沒有意義。
b.台北市民對台北市長的評價,和高雄市民對高雄市長的評價,兩者能否比較,有沒有意義。
你提到的知覺態度調查,就相當於你自己提出的班級成績比較,母體界定是全台,不同縣市視為變數中的不同屬性,評估標的是學生自己的表現(或是自己的父母),而非集合個體意見所得到的整體意見彙整,你能區別這中間的不同嗎?
2.我不需要幫自由辯護,他們也沒給我錢,我在前文也提到訪問過程及調查本身的疑慮是他們要自己回答的。
3.港大民意中心那篇是專欄,我提到的重點是從點估計到區間估計的問題,你又畫錯重點。
4.我還聽過(委辦單位)要多少(數據),(調查單位)直接自己填的咧 XD
1.原來你要說的是有沒有意義,不是統計上的問題,那文中一直說不同母體不能比較,會讓我誤解。
回覆刪除2.[你提到的知覺態度調查,就相當於你自己提出的班級成績比較,母體界定是全台,不同縣市視為變數中的不同屬性,評估標的是學生自己的表現(或是自己的父母),而非集合個體意見所得到的整體意見彙整,你能區別這中間的不同嗎?],我不清楚你的觀點,縣市可以是一個變項阿?個體的意見為什麼不可以集合起來分析?譬如子女對父母親教養方式的知覺態度:我來針對子女不同年齡層知覺父母親教養方式在平均數上的差異進行分析,這樣有問題嗎?年齡層是一個變項,就如同縣市也可以是一個變項。
3.我要跟你提的是「點估計到區間估計」其實在美國民意機構的調查也不常見。我還可以舉出20個以上可以改進調查缺失的方法,問題是,要花多少成本?
版主回覆:(2010-10-11 15:46:47)
1.單純從"統計軟體"的角度,當然愛怎麼比就怎麼比,頂多就是GIGO(garbage in garbage out)...但是從統計學理的角度看,的確是不同母體不能比較,天下雜誌用這種矇混的方式賺了那麼多年,應該也賺飽了。
2.我說的個體意見彙整比較,是指像天下雜誌這種跨母體的首長民意調查比較,可以彙整(這就是民調的用意)去推估每個母體的意見,但不能跨母體比較。
而你說的成績或是對父母教養態度的知覺調查,都是學生自己的成績或是學生評估自己的父母,前者一定可以比較,因為具有相對客觀的量化基礎,後者除了要探討的內生變數太多,還有衡量標準的問題、群組變異的問題,但勉強還能比較,要看題目怎麼設計,例如"我父母有沒有實施體罰"假如程度是有或沒有。重點是有沒有一致的比較基礎。
3.你還是沒抓到重點,我從頭到尾都沒說要像香港那樣採取滾動式調查,點估計變成區間估計,跟採取什麼調查方法無關...請估狗"點估計 區間估計"
補一下縣市首長的比較有沒有意義,就版主看起來沒有意義,但是我從公共行政理論的觀點看來的確是有意義的,我只能說大家觀點不一樣。
回覆刪除版主回覆:(2010-10-11 16:00:15)
新新聞對於天下調查的專題,那裡面就提出了許多從公共治理解讀的看法,最大的問題是,許多積非成是(?)或尚未驗證的觀點,都可以拿來解讀民調,例如這個
"縣市的型態是都會型還是農業型,也會影響當地民眾對縣市長的滿意度,梁世武說,「一般來說,農業縣的民眾比較容易得到簡約式的快樂,也比較容易滿足;都會型縣市的民眾要求較高,比較不容易滿足。這個因素當然會影響到民眾對縣市長的滿意度,更會影響到依據滿意度評分而做出的排名。」"
一個嚴謹的作法是,提出學理根據,評估鄉村地方因為"簡約式的快樂,比較容易滿足"而對於該縣市首長滿意度會高估多少,亦即標準化或加減權後或許從實務觀點勉能跨縣市比較。
但是那份專題裡面還是糊成一團,例如泛藍執政縣市名次狂跌,跟哪個調查比?該不會是遠見的縣市長施政滿意度調查吧 XD