網頁

顯示具有 統計 標籤的文章。 顯示所有文章
顯示具有 統計 標籤的文章。 顯示所有文章

2011年8月23日 星期二

統計可能可以用來解釋為何滑動中的物品比較不會倒

最近為了瞭解為何行進中的腳踏車比較不會倒上網查資料,才發現這個問題並不是簡單可以回答的。2011年發表的論文Science Magazine, Vol. 332 no. 6027 pp. 339-342, "A bicycle can be self-stable without gyroscopic or caster effects",還有團隊以這個題目做了深入的研究,基本上否定了大家最容易想到的角動量的因素(雖然我對其所作的實驗還是有很大的疑問)。

撇開腳踏車這種有輪子構造的物品不談,其他滑動中的物品,例如滑冰者在滑動時似乎比靜止不動時更容易保持平衡。我認為在每一種特定狀況下(冰面光滑度、冰刀、滑冰者的體重與體力等等)應該有一個最容易保持平衡的最佳速度,過快或過慢都會讓保持平衡更困難。冰刀滑動沒有任何轉動的物體,也沒有可以改變方向的前輪,因此上述論文所提出的研究並不適用。這個問題我目前認為可能可以用統計常見的現象來解釋。

照理說,任何形狀的物品,只要我們調整好其角度,讓重心與支點連線正好和地面垂直就可以保持平衡不會傾倒。不過在真實世界中隨時都會有許多擾動(氣流、地面震動、肌肉顫動等等)會讓重心偏離這條垂直線。不論這個擾動多麼微小,只要這個物品的重心在偏離垂直線時變低就會產生正回饋,而讓物品倒下。例如我們讓一個方型物品以某一個角當支點站立時就是如此。但如果我們讓這個方型物品以一整個邊當支點站立在地面上,其重心不論受到哪個方向的擾動而偏離原先的垂直線時,都必須被抬高,因而產生負回饋而讓物品回復平穩。底面較寬的物品就必須有較大的擾動才可能將它推倒。

滑冰者以尖銳的冰刀站立於冰面上,必須靠滑冰者的平衡感與重心調整才能保持不倒。在滑動時因為冰刀與冰面的接觸會產生許多擾動,並且隨著速度增加,擾動的強度也會增加,照理講應該會讓滑冰者更難保持平衡才對,這似乎與平常的觀察與直覺不一樣(是否真的如此有待實驗證明吧)。如果滑動時確實比較容易保持平衡,一個可能的解釋是滑動時在短時間內會產生大量的隨機擾動,這些沒有特定方向的隨機擾動對滑冰者所產生的影響反而會比較穩定,而比較容易控制。就像如果以丟銅板代表對滑冰者向左或向右的擾動力量,只丟兩個銅板的話全為正或反面的機率是二分之一,正反平衡的機率也是二分之一。但如果丟一千個銅板的話,正反面的數量則可以穩定的維持在接近平衡的狀態。此時對滑冰者而言,反而比較容易適當的調整重心來保持平衡。這是我的解釋,想到簡單的統計概念可以這樣用覺得很好玩,不過畢竟只是推測,是否真是這個原因還需要進一步的研究。

2009年4月24日 星期五

機率-化簡馭繁的屠龍寶刀

機率是幫助我們簡化複雜現象的法寶。任何事情,如果會受到多 不勝數的物件、事件或環境因素的影響,就很有可能可以用機率簡單化解此困難的處境,讓我們可以用簡單到難以置信的方法來分析或預測該事情的發展。最先想到 的例子當然就是骰子了。一顆骰子被拋出,掉落、翻滾、彈跳,最後靜止在桌面上,其中一面朝上顯示出一個數字。這是一個極其複雜的物理現象,我們需要計算拋 出的力道、方向、骰子的重量、重心、彈性係數、氣流、阻力、摩擦力.....等等多不勝數的物理性質如何影響骰子的運動過程。一顆骰子都已經這麼複雜,那 麼一千顆骰子呢?極其簡單,賭場只要能夠吸引一千位客人來擲骰子,幾乎可以說就是穩賺不賠。以下是兩個例子:
計算任意圖形的面積
  • 把圖形填滿畫在一張紙上,然後用另一張紙蓋起來。在這張紙上任意(隨機,每一次戳洞不受先前已戳之洞的影響)戳洞,計算破洞的總數n,以及破洞顯示出圖形顏色的次數m。
  • A*m/n的值隨著n值的增加將趨近於圖形的面積,A指覆蓋紙張的面積。
期末考時每一位同學都拿著一隻小手電筒被單獨囚禁在一個漆黑的房間,房中有下列物件:
  • 一盒兩千片的拼圖,拼好後是一張50公分見方,比例尺為二萬分之一的衛星照片
  • 房間裡面有鉛筆、白紙、量角器、計算機和比例尺
一個小時來計算照片中綠地的總面積,算的最準的人才能及格。怎麼辦?

2009年4月5日 星期日

標準差的幾何意義

右圖是計算標準差的公式。可是為什麼要這樣算?我們可以把一份資料的n個值看成是n維空間中的座標,因此一份資料就是n維空間中的一個點。在此看法下,標準差就是該份資料與 n維空間對角線之垂直距離的根號 n分之一。對角線就是該空間中所有向度座標都相等的點所組成的線,就是座標為(t, t, ..... t)的線 t為任一實數。

一份正好落在對角線上的資料其標準差是0,這顯然是相當無趣的資料,因為每一個值都剛好等於平均值。不過直覺上,用一份資料與對角線的距離來估計該份資料的散佈情況應該是合理的,至於根號 n分之一則是為了正規化,讓不同筆數的資料之間可以互相比較。

PS.
昨天問了幾位同學為何標準差要這樣算,有點意外的,有很多根本不了解標準差的意義,更不用說了解為什麼要這麼算了。說老實話,我不太容易體會這個問題在思考上的盲點,因為標準差算是相當直觀的概念,其算法應該也不必當作公式背,只要按照常理推斷就可以把公式設計出來。最直觀的當然是平均誤差,也就是每一個取樣與平均數之差距的平均值,然後導入空間概念,用計算距離的方式取代平均誤差就可以設計出標準差的算法與概念。需要想一下的是為何以根號 n 作為標準化的除數。我的解釋如下:

當我們要比較距離時,須考慮各項距離參考點所處空間的維度。考慮一個邊長為1的正方形區域,在其間取兩點的最大可能距離為根號2,當這個區域增加一個維度而成為正方體時,區域中任取兩點之最大可能距離為根號3。依此類推,在n維空間中的「正方體」區域任取兩點,其最大可能距離為根號n。因此,當不同維度空間中所量測的距離要放在一起比較時,需要除以根號n來正規化,才能將在不同量測條件取得的值相互比較。另一個切入概念是說,二維空間中的線段可以是某些更高維度空間線段的投影。一個個數為m的母體可以看成是在m維空間中的一個點,其標準差是該點與空間對角線的距離除以根號 m。當我們用n個取樣值來估計一個統計母體的標準差時,我們希望量測在m維空間中母體與對角線垂直線段在n維空間中投影的距離 ,但因為母體的平均值未知,取樣的平均值不太可能剛好等於母體的平均值,也因此取樣標準差對母體標準差的推估都太低了,也因此會有bessel's correction的需要。當然我們無法用投影距離推算出其在更高維度空間中的距離,不過我們可以合理的期望,如果取樣的方式適當,所忽略的m-n個維度之座標值的分佈情況與整個母體的分佈大約相同的話,將所量測出來的值除以維度的根號應該是合理的標準化差距,可以做為不同統計數值間的比較。

至於為何需要bessel's correction,以n-1取代n作為除數來計算標準差?其關鍵就是上述的,母體平均數為未知,若是以取樣值的平均數代替,所推估出來的標準差當然偏低。至於為何是n-1,而不用其他數值就需要再深入探討了。

(這個問題可以參照 丁村成老師的著作)(2011,10,16補述,謝謝 http://kevinlyu.blogspot.com/2011/05/blog-post_21.html的介紹)

下一個練習可以是兩個屬性之間相關性的分析。