2011年3月18日金曜日

Ubuntu10.10でsqlite3-rubyのインストール




「作りながら学ぶRUBY入門」でRubyからデータベースSQLite3を使うためのライブラリSQLite3-rubyのインストールに手間取ったので、その備忘録。

単に、
sudo apt-get install sqlite3
sudo apt-get install gems
sudo apt-get install rubygems1.8
sudo gem install sqlite3-ruby

とすると、図のようなエラーを出してインストールしてくれない。エラーメッセージを読むと、コンパイルで失敗しているみたいなので、手当たり次第にライブラリをいれる。

sudo apt-get install libsqlite3-dev
をやってもダメ。
sudo apt-get install libsqlite3-ruby
をやってもダメで、次に
sudo apt-get install ruby1.8-dev
を試すと、
sudo gem install sqlite3-ruby
がうまくパスしました。

あとは、
sudo gem install dbi
sudo gem install dbd-sqlite3
で、第5章の環境が構築できる。

めでたし、めでたし。しかし、LinuxをSlackwareのころから使っているけれど、進歩がない。トラブルが起こると、WEBで手当たり次第に検索するだけ。

同じトラブルに見舞われるであろう、I君へ記録を残しておきます。

2011年2月24日木曜日

卒論発表終了

昨日平成22年度の卒論発表が終了。今年のメンバーは5名で、自宅に引きこもるのはいるは、「朝10時までに来い」といっても、来るのは1,2名とかでいろいろでしたが、10月の投票実験とその解析で4名、残り1名は昨年の競馬予想の続きで、今年の発表のラインアップを組むことができました。

1:熊谷「美人投票と情報カスケード」

2:石澤「投票実験と情報カスケード」

3:辻「情報カスケードと相転移」

4:神田「投票モデルの統計物理」

5:入江「競馬予想と集団知」(本当は「最強の競馬予想」だったが、他の先生からのクレームでタイトルが変更。)

以上が、今年の発表のタイトル。プレゼンは、一番の熊谷君のが一番うまかったか、という印象です。他の方々も、まあまあだったと思います。ご苦労様でした。新しい環境で活躍されることを期待します。

2011年2月10日木曜日

つながり



誰がホモ・エコノミクスを殺したのか?そもそもホモ・エコノミクスは存在したのか?著者の答えは、非工業化社会の原住民に非常に合理的に行動する人々がいるというもの。アマゾン川流域のマチゲンガ族、タンザニアのハザ族、エクアドルのケチュア族など。それらに共通するのが社会性の欠如。部外者と遭遇しない、市場での取引を行わない部族ほど経済学者が考える「人間は私利私欲に基づく種であり、最小限のコストで最大限の個人的利益を得ようとする」ホモ・エコノミクスに近い行動をする。

一方、人類はこのホモ・エコノミクスの状態から進化し、ホモ・ディクティアヌスになったと著者達は考える。ラテン語のdicty=「網・ネット」とhomo=「人間」からの造語で、「人間の動機を純粋な利己主義から切り離」し、「私たちは他人とつながっているゆえに、また他人を思いやるように進化してきたがゆえに、行動を選択するにあたって他人の幸せを考慮」し、その結果自分の欲求に「周囲の人々の欲求を」を含め、「自分とつながりのある他人の欲するものを欲する」。

また、人の脳の大きさから、人は150人程度の人と「つながる」ことができる。この150をダンバー数という。ここでいう「つながる」というのは、「相手のことをよく知っている」関係のこと。150人とつながりを維持するためには、「毛づくろい」では自分の時間の42%必要となるので、人は「言葉」を発明した。「言葉」なら、「毛づくろい」と違って、1対1である必要はなく、一対多でOKだし、効率がいい。ダンバーの試算では「毛づくろい」より言葉は2.8倍効率的で、レストランの予約の人数を調べてみても、グループの人数の平均値は3.8だった。

人はなぜ投票するのか。自分の一票で選挙の結果が変わるわけでもないのに。筆者たちは「3次のルール」という自分の行動が友人の友人の友人にまで影響することを発見。すると、ひとり10人の友人がいれば、投票行動は、10人の10人の10人先の計1000人に影響し、ひとり1000票の価値を持つことになる。すると、選挙結果に影響がないとは言えず、投票行動は「合理的」となる。その他、「肥満は伝染するのか?別にいっしょにマックにいくわけでもないのに」などなど、取り上げるテーマも興味を引くものばかり。

おすすめです。

2011年2月8日火曜日

学会誌から

昨日、物理学会誌が届いたのを自炊するために分解しながら、パラパラと眺めていたら、金子先生の記事を見つけました。それは、1979年の東大物理の卒業文集に寄稿された久保亮吾先生の「基礎と応用」という文章の再録に関するもの。

内容は、日本に10年近く滞在したフランスの研究者D氏と久保先生の会話から始まり、D氏が「日本は応用科学には力をいれるが、基礎科学への努力は甚だ乏しい」という日本科学への短評から始まります。「フランスでは技術者でさえ、最も基礎的なことをやりたがる」「誰でも、できるならカルノーの原理のようなことをやりたいのだ」と。

それに対し、すこし「意外」という感想と日仏の比較のあと「基礎科学と応用科学の意味とその関係」についての話になります。久保先生の文章では極論として、真理とは役に立つもの(By 高橋秀俊先生)で、「役に立たないものは真理ではない。」「真理を求めるのが科学なら、応用とか基礎の区別は意味がない」となる。「その上に何かあるものを構築され得るだけの基礎を探求する、というものだけを基礎研究と呼ぶとすれば、それは実用を目的としない研究というのとはちがった意味である。」また、「大事なことは、役に立つ基礎を一つ新しく築くことである。」と。

最後に、話の落ちがお説教になって申し訳ないとしながら、「物理学科を卒業する諸君の仕事は本当の基礎を営々と築く活動であると思う。何も物理の分野に限ったことではない。物理の精神は本来、そういう基礎の学問であり、最も応用がきくものである。それが教育できたとは私も思っていない。むしろ、物理をやろうと思ったその気持ちの中にそれがあったはずである。」(1979.2.26)

北里物理の学科長は十河先生。久保先生の最後の弟子として何を語るのでしょう。

あと、学会誌に最後の会員の声で、吉岡先生が「グラフェンでは困りませんか?」という記事を書かれていました。grapheneは「グラフィーン」という表記のほうが発音に近い。グラフェンだと、日本人はグラにアクセントを置きがちで、外人には「グラヘン」と聞こえてしまう。今変えとかないと、Reynolds(レイノルズ─>レナルズ、レノルズ)数、acoustic(アコースティック─>アクースティック)やlaundry(ランドリー─>ラーンドリー、ローンドリー)みたいな、ローマ字読みのカタカナをそのまま発音することになってしまうと。今年、修士論文の副査を担当するのですが、そのタイトルは「グラフェンの物性の理論的研究」。修正させたほうがいいのでしょうか。ちなみに、主査は十河先生。

2011年1月29日土曜日

量子カオスの条件



半年ぶりに、数理物理・物性基礎論セミナーに出席。今回で7回目だそうですが、私は1回目の笹本氏のとき以来の2回目。テーマは、カオスの量子古典対応問題。講師は齊藤 圭司 氏。

カオスはもともと、系の時間発展が初期値に鋭敏に依存することを意味する言葉であり、有名なのがバタフライ効果で、ニューヨークでの蝶のハバタキがフロリダのハリケーンを巻き起こすというもので、あくまでニュートン方程式のような古典的な系に関する概念。では、古典的なマクロな系がカオス的なら、対応する量子系はどのような特徴をもつのか。それに対する答えが「エネルギー準位の統計がランダム行列のものと一致」ということ。

もっとも、答えといっても証明があるわけではなく、Gutzwiller(1971)からBerry(1985)までの研究で、エネルギー準位の2点関数のフーリエ変換の一次の項の一致のみが示されただけでした。図は、ランダム行列でのエネルギー準位の2点関数のフーリエ変換。τに関する一次の項の一致を示したのがBerry(1985)。それがここ10年の間にすべての次数での一致が示され、そのテクニックを使うと、ランダム行列で計算できない物理量が、半古典論にもとづく計算で可能となるとか。

セミナーでは、Berryまでの流れを前半の2時間半で解説し、細かな計算はともかく非常に分かりやすいものでした。一般的な古典系がカオスであるとして、古典軌道の概念を使いながら(つまり半古典論で)エネルギー準位の分布などの計算を行っていく。ひたすらガウス近似でおおらかに計算していくところは、昔風の理論物理そのもの。エネルギー準位の分布は古典軌道の和で書け、相関は経路の積の和になる。そのうち残るものが同じ経路の間だとして計算したのがBerryで、図の一次の項のτと2τを求めた。二次以降の項は、経路の重なりを考えて、組合せ論を展開する必要がある。

後半の1時間は、その高次の項の計算に用いられたSieber&Richer図と相関関数の計算(2001から2005)の解説。肝心の図の内容は理解できませんでしたが、雰囲気や、この手法がランダム行列の展開公式やアンダーソン局在の計算から思いつかれたものであるとか、いろいろ興味深いものでした。

自分で研究するわけではないですが、大変勉強になりました。ただ、内容が内容だけに学生さんむけというよりは、ほとんどプロ向けの勉強会になってしまっている。また、参加メンバーも、オーガナイザー周辺の人々だし。なかなか難しいのでしょうね。

2011年1月22日土曜日

キャプテンバギーの懸賞金はいくらか?



ワンピースで活躍するキャラクターの一人に「道化のバギー」ことキャプテン・バギーがいます。昨年行った投票実験のクイズの問題に、彼の懸賞金に関するものがありました。

問題:漫画「ワンピース」に登場する、バギー海賊団船長「道化のバギー」の懸賞金はいくら?(2010年9月1日現在)
            A.1300万ベリー    
            B.1500万ベリー

この問題に31人の学生さんに答えてもらったところ、正解したのは18人で正答率は約60%。もし、誰も正解を知らないなら正解する人の数は15,6人で、ゆらぎは3人程度なので、ゆらぎの範囲内ともいえるのですが、その点は置いておいて(31人というのがネック)、次のように考えるとします。答えを知っている人は20%で残りの80%はヤマカンで答えていると。すると、ヤマカンであたる確率は50%なので、答えを知っている20%と答えを知らない80%のうちの半分が正解して60%という正答率が出ることになります。

では、この二択のクイズを次のように行うとします。

(1)一人一人が解答
(2)前回までの解答結果をAに何票、Bに何票と教える。たとえば3番目の人には過去2人の投票結果を票数で教える

このとき、投票結果はどうなるでしょうか?そのときの投票の様子を示したのが次の図です。



毎回の投票の様子を折れ線の延びであらわしています。正しい選択肢に投票するとx軸に1ステップ、間違った選択肢に投票すると、y軸に1ステップ進みます。原点から出ている対角線は、ちょうど二つの選択肢の得票数がイーブンの状況を示し、もうひとつの対角線は31回投票後に到達しうる状態(x+y=31)を表しています。最初に伸びていく折れ線は前回までの投票結果を教えない状況での投票の様子を示しています。二つの選択肢の間でゆらいでいる様子がわかると思います。最初の二人が間違った選択肢を選んでいることに注意してください。

次に伸びていく折れ線は、(2)に書いたように、前回までの投票結果を教えた場合です。最初の一人は、参考にできる投票結果がないので、投票結果を教えない場合と同じように間違ったほうに投票します。二人目は、参照しない場合でも間違っていたのですが、教えた場合、最初の人の間違った答えを参照したので、おそらくより自信を深めて間違った選択肢を選びます。3人目の人は、参照しない場合は正しい選択肢を選んでいたのですが、今の場合は二人目までが間違った選択肢を選んでいるので、それに影響されて間違った選択を行う。この間違いの伝播が16人目まで続き、ひたすらy軸のほうに折れ線が進んでいきます。17人目に、やっと正解を知っている人が現れて、折れ線がx軸に1ステップ進むのですが、その時点で正解と不正解の得票数は1対16。それ以降の人々は、正解を知らなかったみたいで、全員が間違った選択肢を選び続けるようになります。(この結果を見ると、正解を知っていたのでは31人中1人で、残り30人は知らなかったことになり、20%80%という最初の評価にはすこし誤差があることがわかりますが。)

実験では、正解率が50%より高く、70%以下のクイズが全部で78問ありました。平均の正答率は60%で、この数字から正解を知っている人は20%、正解を知らない人は80%ということがわかります。正答率は50%より高いので、何も知らないで投票し、多数決で正解を推定すると100%正しい解答を選べたことになります。では、前回までに投票した人の投票結果を見せて投票させると、どうなるのか?そのときの正解率の分布を以前お見せしました。20%のところに小さなピーク、100%のところに大きなピークのある緑のヒストグラムです。では、このヒストグラムで正答率が50%未満のもの、つまり多数決を使うと間違った選択肢を選ぶことになるものがどれぐらあったかというと、16問。つまり2割強の比率で情報カスケードにより、選択を誤るわけです。



では、正解が知らない人がp%存在する(正解を知っているのは1-p%)とき、多数決で選択肢を選ぶと間違う確率はいくらなのでしょうか?論文の結果を示したのが、左の図です。αで間違う確率、つまり誤った選択肢の得票率が50%を超えてしまう確率を示しています。x軸は、無知な人々の比率。pが50%以下なら、その確率はセロなのですが、50%を越えるとゼロでなくなり、100%では確率50%で多数決が誤ることを教えてくれます。100%の場合は正解を知っている人が誰もいないので、誤る確率が50%になることは自明なのですが、無知な人が50%を超えると多数決で間違う確率が増加する様子は興味深いものです。特に50%での増加の様子は、情報カスケードが2次の相転移(確率の変化は連続で、その微分が不連続)であることを教えてくれます。

この式に、無知な人の比率が80%という値を代入します。すると、αは3分の1となり、3回に1回多数決が間違うことになります。実験では、78問中18問の2割強だったので、若干(?)少ない値となっていますが、その差が、投票人数が少ないこと(理論の結果は無限の人が投票する場合)からくるのは、サンプル数(78問)が少ないからなのか。それとも無知な人々の比率の推定がラフすぎるのか。私は、誤差の原因は論文のモデルがシンプルすぎだからと考えていますが、この実験結果の示唆する情報カスケード転移の本質を捉えていると考えています。

2011年1月20日木曜日

ニューラルネットとソーシャルネット2



「ニューラルネットとソーシャルネット」の続き。

今回の研究で一番驚いたというか、直感に反した結果というのは、参照する人数を増やすと正答率が下がるというものでした。考えている状況は、一人一人順番に投票し、そのうち比率1ーpの人は確率qで正しい投票を行い、比率pの人は無知で二択のうちのどちらが正しいか分からないというものです。このままだと全体の正答率は(1-p)q+0.5pとなります。無知な人々は、自分より前に投票した人の投票結果を参考に、その多数決の教えるほうに投票するとします。問題は、何人の意見を参考に投票するのが自分の正答率をもっとも上げることができるかというものです。直感的には、過去のすべての投票結果を見て、それを参考に投票するのがもっともよさそうです。モデルでは、多数決に従うとしているので、自分の順番が100番なら過去99人の投票結果のうち、66人が選択肢Aで残り33人が選択肢Bなら、選択肢Aを選ぶ。自分の順番が1000番なら、過去999人の多数決に従う。こうすれば、過去の情報をすべて取り入れることが可能になり、無知な人々の影響も弱まって、正答率も最大になるだろう。

図は、無知な人が80%存在する場合に、10000人の人が投票したときの全体の正答率をプロットしたものです。y軸はその正答率π。x軸は参照した人数rです。参照人数が1人の場合、無知な人は自分の直前に投票した人の結果を参照し投票する、というかんじです。図を見ると、正答率はある参照人数のところで最大になっていることが分かります。qが100%の場合は一人参照、それ以外の場合は5人から10人ぐらいを参照するのが正答率が最大で、参照人数をそれ以上に増やすと正答率は減少します。

何人を参照して投票するのがベストなのかは、全体の投票人数(何番目に投票するのか)や無知な人の比率p、正しい人の正答率qを変えると変化するので、一概には言えないのですが、pが80%以上の場合は5人から10人を参照するのがよく、pが低い場合は何人参照しても正答率はほとんど変化しないのですが、参照人数が多いほうが正答率は高い。次の図は、pをx軸に、正答率をy軸にとり、参照人数を変えたときのpと正答率の関係(1万人投票でq=0.6の場合)をプロットしたものです。pが大きい場合は参照人数が少ないほうがよく、小さい場合は多数の人の意見に従ったほうがいいことが分かります。また、参照人数が無限大の場合、無知な人々の比率が50%をこえているならば、どの参照人数の場合よりも正答率が低いこともわかります。




例えば、食べログやアスクUなどのレストランでレビュー件数が1000件の場合、1000件での多数決よりは直近10件での多数決のほうがいいということなのでしょう。情報の鮮度を考えると、数年前のレビューより、この2、3カ月のレビューを信じたほうがいいという、何かあたり前の結論になります。参照人数を多くすると正答率が下がるというのは別に直感に反するわけではなく、常識なのかもしれません。

もちろん、これはあくまで例え話なので、問題の本質とは関係ありません。情報カスケードで悪い状態に捕まったとき、参照人数がすくないならば、正しい人が状況をひっくり返せるけれど、参照人数が多い場合はそれができない、ということなのでしょう。