Showing posts with label google. Show all posts
Showing posts with label google. Show all posts

Friday, April 16, 2010

如何搞定 Google Search 的 Twitter Timeline 介面

Google 公布開放 Twitter 歷史資料搜尋的同時,也提到呈現搜尋結果的 Timeline 介面,但是我昨天試了一下午,總是看不到時間線。直到今天看了Google Operating System 的介紹,仔細研究幾個範例(例1,2,3),才發現網址列裡面的玄機,後來用瀏覽器的 smart keyword 功能,建了一個智慧搜關鍵字 tl,設定完畢後,就可以在網址列直接輸入 tl  Yankee ,以時間線介面,選擇看到 Yankee 在 Twitter 訊息流裡面特定時間點和範圍裡出現的順序和內容 (見下圖)。




智慧關鍵字的網址設定如下,因為目前此功能只有英文幾面才開放,所以必須指定使用英文(hl=en),雖然用這個繞路(work around)的方法,暫時解決 Twitter Timeline ,不過我總覺得不對勁,依照 Google 公布 的說明,不需要這麼麻煩就能看到時間線,不知道究竟是哪裡出錯?請高手為小弟解惑。

http://www.google.com/search?hl=en&tbo=1&esrch=RTReplay&q=%s&tbs=mbl:1


Tuesday, April 6, 2010

搜尋引擎能給我們更美好的未來嗎?

ReadWriteWeb 的 Mike Melanson 昨日(2010/04/05)發表一篇短文,文中說明他發現如果使用 Google 搜尋“我想死”(i want to die),在搜尋結果上方,出現防止自殺熱線的訊息(圖1中用紅框標示的項目)。文末,作者問了一個問題 Do we want Google to simply act as a firehose of data or can we expect it to tailor its results to do better for the world?

如果一個人能“舉一隅,而以三隅反”,我們認為這個人夠聰明,肯思索;如果”舉一反三“的不是人類,而是用演算法建構的資訊系統呢?

這問題背後隱含好幾個問題,首先,現有技術搜尋內容判斷搜尋者企圖的能力是否夠好?做了判斷之後,搜尋引擎的資料庫裡面是否有足夠多的資料能夠舉一反三?最重要的是,這樣能帶給使用者最大的效益嗎?面對這些問題,我沒有答案,Mike Melanson 也只是問 what do you think (很老實也很滑頭)?

筆者做了一個小實驗,分別搜尋 “i want to die”和 "我想自殺",圖 2, 3, 4 是測試結果的截圖,不論是否使用搜尋輔助套件 Surf Canyon,搜尋 ”i want to die“ ,都不會顯示防止自殺熱線,搜尋“我想自殺” 結果的第一條,竟然是“推薦跳樓地點”。

做了實驗之後,我的腦子裡又多了一個問題,Google 所打造的幸福未來,還是有地域之別的!?

(圖1:RWW 文中所使用的圖例,紅色方框是筆者加上去的)


(圖2:這是在 Chrome 瀏覽器中使用套件 Surf Canyon 的搜尋結果)


(圖3:這是完全沒有使用任何套件的搜尋結果)

 (圖4:搜尋“我想自殺”的結果)

Friday, June 27, 2008

[感慨] It's over. Google Wins?

一年前,Read/WriteWeb 宣布 :Google has won。但是作者 Bernard Lunn 仍然樂觀的舉出許多創意和技術上的方向,並且興致勃勃的討論 What is Post-Search。RWW 其他作者寫了這篇 Top 17 Search Innovations Outside Of Google 告訴大家,除了 Goggle之外,學界和產業界仍然有許多金頭腦(們)竭力改變搜尋的面貌和產業版圖,而且Google也沒有停止創新的腳步,誰知道明天我們會看到什麽?

一年後,John Batelle 看到 Yahoo 在面對微軟收購壓力的失措,還有新創公司的蹣跚腳步,不由得感嘆 It's Over。

In search, it's over, Google wins. With Yahoo flailing, and Microsoft hiding in the weeds, search is slouching toward a natural monopoly. We may as well call it. Sure, there are really interesting startups. But....nothing that interesting.

So now what? What might be next?

 

Share this post :

Monday, January 7, 2008

Google favors recent contents ?

It was January 1st, 2008, then. Google Operating System pointed out that there's an interesting change in Google's search result - the preference in favoring recent contents. TechCrunch immediately published the post "The Google Algorithm Is Changing" highlighting the discovery of "update on algorithm".

If you're tired of reading the articles filled with the similar sentences describing the changes made by Google and comments on the impacts caused by the update. Try the video released by WebProNews. If a picture paints a thousand words, what about a video?



It's not quite clear that when Google changed their algorithm and how it will change the world. After reading TechCrunch's post, I turned off my laptop and went out for a walk with my daughters.

Wednesday, December 5, 2007

從 Google Reader 的訂閱推薦談起

時值歲末,Google 旗下的服務異動很多,好像急著在年底前倒出一籮筐「好東西」,作為給用戶的 Christmas (新年)禮物。 GMail 啟用第二版介面才沒兩天,就又增加 Group Chat 、彩色標籤和 AIM 的整合。和郵件服務有點「兄弟臉」的 Google Reader 也沒閒著,先是提供拖拉(drag-and-drop)方式管理訂閱清單的功能,這兩天
宣布開始提供推薦閱讀 (Feed Recommendation)功能。

在部落格圈子(Blogospphere)裡,對於訂閱推薦的反應很是熱鬧,新聞型的網站是報導加轉載,一天要看上很多次報導;評論型的博客們,則各自發表了試用的心得,從經營模式的針貶到推薦精準度的抱怨,遍地開花,倒也有趣。

因為前陣子「閉關」的緣故,刻意讓自己少念些來自網路上的資訊,所以向來關注「推薦機制」議題的我,這回原本並不怎麼關心這個話題的。但是在試了幾個推薦訂閱之後,一些有趣的巧合,讓我對這個議題產生一些想法,開始留意起更多有關資料。

關於推薦訂閱這件事,我的觀察分為兩個角度,第一是 (Online)RSS Reader 的競爭環境,和不同經營模式對於市場佔有率的影響;第二個則是從推薦機制的技術角度來看,與過去所念的文獻相印證。

Google Reader 進入線上 RSS 閱讀市場之後,憑著高明的技術,很快搶下一片天空,
原本市場中的活躍份子,如今只剩 Bloglines 的市佔率還算「可觀」,其餘的競爭者已經被擠壓到一軍陣容之外了。倒是大陸地區因為大環境的關係,本地市場出現了像「抓蝦」、「鮮果」這樣令人驚豔的狠角色,令人期待。

在這樣的大環境下,不少 RSS 閱讀器廠商,都以開發更多社群網路的可能性作為強化競爭優勢的手段。就以促進推薦訂閱這件事來作比較,鮮果的 鮮果榜和 Bloglines 的 Bloglines Top 100 ,就是這種思維的產物;而 Google 在面對這個挑戰時,採取的態度與 Google News 相若,強調以「資料+演算法」的機制,產生推薦名單。

Google News 的開發團隊,在今年五月舉辦的 WWW 2007 會議中,發表了 Google News 推薦新聞機制演算法的論文 ─ Google news personalization: scalable online collaborative filtering。換言之,Google News 不再滿足於2001年時設定的新聞聚合(automated news aggregater)服務的目標,也加入更多的機制,期望提高這個服務的使用率。

Google Reader 也加入推薦閱讀功能,恰如 Attention Economy: All You Need To Know 所闡述的 ,choice 和 relevancy 是留住用戶的手、眼和心的不二法門。



雖然有人(原本不是很認真看這個話題,當時沒有作書籤,現在一時找不到出處,等找到再補上)抱怨 Google Reader 的推薦名單,精確度和推薦數目都不理想,認為 Google 作得太草率。以我個人的經驗來看,推薦品質雖然不算完美,倒也沒有太糟糕,也許Google Reader 團隊所使用的演算法還沒有成熟。但我想強調的重點是, Google 「讓資料說話」和「閱讀器功能優先」的信念,和其他業者以社群機制作為留客關鍵手段的想法是有很大不同的。

另外一件值得重視的事情是源自巧合,我從 Google Reader 的推薦名單裡找到兩個我很喜歡的部落格 - Synthese 和 Daniel Lemire's Blog 。這兩個部落格的作者都是資訊科學界中人,書寫的題材恰好也是我關注的議題,所以我非常滿意這兩個推薦項目,其他的推薦項目,雖然不見得合我口味,但在這兩個極度滿意的「掩護」下,讓我沒有太多抱怨(grin)。

讓事情變得更有趣的是,這兩個部落格最近的兩篇文章,都和近日手中的工作或者接下來的工作有關,這樣的巧合,是所有的推薦機制都作不出來的。

Daniel 剛剛寫了搜尋引擎 Quintura 的介紹,這個被 AltSearchEngine 稱為 the alternative search engine of the year 的搜尋界新秀,正是我打算分析、介紹的關注對象之一,原本想年底忙完現在手上的專案,再找些相關資料來消化的。面對這個巧合,頓時有點「眼前有景道不得,崔顥題詩在上頭」的感慨。這是巧合之一。

Synthese 則提到 IngentaConnect (一個提供學術出版品和圖書館服務的廠商)宣布將和 Baynote (提供推薦系統技術的廠商)合作,以 Collaborative Filetering(關於 CF 的介紹,請參考拙作)技術為基礎的建立推薦機制,向閱讀學術期刊的讀者們提供期刊文章的推薦服務。以下是新聞稿部分內容,概略的介紹了這個服務的運作原理 (how it works)。
… context and behaviour are combined to determine the user’s intent, which is then analysed for relevance to that of the site’s other users; patterns that emerge from this analysis are used to recommend additional content which is more likely to be of interest and relevance to the user than regular, contextual recommendations. Sophisticated behavioural analysis monitors not simply clicks and page views, but also the length of time that a user spends on the page and the type of activities that they carry out there.
Synthesis 的作者對於這個合作是有疑慮的,他認為 IngentaConnect 的介紹太籠統含糊,而 Baynote 的產品介紹,則是 too simple to be true。果然是深諳推薦系統箇中三昧的圈內人,只是有些書生氣(我喜歡),對於行銷宣傳目的的新聞稿,也可以有那麼多牢騷,還指出某些推薦系統成敗的要素,果然是讀書人啊。

不論 Baynote 到底是會不會抓老鼠的貓,但是從 Google News 、Google Reader 到 IngentaConnect ,推薦機制不約而同變成各項服務(service offerings)內容的核心機制之一,證明了幾件事:

  • 首先,在競爭激烈的線上世界,內容的 choice 和 relevancy 是抓住客戶的關鍵指標,而推薦機制(recommendations)正是這促進這兩個指標的具體實踐。但是目標雖同,不同的決策者,執行的策略未必相同(本文第一項的分析正說明這個事實)
  • 其次,推薦技術的成熟度,有很大的進展,所以越來越多的業者,可以將推薦機制加入產品中
  • 推薦系統處理的資料品項,越來越豐富,從以零售(retail business)產業的產品(比如說書、CD、DVD),如今內容(content)產業的產品,也將變進入推薦機制的主流
  • 產品資料的複雜度,與日俱增,下一代的推薦系統,必須提升對產品特性資料的掌握度,比如 Google News 的產品─新聞,具有高度的時間相關性,每則新聞的生命週期,可能短到以天為單位,這與傳統 e-business 販售產品的特性有很大差異。另外一個例子,Netflix Prize 的參賽者,曾經有過是否可以援用 IMDB 資料庫內容的爭議。由此可見,產品特性掌握越到位,才有機會建立一個完整的推薦系統。

Wednesday, October 31, 2007

Linux dates backs to 1911 ?

據 Google Blogoscoped 介紹,有人在 Reddit 上說, Google Experimental Search 的 timeline view (關於 timeline view ,請參考筆者先前寫的介紹1,2) 顯示 Linux 的最早日期是1911年,並且附上一張圖,表示「有圖有真相」。



Blogoscoped 解釋這個現象的原因是,Google 錯誤解讀核心版本號碼 ─ 2.6.11 ─ 的意義。不過,顯然 Google 已經作了修正,現在搜尋結果顯示的最早日期是 1984 年了。總之,實驗仍未成功,同志仍須努力....

Monday, October 8, 2007

把 Google Experimental Search 變成預設的搜尋首頁

兩個月前,筆者曾經撰文介紹 Google 推出的 Experimental Search ,在這個實驗性質的網站, Google 推出了增進搜尋體驗(search experience)的四項實驗功能:
  • Alternative view for search result
  • Keyboard shortcut
  • Left-hand search navigation
  • Right-hand contextual search navigation

筆者在創新和研發不會停止一文中特別介紹了 Alternative view 中的 map view 和 timeline view,許多老朋友對於這個發展特別感興趣,最近 Google Experimental 又有值得關注的新變化。

首先,Alternative views for search result 增加一個新的展現方式 - info view ,在輸入搜尋關鍵字組後,接著輸入 view:info ,搜尋結果除了以傳統的條列方式展現外,螢幕右方會出現如下的文字方塊。

使用者可以選擇想要聚焦的項目,例如地點(map)、日期(timeline)、影像(image)等等,當使用者選擇想要特別關注的項目之後,左方的搜尋結果會配合所選的項目,在每一個輸出 URL 的下方,顯示文字或圖片會作相應的變化。

下圖即是查詢 Olympic view:info - show Images 的結果:

其次,Google Experimental Search 邀請用戶加入網站的實驗計畫,加入實驗計畫的方法很簡單,先拜訪 Experimental Search 網站,然後在想要加入實驗項目上點選 Join Experience 即可。加入實驗後, http://www.google.com/experimental/ 就取代原來的 Google 首頁,變成用戶進入 Google 的門戶了(我猜紀錄應該是存在瀏覽器的 cookies 裡)。

Thursday, August 16, 2007

Google 又來了,這回是 Google Health

去年(2006)十一月,國內外媒體紛紛刊登一則「Google 搜尋醫療文章準確度達 58%」的新聞,這則新聞的根據是 British Medical Journal (BMJ)網站上發表的一份報告 - Googling for a diagnosis--use of Google as a diagnostic aid: internet based study。

Google as doctors' aide

根據 BCC 新聞網站的報導,澳洲的兩名醫師(Hangwi Tang,Jennifer Hwee Kwoon Ng )從新英格蘭醫學期刊(New England Journal of Medicine),找出二十六件個案記錄,從每件個案中挑選三到五個描述症狀的關鍵字,輸入 Google ,檢視前三十項搜尋結果,然後選擇與關鍵字相符的診療判斷。然後和期刊中登載的診療方式比對,發現在廿六種疾病的斷症中,有十五個答案是正確的, Google網站提供的資訊準確度近六成,達百分之五十八。

BCC 的報導中說,Google 不可能代替醫師,但是它可以提供很有效的幫助:

The authors say Google can be a "useful aid", but UK experts said the internet was "no replacement" for doctors.

民生報和其他國內媒體,大都將這件事當作”寰宇搜奇”之類可供茶餘飯後談助之資的新聞來處理。但是這則新聞背後,有些更重要的意義沒有被傳達、被發掘(星島日報就處理的比民生報準確有用)。

根據這則報導,目前 Google 收錄了三十億篇(three billions)醫學相關的文章,因此 Google 能夠以他們的演算法和運算資源,將「可能」是合適答案的資料給篩選出來。這代表 Google 在技術上已達到某個高度,而網路上醫學相關的資料在質和量上也都達到一個相當的水準。

Google Health

以上分析,可能只是 提供Google 達成另外一個「野心」的充分條件而已,Google Blogoscoped 最近的一則新聞披露了正在研發中的 Google Health 的執行畫面。Google Health 是一個遠比單單查詢疾病診療用藥方式,更具野心、更全面的一個產品(服務)。紐約時報的報導 - Google and Microsoft Look to Change Health Care,更準確的說明了軟體雙雄對於改變醫療產業生態的野心,根據紐時報導, Google Health 的啟動畫面有以下的文字:

At Google, we feel patients should be in charge of their health information, and they should be able to grant their health care providers, family members, or whomever they choose, access to this information. Google Health was developed to meet this need.

這段話,把Google 的目的(或說野心)講得很清楚,Google 希望將每個人的醫療資訊納入索引範圍,結合他們原有的龐大醫療資訊源以及運算能力,這個產品不僅能將個人、醫藥業從業人員、保險業全部綁在一起。

Google 提供給某些醫療業內人士的展示畫面包括了 health profile 和 health guide 兩個大方向的功能:

...then has 17 other Web pages including a “health profile” for medications, conditions and allergies; a personalized “health guide” for suggested treatments, drug interactions and diet and exercise regimens; pages for receiving reminder messages to get prescription refills or visit a doctor; and directories of nearby doctors

Google Health 是一個已經開發超過一年半的產品,大陸極為有名的博客 GSeeker ,對於這個產品開發的來龍去脈,有很詳細的解說。Google Blogoscoped 稍早的文章則公布了一些可能是測試版本的畫面。下面是其中的兩個畫面,若要看更多畫面,請到Google Blogoscoped 查閱。

(上方的 Tab 有 Profile 和 Medical Guide 兩項)



(把 Google Health 和 WebMD 查詢用藥方式的畫面做個比較)

撫今追昔,話天寶舊事

據筆者的記憶(記憶是會騙人的,所以以下說話不敢負責任),在西元兩千年前後,就是所謂的 Web 1.0 那個年代,國內有幾家網路業者,也打算改變以網際網路突破醫療業的產業結構,其中較著名的有以國際厚生健康園區(背後是秀傳醫院)、亞洲醫藥網(新黨某大老和創投)、國家網路醫院(KingNet 的頻道之一)。

當時有的廠商想做藥的聯合採購平台,有人想吃健保申報這塊餅,有人要做線上問診、有人要做比美 WebMD 的專業醫藥 ICP ,但是醫藥產業的生態鏈,不是 HTTP protocol 和納司達克(Nasdaq)的魅力可以打破的。2000 年的上半年,大夥兒都熱熱鬧鬧的開了記者會,但是日子一天天過去,醫界根本沒人理他們說什麼,最多就是多說服幾個診所醫師架網站而已。然後錢燒完了,大家都必須懂得權變,不約而同的轉型了。

七年過去了,現在這幾家廠商的網站,距離一個 ICP 的標準都還差得遠,有的網站裡的醫藥文章,最後編輯時間是 2004 年,就算仍然有在網站上更新文章,數量跟 billions 不知道差幾個零。

有人轉型為做網站設計、客製軟體開發的軟體公司;厚生也只能做秀傳自己的採購罷了,距離 Hub 的概念是天差地遠了。曾經在這一波網路熱潮裡「參一卡」的經理人們,看到 Google Health 的新聞,不知道心裡有什麼想法。


Tuesday, August 14, 2007

使用 Google 會讓人變笨嗎?

商業週刊有一個單元,叫做 DebateRoom ,副標題是 "Find Out What Fellow Readers Think",開放讀者針對目前這個特定的題目發表正、反不同的意見。最近有個主題 ─ "Google Is Killing Intellect",發行了一集 Podcast。

這一集裡,負責串場主持的週刊執行編輯,先用他柔和的男中音,問了一個問題─ "Is Google making us dumber ?",然後邀請以研究 web usability 出名的 Jakob Nielson 和 "When Computers were Human" 的作者 David Alan Grier,從不同的角度,各自陳述不同的論點。之後主持人拿讀者所問的問題,讓兩位主講人分別回答,交織出一場十六分鐘的精彩對談。



我的聽力其實很一般,在聽的過程中,也常走神,想到別的問題就拉不回來了,等到回神,討論的主線輕舟已過萬重山,所見所聽早就不是原來的風景了。我不想誤導大家,只寫下幾點我聽到的和自己胡思亂想的,讓大家自己去思考。這樣的問題,每個人都該有一個屬於自己的答案才是。

  • 如果你想查一個藥品的用法、K2 峰的高度、1988年奧運在哪裡舉行, Google 是非常好的工具;但是 Google 沒辦法讓你作進一步的思考,如果你想要進一步深入研究一個主題、研究一個國家的歷史、瞭解一個對於新的學問,Google 就力有未逮,而且使用 Google 可能妨礙你養成思考的習慣。
  • 使用百科全書、辭典查閱資料,本來就是學習的重要一環,現在有誰會指責”大英百科全書”讓你不再思考?
  • 網路的資料,尤其是有關爭議性主題的內容時,可靠性常常要打折扣。
  • 當我們在讀印刷媒體(比如說:用紙張印刷的書),也必須自己判斷閱讀內容的考靠度與有用的程度。不是說盡信書不如無書嗎?
  • Jakob 說他作的研究顯示 - The best pieces get least traffic ,我們該高興還是悲傷?
  • 有讀者建議我們該作個 Google Diet ?
  • 最後但不是最不重要的一點 (The last but not least): We're not claiming Google is evil.
(再次聲明,以上不是翻譯,只是邊聽邊胡思亂想寫下來的,我的聽力實在不怎麼樣,我絕對不能負誤導之責 )

不熟悉 Podcast 的人可以,不妨到網路搜尋 podcast 101 (看看蘋果的解釋和 ZDNet 的影片),可以找到許多介紹”播客”的資料,目前訂閱、收聽 podcasts 最方便的,應該還是蘋果出的 iTune 了,如果想要安裝軟體,到蘋果電腦的下載網址去下載吧。

使用 iTune 的人,直接訂閱這個網址,可以在未來 用iTune 繼續收聽 DebateRoom 其他節目,如果只想聽這一集對談內容,可以直接下載這個 MP3 檔案,用你的播放器放來聽。

商業週刊網站裡 Cutting Edge 單元裡,也有一個 Podcast 101 的介紹,但是這個安排有點奇怪,不懂 Podcast 的人,怎麼能收聽到這一集節目呢?ZDNet 用短片來介紹 Podcast 的點子顯然合理得多了。

不知道這算不算 usability 的範疇,雖然商業週刊(BW)請 usability 專家上節目,但是自己網站的安排,還要改進空間喔。不知道 Jakob 會不會順便收顧問費?

Sunday, August 12, 2007

創新和研發不會停止...

雖然 RWW(Read/Write Web) 說,Google 已經贏了第一回合,大家要做好準備面對 post-search era ,而且也告訴大家用這篇 Top 17 Search Innovations Outside Of Google 告訴大家,世界上的金頭腦們(當然是複數嘍)不是只為 Googleplex 效力。

不過 Google 的研發人員也沒有閒著,在 Google Experimental Search 網頁,可以看到他們的研發人發最新的點子,隔一陣子來這兒逛逛,常會帶來不少驚奇(或驚喜)。目前我們在這裡看到的大多是使用介面上的創新,比如說鍵盤捷徑(keyborad shorcut)或是語意相關 (contextual search navigation),也有可能是資料整理或呈現的新方式,比如說最新的點子 ─ timeline view 和 map view 。

有的時候,逐行條列的呈現方式,不見得是最適合的資料呈現方式,以視覺化(visualized)的方式,呈現搜尋目標的時間和空間的意涵,就是非常好的切入方向。

時間 (timeline view)

用例子來說明什麼是 timeline view,可能是最好的說明方式了。當我們搜尋亞當斯、喬治布希、奈米技術等關鍵字的結果時,timeline view 以時間軸的方式(見下圖)來呈現資料庫中與搜尋標的相關,且包含時間這項屬性的資料,這種方式,可以將一個人(一件事)的生平(大事記),快速的勾勒出來。

下面的圖形就是查詢的例子,時間軸上直方長條,表示那一段時間資料的多寡,直方條愈高,那個時段有與我們要搜尋標的有關的資料愈多,當滑鼠經過時間軸上,方框會顯示現在的焦點(foucs)。點擊下去,會顯示僅與該時段有關的資料。

上圖是查詢奈米技術的結果, 從這張圖我們可以看出,在西元 2005 左右,是相關資料最多的年份。所以從資料顯示,奈米熱是從約莫三、四年前開始加溫燃燒的,事實是這樣的嗎?

空間(map view)

同樣地,用實例來解釋空間呈現方式的奧妙,是再簡單不過了。假設我們要查詢奧林匹克運動會、美國民權運動或是某個學術會議, map view 給我們的是搜尋目標的地理關係分佈圖。

拜 Google Map/Earth 之賜,Google 會以一張很精美的地圖表示歷年奧林匹克運動會舉辦地點,或者是這個學術會議的舉辦地點。然後使用 Google Map 的強大功能,就可以在地圖上查詢、作標記、看衛星地圖等等,作進一步的研究。

試試看

如果你想自己試試看這兩個功能的效果,只要在一般搜尋的文字窗裡輸入

keywords view:timeline 或是 keywords view:map,

不見得要到 Google Experimental Search 網站才能嚐新。不這兩個功能還在概念性的測試,不是真正產品化的功能,結果不見得如人意,嚐鮮前不要期望太高。比如說,查詢在 Birth of Data Mining 裡談到的學術會議 IJCAI ,就沒有在時間軸上顯示出 1989 這個重要的年份。

展望

實驗室裡有個兄弟作 Text Mining,每回他們那一組人在跑資料的時候,就語多哀怨,貌似痛苦的很。不僅自憐沒有強大奧援,也自傷不知未來的應用何在?

看了 Google 實驗室的作品,他們應該會對這個領域的應用,有更多信心了。如果在搜索引擎畫面輸入 "白居易 view:timeline" ,搜索引擎就幫你畫出白居易的生平,相信這樣的服務,會有很多學子拍手歡迎。如果這樣的技術有進一步的發展,這樣的服務,不知會是奇摩知識的最佳伙伴還是競爭者?

補記

才剛寫完這篇文章,就追加”後記”似乎不是個好習慣,實在是因為才剛上傳文章, Java Update 就了跳出來,我不假思索地就同意安裝更新,不料安裝程式立刻問我要不要裝 Google Toolbar 和 Google Desktop,實在是讓人感受到 Google 在網路世界裡的無所不在。

接下來,我們要問,有 Google 真的完全是好事嗎?


Saturday, August 11, 2007

Eric Schmidt talked about Web 3.0 at Seoul Digital Forum

自從 Eric Schmidt(有人不知道他是誰嗎?) 在 Seoul Digital Forum 接受記者訪問時開了 Web 2.0 一個玩笑,說 two point o 是個行銷名詞(marketing term),韓國籍的博客趕緊將這段錄影上傳到 YouTube 去,一時間在每個書籤網站(尤其是國外的,咳),可以發現引用、轉錄這段錄影的博客,多得罄竹難書。


其實這段只有一分多鐘的訪問,重點是後半段 Eric Schmidt 談 Web 3.0 那幾句話。這幾句話咬字很清楚,說的不快,要聽懂不算很難,不過為了避免二手傳播誤人,有位正港外國人把訪問內容寫下來,大家對照著聽吧...



My prediction would be that Web 3.0 would ultimately be seen as applications that are pieced together [and that share] a number of characteristics: the applications are relatively small; the data is in the cloud; the applications can run on any device - PC or mobile phone; the applications are very fast and they're very customizable; and furthermore the applications are distributed essentially virally, literally by social networks, by email. You won't go to the store and purchase them. ... That's a very different application model than we've ever seen in computing ... and likely to be very, very large. There's low barriers to entry. The new generation of tools being announced today by Google and other companies make it relatively easy to do. [It] solves a lot of problems, and it works everywhere.


延伸閱讀:

 

Google 更新資料的速度有多快

Google Blog Search Indexing Posts Within 120 Seconds七月底,國外不少以搜尋產業和搜尋最佳化( SEO) 為主題的部落客─ 比如說 Google Operating System、SEO by the SEA、BlogStorm、Tamar、s-Sema,不約而同的談到 Google 更新資料的速度。

(題外話,又是一個 Blogoshphere 生態的寫照,同質性高的圈子裡,會在同一個時段裡,傾向談同一個話題 ─ 不過這不是今天我想談的主題)

有的人(eSema 和 Google Operating System)說網頁更新的速度以分鐘為單位,有人(BlogStorm、Tamr、Seo by the SEA)說部落格的更新更快,BlogStorm 甚至說他作的測試,反應速度達到120秒(兩分鐘耶,Argh, incredible...)。 總而言之,眾家說法有驚人的共識,部落格資料的更新比起一般網頁,的確是稍微快一點,但是無論是網頁還是部落格資料,反應速度都是 within minutes,以分鐘為單位,這個結論,實在是嚇人。

Matt Cutts ─ 這個可能是除了創辦人和總裁 Eric Schmidt 之外,在搜尋業界最有名的 Google 員工,索性在他的個人部落格裡夫子自道,披露 Google 更新網頁資料庫的秘密,為眾人釋疑。

根據 Matt 的說法,當他在 2000 年初加入 Google 的時候,網頁資料要三至四個月才能更新一次,到了 2000 年中,他們已經進步到一個月更新一次。而當時有些搜尋業界的競爭者,可能一年都沒有作一次 fresh update (他沒有指名道姓,不過這樣的廠商還存在的機率,可能是趨近於零吧)。

從2000夏天到2003年夏天,Google 大約每月作一次 index update。,每次更新時,必須依序將逐個資料中心離線,然後灌入新的資料,這樣一輪下來,約莫要花一個月,才能把所有資料中心更新完畢,這種動作, Matt 稱作 Google Dance。

過了2003年夏天,他們的 crawl/index 團隊,開始使用漸進式(incremental)的更新,不再每次都作全部索引的更新(fresh update)。經過這些年,index 團隊持續改善他們的程式和作業方式,現在的成果是以分鐘作為反應速度的單位,結果就是「持續」提高使用者的對服務品質的期望值。

Now raise your hand if you remember “Update Fritz” from summer 2003. That was the Google Dance where Google switched from a monthly batch update to an incremental update. That means that our crawl/indexing team updated a fraction of our index daily or near-daily. Back then we had not only the normal crawl but also a “fresh crawl,” and if documents were in the fresh crawl then Google would sometimes show a date in our snippet.

難怪 Read/Write Web(RWW) 要說,我們面對現實吧,Google 已經贏了第一回合,我們要面對 post-search era ,準備下一回合的競爭吧!

讓人感到欣慰的是,innovators 沒有懷憂喪志,仍然不斷拋出新創意和新技術,說不準真的有個 Google killer out there ,主宰下一回合的戰局。RWW 在今年五月發表了一篇Top 17 Search Innovations Outside Of Google,非常精彩。

這篇文章把將出現在新一代搜尋服務裡的技術分成四個分類:Query Pre-processing; Information Sources; Algorithm Improvement; Results Visualization and Post-processing。每個分類都有頗精彩的代表作,雖然不是每個創意或技術都能笑到最後,但是這些創意的衝擊和融合,勢必會給我們帶來更有趣的網路衝浪經驗(I hope)。



所以,還是那句老話 ─ stay tuned....


Friday, July 27, 2007

The Future of Search - Google Edition

MIT Technology Review 是一本深度、廣度兼具,介紹科技新知的雜誌,最近這本雜誌訪問 Google 的研發部門主管(Director, Google Reseach)Peter Norvig ,雜誌網站在今(2007)年7月份發表了訪問的內容。看了這篇訪談,讓我想起去年初(2006年2月)的一則科技新聞...

背景回顧

去年二月在費城舉行的 Wharton Technology Conference 2006 中,三大搜尋引擎巨頭 - Google, MSN, Yahoo - 產品主管齊聚,各自陳述對未來搜尋引擎的看法,ZDnet UK 在會後發表了一篇新聞 Google and MSN disagree on future of search ,精簡扼要的將三個公司主管的發言排列比較,讓讀者領略這三家公司各自不同的戰略。簡單地說,MSN 認為使用者應該學習(換句話說就是被教育)改變搜尋的習慣,因為 MSN 的未來的策略是精進並改變搜尋引擎的介面,讓使用者和搜尋引擎有更多、更有益的互動,讓搜索更精準、更有用。Yahoo 則押寶在社群這個方向,認為搜尋的精度和準度,要靠 social search 的策略方向來達成。Google 則一派邪惡科技帝國模樣,認為重點是底層(underlying)的技術,以研發能力取勝。

部落客 Geeking with Greg 引用 ZDNet 的報導,將這三家公司的異同,作了畫龍點睛的陳述 Different Version of futire of search:

MSN (and, until recently, A9) wants to give you more powerful tools. Yahoo wants the community of users to help improve search. Google wants computers to do all the work to get you what you need.

Peter Norvig 在訪談中,明確的表示, Google Research 的「核心研究課題」就是搜尋技術、廣告,還有使用者如何和搜尋引擎互動,以此三者為軸心,開展的各項研究,目的還是在於 help us serve them better。身為未來所寄的研發部門主管,從他口裡透露 Google 對於搜尋引擎技術的立場和進行中專案的描述,是很令人期待的,雖然訪問的篇幅不算很長,但是畢竟我不是專業譯者,逐字翻譯對我來說實在太麻煩了,所以我試著將內容消化,並加上一點點自己的經驗和想法,所以這份摘要不能算是真正的翻譯(逐字翻譯在法律上也站不住腳,唔,又是一個偷懶的好藉口):

機器翻譯和語音辨識

根據 Peter 的說法,目前獲得最多財力和人力支援的專案是機器翻譯(machine translation)和語音技術(speech)的案子,Peter 說他並不認為這兩個技術對於視訊(video)資料的搜尋有很大幫助,因為視訊的搜尋還不是主流;但是他認為語音辨識是對於提供電話介面(用電話作搜尋介面)是很重要的技術,而且改善語音技術能夠對對聲音文件作更好的索引(indexing audio files)video search 的貢獻。

根據他的說法,在瞭解現有市場上可用技術後,他們決定自己開發相關技術,而且他認為以 Google 的資源和能力,一定可以對這個領域做出貢獻(他還用 advance 這個字眼)。 有一點特別值得一提,他說 data trains algorithms over time,這點讓我特別有感觸。作研究的人都知道,擁有 data 的可貴,能掌握資料源,就有發表論文的機會,不管是作什麼題目都好;沒有 data ,完全沒戲唱。

Peeter Norvig 本人在另外一次演講時,講了另外一段話,他認為 recommender 演算法根本沒有什麼好比較的,不管演算法再怎麼不入流,只要擁有更多資料,自然可以把演算法教育 (trains)成人,打敗原本的 winner 。

Rather than argue about whether this algorithm is better than that algorithm, all you have to do is get ten times more training data. And now all of a sudden, the worst algorithm ... is performing better than the best algorithm on less training data.

Worry about the data first before you worry about the algorithm.

總之,如果要作研究,擁有大量的資料,和鉅額的資本支出一樣重要。換個角度說,像谷歌這樣家大業大的富家翁,最令人羨慕的不是龐大的現金預算,而是可以使用的軟、硬體資源和最寶貴的資料(弔詭的是,這些東西是靠金錢堆積出來的)。

問題是什麼

Peter 認為,當我們在使用搜尋服務時,會面對很嚴重的 不均衡狀態(imbalance),我們可能輸入僅有兩、三個字構成的搜尋字組,但是有限的螢幕顯示空間,讓我們無法一次提供足夠多的有效資訊。另外一個問題,也值得關注,使用者需要更多的參與,才能獲得較佳的搜尋結果。只是輸入 map 或 coffee 這樣的字眼,實在很難判斷使用者要什麼,所以使用者的積極參與,對於問題的改善是正面的(這裡有點 MSN 產品經理說法的味道)。

當 TR(Technology Review) 詢問,此刻目前搜尋領域比較突出的問題是什麼? Peter 的回應是這樣的:

一般而言,主要有兩個方面的問題。 第一個是如何更佳地瞭解用戶需求,另一個則是瞭解文件內容的「意義」,不管是網頁還是視訊資料。用戶輸入資料之後,我們把輸入的詞組當作一個個的獨立字眼(individual words)來處理,但是用戶究竟是什麼意思,並不是那麼容易理解。

自然語言搜尋技術

既然如此,TR 當然想瞭解 Google 在自然語言(natual language)處理技術上的進展。如果用戶可以輸入一個完整的句子,不是獨立的若干關鍵字,似乎聽起來很迷人,很 fantatic ,很 promising ,不是嗎?

Peter 認為自然語言技術所指涉的範圍很廣,首先,Google 在瞭解同義字方面,下了許多功夫。比如說, San Franscisco 這兩個字必須是成對出現,不能單獨成立的;但是 Las Vegas 和 Vegas 雖然是兩個不同的字組,但卻是同一件事;再舉個相反的例子, New York 和 York 則是完全不同的兩回事。Google 在這方面下了不少功夫,也有相當的進展。

另外一個自然語言領域的技術,是將較長的查詢自串(longer query)分解成較小的元件(omponents),最理想的境界當然是用戶輸入一個完整的句子,處理後得到的答案也是個完整的句子。但是 Google 在這方面,沒有太多著力,我們可以處理一部份問題,像日本的人口(population of Japan)這樣的問題,我們可以給出不壞的結果。但是大部分的情況,這未必是使用者希望的,他們不一定希望在搜尋時,每個問題都要寫一個完整的句子。

至於 TR 詢問關於人工智慧(AI)技術運用的問題,Peter 則回應,人工智慧技術大部分用於解決沒有明確解答的問題,雖然人工智慧技術不能解決所有問題,但是谷歌的確用了許多人工智慧技術來開發產品。

雖然 Peter 在自然語言搜尋上,說得很保守,但並不代表別的研究機構也如此保守,目前運作中的 Answer.com 允許用戶以簡單的英文句子提出搜尋,有興趣的人可以自己是玩玩看。如果問 Who is the President of Taiwan 詢問 Answer.com ,跑出來的答案是總統府的網站。

Technology Review 近日介紹了一家公司- 的 Powerset, Inc., 以授權方式取得著名的 Palo Alto Research Center (PARC) 過去30年所累積技術的自然語言技術,將推出的自然語言搜尋引擎。這家公司的老總說,雖然自然語言技術近日沒有重大的突破(breakthrough), 但 Powerset 將整合許多PARC 的技術,推出的產品,一定會讓大家耳目一新云云。

除了上面提到的商業運轉的例子,我在一個介紹 Data Mining 技術的部落格,看到 Quanta (Beta) 的介紹,這應該是個學術界的專案,進入網站之後,畫面樸素得很誇張,沒有說明,沒有提示,版權宣示的地方,只留了一個北京清華大學的電子郵件地址,從畫面很難看出這是什麼回事。只有畫面下方兩個超連結─搜尋範例和搜尋歷史,透露這個網站可能是搜索引擎的線索。搜尋範例有許多比簡單句還複雜一點的英文句子,比如說「Who was the first person to run the mile in less than four minutes?」,「Who won the Oscar for best actor in 1970??」,看起來似乎很厲害的樣子。

我仍然用 Who is the President of Taiwan 考驗 Quanta,這個「黑箱」給出的答案是陳水扁三個字的漢語拼音,然後列出了一堆可能解答這個問題的網址。Quanta 的速度非常慢,我猜是在測試某些演算法吧,輸出結果會列出某個方法的 scoring ,然後是兩欄式的比較列表,畫面配置不甚美觀。雖然 Quanta 不是一個商業化的作品,不過從輸出結果的品質(準確度)來看,或許是個值得期待的東西吧。


Sunday, July 22, 2007

Beyond Google -新一代搜尋服務

一向以為自己找資料的功夫不錯,直到看了異塵行者推介的 Top 100 Alternative Search Engines, February 2007,和他的三篇大作走出Google & Yahoo,搜尋引擎大不同—替代性搜尋引擎推薦、搜尋引擎大不同之二:我愛用的Search Engine、Yahoo推出Alpha搜尋,對決Google的Searchmash之後,才知道自己錯的厲害,以管窺天,羞煞人也。

異塵行者的文章,解說清楚圖文並茂,並且加上他自己的使用心得,實在是不可多得。但是這些資料散在好幾篇文章裡,找起來有些吃力,所以我依照自己的使用經驗和偏好(每個人的背景和使用目的都是不同的),將一般 Web 內容的搜尋引擎,重新彙整放在同一篇裡。至於部落格文章和所謂的 Web 2.0 應用的搜尋,等我對這個領域更熟悉的時候再說吧。 我個人將這種一般型的新一代搜尋引擎服務,分為三類,這只是我個人自己為了工作方便作的分類,不是學術上或者真正業內人士所用的分類 (taxonomy / classification),真正的方家見了,請勿大笑:

1. Improved Google and Yahoo


SearchMash - http://www.searchmash.com
Alpha(Yahoo) - http://au.alpha.yahoo.com
Ask - http://www.ask.com

第一類是原本的搜尋服務提供者,優化本身原本搜尋引擎的輸出,結合本身所提供的其他服務,將搜尋服務變得更豐富、更便利,也試圖讓使用者繼續留在該業者的其他服務裡,製造更多的賺錢機會。

這類型的搜尋服務,不論是 Google 的 SearchMash 還是 Yahoo! 的 Yahoo! Alpha(beta) ,甚至是 Ask.com 新的 Ask3d 介面 ,螢幕的配置和組成方式,都非常相似。 首先,不再堅持原先被認為是 Google 成功要素之一的極簡風格,多了一些色彩和裝飾;其次,螢幕的右邊,無一例外的加上「建議搜尋」和影像、視訊、部落格的搜尋指引,和自家提供各式服務的超連結。這種作法,在雅虎中國的雅虎易搜網,也可以看到。

異塵行者寫作的 Yahoo推出Alpha搜尋,對決Google的Searchmash 裡,針對 SearchMash 和 Alpha(beta) 這兩個服務,有很詳細的分析比較,他對這兩個服務的評價如下,有興趣的讀者,可以自己試試看。

透過上面的比較,Google的Searchmash和Yahoo Alpha除了在一些特色搜索的內容上有所區隔外,Yahoo Alpha目前以可以自訂的搜索側邊攔,應該是有成為個人化式搜索首頁的野心。而Google的Searchmash還是繼續維持著Google易上手、好操作的特色,尤其可以在同一個頁面展示更豐富瀏覽方式的特色更是深得我心。有興趣的朋友可以試用看看,或許它們可以取代原本大家習慣的傳統Google與Yahoo搜索頁面。

除了 SearchMash 和 Alpha 之外, 新改版的 Ask.com 也不錯,個人覺得比起 Google 和 Yahoo 猶有過之,諸君不妨自行試試。尤其是畫面最左邊的 Narrow your search ,有 aggregated and clustered 的味道。不過 Ask.com 在搜尋中文資料時,實在不怎麼靈光,可能是 Ask.com 目前不打算進攻中文市場的緣故,實在可惜了。

可能是因為還在測試階段的緣故, SearchMash 和 Alpha 的頁面沒有廣告,看來很是清爽,不知道未來正式上線,會變成怎樣?

2. Dashboard for searching


goshme - http://www.goshme.com
CrossEngine - http://www.crossengine.com
Sidekiq - http://www.sidekiq.com

我把這類的搜尋服務,稱作 Dashboard 型的搜尋服務,這種搜尋引擎服務,就像一個大型的搜尋引擎控制面版,輸入關鍵字,選擇要使用的搜尋引擎,按鈕發射,然後看搜尋的結果。

在這一類搜尋服務中,Charles Knight(Top 100 Alternative Search Engines 的作者)和異塵行者(搜尋引擎大不同之二:我愛用的Search Engine),對於 goshme 都推崇備至,因為他的特別和全面。嚴格來講,這不是一個所謂的正統 meta search engine,因為它在接收到關鍵字之後,不是立刻將關鍵字丟到各大搜尋引擎,然後彙總(aggregate)各個搜尋引擎的輸出,作資料分群和輸出美化的動作。 goshme 先分析這個關鍵字(詞)適用的搜尋引擎,列出各式搜尋引擎的選擇,包括一般目的(general purpose)和特殊領域的(Specialized search engines)搜尋引擎和資料庫服務,使用者選擇要使用的搜尋引擎後,goshme 方才執行搜尋和呈現的動作。這是 goshme 和另外兩個搜尋服務 Sidekiq 、CrossEngine 最大的差別。

這個點子固然有趣,goshme 真正出色的地方在於它的全面,goshme 搜尋的對象除了幾個有名的大搜尋入口外,還包括各領域的垂直搜尋引擎(specialized search engine)或資料庫。goshme 在畫面左方的過濾器(Filter,見上圖)列出更細的選擇,它的選項包括 Recreation、Information、Tourism、Business、Arts、Movie、Arts、Games、Social Science、News、Sports、Shopping、Law、Kids、Adults、Home & Garden 等等,每個選項底下還有更細的子選項,例如 Tourism 之下,再細分為 Transportation、Guides 和 Information。 收羅之廣,令人嘆為觀止。還有,使用 goshme 需要先註冊,手續很間單,只要輸入電子郵件位址,設定一個使用密碼即可。

至於 Sidekiq 和 CrossEngine ,兩者在本質上非常相似,只是所包含的搜尋引擎數量,有很大的差異。Sidekiq 的搜尋引擎數量和廣度,屬於包山包海那一型,僅僅 The Web 一項,就包含 14 個通用型的 Web Content 搜尋引擎。選擇了要使用的搜尋引擎後,Sidekiq 呼叫該搜尋引擎,將輸出嵌在右邊的 Frame 裡面,Sidekiq 並不作整理和解讀。


CrossEngine 是這三者中最樸素的,可選擇的搜尋引擎按鈕只有十個,可以將控制面版放在上方或是螢幕左方,雖然沒有前兩者這麼豐富,對於一般的使用者,我想應該是足夠了。畢竟,不是每個人都有作 researcher 的必要(苦笑)。

3. Aggregated and Clustered

PolyMeta - http://www.polymeta.com
Clusty - http://www.clusty.com

第三類則是所謂的分類式引擎,基本出發點,就是所謂的三個臭皮匠,勝過一個諸葛亮(More heads better than one)。這種搜尋服務,將使用者輸入的關鍵字,送至其他各大搜尋業者的引擎,將不同引擎的輸出彙總在一起,然後應用 clustering 和 textual analysis 的技術,將結果重新整理,以分類的方式,呈現給使用者。使用者可以從分類的選單裡,找出自己真正感興趣的部分,繼續追蹤下去。

比如說,當我們使用 Google 搜尋 Coffee 這個關鍵字時,會產生大約 203,000,000 筆資料輸出,要在這樣大量的資料裡找到我們需要的資料,難度仍然不是普通的高。如果搜尋結果採用 aggregated and clustered 技術加工後,可以將輸出資料分群為咖啡豆、產地、咖啡因、健康、雜誌、烘焙、歷史、咖啡與茶、飲料等等分類,我們可以從這些分群後的結果,找到我們需要的入手處,這樣要找到合適的資料就容易多了。而且分群後的輸出,經過適當排版,可讀性提高,當然更容易找到資料。


這類的搜索引擎有不少,例如 jux2, mamma, dogpile, clusty,polymeta 等,依個人的使用經驗,PolyMeta 和 Clusty 的輸出結果,真正應用了 clustering 的技術,將搜尋結果分類,而且螢幕的配置易於閱讀,不會讓人迷失在大串資料裡,找不到重點和入手處。PolyMeta 使用的搜尋引擎主要是 Ask 、Exalead、Google、MSN 和Yahoo, Clusty 主要使用的搜尋引擎則包括 Gigablast、MSN、Open Directory、Wikipedia 等,所以輸出結果會有差異,兩者可以交替使用,互相參照。

用得順手,就是好工具

不論是已經獨霸搜尋市場的 Google ,或是力圖挽回使用者難測的心的 Yahoo,抑或其他 Meta Search Engines 業者,都在努力改善自家的搜尋引擎的搜尋能力和輸出品質,提供更好的分類能力,整合多媒體的搜尋,競爭的結果,讓使用者擁有更便利、更人性的工具完成手上的工作,這是絕對值得稱許和期待的。不過,千萬不要忘了,每個人的工作習慣與工作目的都不同,所以沒有一個標準萬用的最好工具,只要用的順手、用的熟練,就是好工具。

實際動手試試看,用你工作上常用的字詞,作個小小測試,就知道那一個服務最適合你了。

補充:Firefox Search Plugins

使用 Firefox(或是 Netscape)的讀者,可以在網路上找到現成的上面所介紹的搜尋引擎的 search plugins ,不知道從何找起的讀者,可以試試看下面幾個網站:

安裝後的效果如下,看起來挺不錯的(grin):

如果我的心是一朵蓮花

~ 林徽因 · 馬雁散文集 · 蓮燈 ~ 馬雁 在她的散文《高貴一種,有詩為證》裡,提到「十多年前,還不知道林女士的八卦及成就前,在期刊上讀到別人引用的《蓮燈》」 覺得非常喜歡,比之卞之琳、徐志摩,別說是毫不遜色,簡直是勝出一籌。前面的韻腳和平仄的處理顯然高於戴...