顯示具有 paper reading 標籤的文章。 顯示所有文章
顯示具有 paper reading 標籤的文章。 顯示所有文章

2008年10月13日 星期一

10/07 Regular Meeting: A fuzzy symbolic Inference System for Postal Address Component Extraction and labeling

論文連結:請點此

論文摘要:

此篇論文主要是提出一個系統可以將地址的各項元素標示上不同的標籤,例如:地區名稱和街道號碼等資訊。對於有規律架構的地址格式和非標準架構的地址格式,後者在研究上顯得較不容易,因此本論文主要在解決unstructured address的問題。

首先,利用符號表示法來表示地址,建立知識庫作為標籤的依據,系統主要從輸入地址的各項元素和知識庫之間找出相似度,再利用提出的方法論來確定地址各項元素的標籤為何,所以fuzzy symbolic inference system即是對於一些較為模糊意義的地址元素加以判斷、擷取並標上標籤。

論文介紹:

a fuzzy symbolic system是這篇論文提出的系統,主要在解決unstrctured address的問題。一般我們所建的地址格式通常較為精確,可標示在Google Map上,但文中提到,類似India所使用的地址描述方式,沒有較為切確的位置,所以無法在Google Map上標示出來(有試過,但無法標出地點),因此主要想要解決的問題為此。

其中定義address和Knowledge base兩種基本格式,利用Assertion Object、Hoard Object和Synthetic Object來做表示。postal address使用Assertion Object和Hoard Object;Knowledge Base則是使用Assertion Object、Hoard Object和Synthetic Object。每個Assertion Object內都有其event,event包含了feature variable和其feature value。

而系統提出兩個方法,將我們所輸入的input component和knowledge base中的component label求算出相似度,稱為symbolic similarity measure。將求算出來的相似度依大小排序好後,再利用我們另外計算的alpha值(臨界值)去找出比alpha高的相似度,將這些比alpha高的相似度看作alpha-cut set,如果set中只有一個component label,那即為我們要找的label,並將confidence設為100,若set中的值有兩個或以上,則confidence則在50左右,可套用confidence的公式去計算出來。

這篇論文所使用的knowledge base,內容資料數量並未提到,不過根據他們測試500筆地址出來的labelling結果,高達94%,即便是只侷限在一個國家的範圍裡,其資料量應該是蠻大的。

其實閱讀完這篇論文,對目前研究領域幫助沒有很大,但仍值得做為參考。

投影片:
2008/10/07 Regular meeting
View SlideShare presentation or Upload your own.

2008年8月4日 星期一

08/05 Regular Meeting心得

這次的Regular meeting是由我來報告
論文題目是Postal address detection from web documents

看這篇論文花費我蠻多時間,也看了幾篇參考文獻
到後來真的有種越看越懂的感覺,論文中提出的方法的整個流程也較清楚
閱讀論文除了需要花一些時間之外,如何從論文中學習、思考,甚至懷疑這樣的作法是否多餘

老師提到論文後半部份,是辨識地址的動作,有點Machine Learngin的概念
這個部份我又不太了解,登凱學長說Machine Learning的主要精神就是要利用正反兩個例子讓它學習
他也提到HMM的作法,來建立不同的model,HMM之前也曾在其他論文上看到,可是並不是非常理解
學長所提到的方法,也不失為一種嘗試,雖然我覺得這篇論文提出的方法好像蠻可行的
但也要看我現在用的javascript能否寫得出來

後來提到忽略空白的部分,萍華也有跟我提到regular expression的方法
我雖然也有用,不過還是有取到空白的部分,真是感謝萍華幫助。

所以感覺有點知道該怎麼做,不過還是先動手執行再說
HMM,Machine Learning也都要去了解,空白的部分要最先解決

還有,今天新生也加入meeting了,感覺實驗室生氣蓬勃呢
希望大家能一起努力,把研究搞定:)

2008年6月18日 星期三

Paper。

conference:

ACM MM
ACM SIGIR
ACM SIGKDD
ACM SIGMOD
ACM CIKM
IEEE ICDM
IEEE ICME
IEEE ICDE
PAKDD
WWW

2007年10月29日 星期一

Address Extraction

Extraction of Location-Based Information from the Web

星期四meeting時,老師有給我看一些例子
有關postal address extraction
這篇Paper剛剛初步看過一次
--
1.Ontology Construction:
Using PartOf,InstanceOf,Similar,SyntacticNeighbor to build relationships.
2.Concept Identification:
Rule1~Rule5.
3.Gragh Matching:
a.the template graph.
b.abstract descriptor subgraph.
4.※Similarity measurement.
5.Structure Mapping:
Fact1&2,Step1&2 to create an address candidate.
--
※Experiments and Evaluation.
※Conclusion and Future work.