Awesome Information Retrieval
Information Retrievalを扱う資料や関連プロジェクトをまとめたAwesomeリストです。
目次
書籍
- Introduction to Information Retrieval - C.D. Manning、P. Raghavan、H. Schütze。Cambridge UP、2008年。(情報検索を始めるための最初の一冊)。
- Search Engines: Information Retrieval in Practice - Bruce Croft、Don Metzler、Trevor Strohman。2009年。(検索エンジンの仕組みを知りたい読者向けの優れた書籍。非常に詳しい)。
- Modern Information Retrieval - R. Baeza-Yates、B. Ribeiro-Neto。Addison-Wesley、1999年。
- Information Retrieval in Practice - B. Croft、D. Metzler、T. Strohman。Pearson Education、2009年。
- Mining the Web: Analysis of Hypertext and Semi Structured Data - S. Chakrabarti。Morgan Kaufmann、2002年。
- Language Modeling for Information Retrieval - W.B. Croft、J. Lafferty。Springer、2003年。(情報検索における言語モデルの側面を扱い、この領域の確率的観点を広く詳述する)。
- Information Retrieval: A Survey - Ed Greengrass、2000年。(ディープラーニング以前の従来型情報検索を包括的に調査)。
- Introduction to Modern Information Retrieval - G.G. Chowdhury。Neal-Schuman、2003年。(図書館・情報学の学生を対象とする)。
- Text Information Retrieval Systems - C.T. Meadow、B.R. Boyce、D.H. Kraft、C.L. Barry。Academic Press、2007年(図書館・情報科学の視点)。
コース
- INF384H / CS395T / INF350E: Concepts of Information Retrieval (and Web Search) - Matthew Lease(University of Texas at Austin)。
- CS 276 / LING 286: Information Retrieval and Web Search - Chris Manning、Pandu Nayak(Stanford University)。
- CS 371R: Information Retrieval and Web Search - Raymond J. Mooney(University of Texas at Austin)。
- CS 172: Introduction to Information Retrieval - Vagelis Hristidis(University of California - Riverside)。
- SIMS 240: Principles of Information Retrieval - Ray R. Larson(UC Berkeley)。
- 11-442 / 11-642: Search Engines - Jamie Callan(CMU)。
- 600.466: Information Retrieval and Web Agents - David Yarowsky(John Hopkins University)。
- CS 435: Information Retrieval, Discovery, and Delivery - Andrea LaPaugh(Princeton University)。
- Information Retrieval and Data Mining - Dr. Jilles Vreeken、Prof. Dr. Gerhard Weikum(MPI)。
- Coursera - Text Retrieval and Search Engines - Prof. ChengXiang Zhai(University of Illinois at Urbana-Champaign)。
ソフトウェア
- Apache Lucene - 情報検索アルゴリズムのテストに使えるオープンソース検索エンジン。Twitterはリアルタイム検索にこのコアを使用している。
- The Lemur Project - 情報検索・テキストマイニングソフトウェアの研究開発を支える検索エンジン、ブラウザーツールバー、テキスト分析ツール、データリソースを開発するプロジェクト。
- Indri Search Engine - Apache Luceneと競合するもう一つのオープンソース検索エンジン。
- Lemur Toolkit - 言語モデリング、フィルタリング、分類研究向けのオープンソースツールキット。
データセット
標準IRコレクション
- DBPedia - リンクトデータのウェブ。
- Cranfield Collections - IR分野で最初期のコレクションの一つ。統計的有意性の分析にはデータセットが小さすぎるが、パイロット実行には適している。
- TREC Collections - TRECは大半のIR・ウェブ検索アルゴリズムで使われるベンチマークデータセット。特定タスクのテスト用データセットからなる複数のトラックがある。トラックと推奨ユースケースは次のとおり:
- Blog - ブログ圏における情報探索行動を調査する。
- Chemical IR - 化学IR向けの大規模テストベッド構築における課題に取り組む。
- Clinical Decision Support - 医療症例を患者ケアに関連する情報へ結び付ける技術を調査する。
- Confusion - Known Item Searching問題を研究する。
- Contextual Suggestion - 複雑な情報ニーズ(コンテキストとユーザーの興味に基づく)のための検索技術を調査する。
- Crowdsourcing - 検索の実行・評価におけるクラウドソーシング手法を探る。
- Enterprise - 組織データ上の検索を研究する。
- Entity - ウェブデータ上でエンティティ関連の検索(エンティティとその属性の発見)を行う。
- Filtering - 安定した情報ニーズに対し、新規流入文書の検索対象化を二値的に決定する。
- Federated Web Search - さまざまな検索サービスからの結果を統合する性能を研究する。
- Genomics - ゲノミクスデータおよび対応する文書の検索効率を研究する。
- HARD - 検索者のコンテキストを活用して文書から高精度検索を得る。
- Interactive Track - テキスト検索システムにおけるユーザー対話を研究する。
- Knowledge base acceleration - 人間のKnowledge Baseの効率を改善するアルゴリズムを研究する。
- Legal Track - 法務ユースケースで高い再現率を持つ検索システムを研究する。
- Medical Track - 患者記録に対する非構造化検索の性能を探る。
- Microblog Track - マイクロブログサイトにおけるリアルタイム情報ニーズの満足度を調べる。
- Million Query Track - 大量のクエリ集合に対するアドホック検索を探る。
- Novelty Track - 新規(非冗長)情報を見つけるシステムの能力を研究する。
- Question Answering Track - 文書検索を超え、事実、リスト、定義型の質問への回答を検索するシステムをテストする。
- Relevance Feedback Track - 関連性フィードバック過程を深く評価する。
- Robust Track - 個別トピックの有効性を研究する。
- Session Track - 情報ニーズが変動する複数クエリセッションの測定手法を開発する。
- SPAM Track - スパムフィルタリング手法をベンチマークする。
- Tasks Track - ユーザーがクエリに対して達成しようとしている可能性のあるタスクをシステムが推定できるかテストする。
- Temporal Summarization Track - 時間の経過とともにイベントに関連する情報を効率的に監視できるシステムを開発する。
- Terabyte Track - 大規模コレクションに対するIRシステムのスケーラビリティをテストする。
- Web Track - 一般的なウェブ検索でよく見られる情報探索行動を探る。
- GOV2 Test Collection - Charlie ClarkeとIan SoboroffがNISTのハードウェアとネットワークを用いて政府ウェブサイトをクロールして収集し、Nick Craswelが整形した、最大級のウェブ文書コレクションの一つ。
- NTCIR Test Collection - アドホックコレクション、中国語IRコレクション、モバイルクリックストリームコレクション、医療コレクションまで、幅広いデータセットのコレクション。主に東アジア言語とクロスリンガル情報検索に焦点を置く。
- CLIR Test Collections - CJKE(中国語・日本語・韓国語・英語)間のクロスリンガルIRに使えるデータセット。次のタスクに適する:
- Multilingual CLIR
- Bilingual CLIR
- Single Language CLIR
- Cross Language Q&A (CLQA) dataset collection - 次のバイリンガルおよびモノリンガルをサポートする:
- Bi-lingua
- 日本語から英語。
- 中国語から英語。
- 英語から日本語。
- 英語から中国語。
- Mono-lingua
- 中国語から中国語。
- 日本語から日本語。
- 英語から英語。
- Bi-lingua
- Advanced Cross Linugal Information Retrieval and Question Answering (ACLIA) - このデータセットはクロスリンガル質問応答タスクに使用されるが、CLQAデータセットよりもタスクの複雑性が高い。
- CLIR Test Collections - CJKE(中国語・日本語・韓国語・英語)間のクロスリンガルIRに使えるデータセット。次のタスクに適する:
- Conference and Labs of the Evaluation Forum (CLEF) dataset - 多言語文書コレクションを含む。テストスイートは次のとおり:
- AdHoc - News Test suite.
- Domain Specific Test Suite - On collections of scientific articles.
- Question Answering Test Suite.
- Reuters Corpora - コーパスは現在NISTを通じて利用可能。以下を含む:
- RCV1 (Reuter’s Corpus Volume 1) - 英語のニュース記事のみで構成される。
- RCV2 (Reuter’s Corpus Volume 2) - 13言語(オランダ語、フランス語、ドイツ語、中国語、日本語、ロシア語、ポルトガル語、スペイン語、ラテンアメリカのスペイン語、イタリア語、デンマーク語、ノルウェー語、スウェーデン語)の記事で構成される。記事は並列ではないことに注意。
- TRC (Thomson Reuters Text Research Collection) - 2008-01-01 00:00:03から2009-02-28 23:54:14までの期間を対象とする1,800,370件のニュース記事からなる、比較的新しいコーパス。
- 20 Newsgroup dataset - 20のニュースグループトピックから取得した20,000件のニュースグループメッセージで構成されるデータセット。
- English Gigaword Fifth Edition - 見出し、日付行、記事を含む英語ニュースワイヤーテキストデータの包括的アーカイブ。
- Document Understanding Conference (DUC) datasets - 過去のニュースワイヤー/論文データセット(DUC 2001 - DUC 2007)はリクエストにより利用可能。
外部キュレーションリンク
講演
技術講演
- Extreme Classification: A New Paradigm for Ranking & Recommendation - Manik Verma(Microsoft Research)
- The next web - Tim Berners-Lee(TED Talk)[Tim Berners-LeeはWorld Wide Webを発明し、Webの標準と開発を監督するWorld Wide Web Consortium(W3C)を率いている]。
- Is Pivot a turning point for web exploration? - Gary Flake、MicrosoftのTechnical Fellow(TED Talks)。
- Challenges in Building Large-Scale Information Retrieval Systems - Jeff Dean(WSDM Conference、2009年)。
- Knowledge-based Information Retrieval with Wikipedia - David Wilne(The University of Waikato、2008年)。
- Music Information Retrieval Using Locality Sensitive Hashing - Steve Tjoa(RackSpace Developers)[この講演は、IRがテキストと画像だけではないことを示す]。
- The Functional Web — The Future of Apps and the Web - Liron Shapira(Box Tech Talk)。
- Information Experience - Solution to Information Overload on Web - Doug Imbruce(Techcrunch Disrupt)[Doug Imbruceは、2013年にYahoo!に買収されたニューヨークのテクノロジースタートアップQwiki, Inc.の創業者]。
- Internet Privacy - Dr. Alma Whitten(Google Brussels Tech Talk)。
哲学的講演
- The moral bias behind your search results - Andreas Ekström(スウェーデンの著者・ジャーナリスト、TED Talk)。
- Beware online “filter bubbles” - Eli Pariser(The Filter Bubbleの著者、TED Talk)。
- Think your email’s private? Think again - Andy Yen(CERN、TED Talk)[この講演は検索エンジンが侵害するプライバシーと、その保護方法を扱う]。
- Do we have the right to be forgotten? - Michael Douglas [TEDx SouthBank]。
- The case for anonymity online - Christopher “moot” Poole”(TED Talks)[Christopher “moot” Pooleは、匿名の住人がウェブで最も不可解かつ影響力の大きいサブカルチャーを生み出した匿名画像掲示板4chanの創設者]。
会議
- Web Search and Data Mining Conference - WSDM.
- Special Interests Group on Information Retrieval - SIGIR.
- Text REtrieval Conference - TREC.
- European Conference on Information Retrieval - ECIR.
- World Wide Web Conference - WWW.
- Conference on Information and Knowledge Management - CIKM.
- Forum for Information Retrieval Evaluation - FIRE.
- Conference and Labs of the Evaluation Forum - CLEF.
- NII Testsbeds and Community for Information access Research - NTCIR.
ブログ
- Information Retrieval and the Web - Google Research。
- IR Thoughts - Dr. Edel Garcia。
注目の読み物
- Deep Neural Network Learns to Judge Books by Their Covers - 情報抽出。
- Can Deep Learning help solve Deep Learning - 読唇からの情報検索。
- To reduce biases in machine learning start with openly discussing the problem - 関連性におけるバイアス。
- Whoa, Google’s AI Is Really Good at Pictionary - スケッチベース検索。
- Neural Network Learns to Identify Criminals by Their Faces - 情報抽出。
ライセンス
法律で可能な限り、Harshal Priyadarshiおよびすべてのコントリビューターは、この作品に関するすべての著作権および関連・近接権を放棄しています。