このページの内容

Awesome Information Retrieval

Information Retrievalを扱う資料や関連プロジェクトをまとめたAwesomeリストです。

目次

書籍

コース

ソフトウェア

  • Apache Lucene - 情報検索アルゴリズムのテストに使えるオープンソース検索エンジン。Twitterはリアルタイム検索にこのコアを使用している。
  • The Lemur Project - 情報検索・テキストマイニングソフトウェアの研究開発を支える検索エンジン、ブラウザーツールバー、テキスト分析ツール、データリソースを開発するプロジェクト。
    • Indri Search Engine - Apache Luceneと競合するもう一つのオープンソース検索エンジン。
    • Lemur Toolkit - 言語モデリング、フィルタリング、分類研究向けのオープンソースツールキット。

データセット

標準IRコレクション

  • DBPedia - リンクトデータのウェブ。
  • Cranfield Collections - IR分野で最初期のコレクションの一つ。統計的有意性の分析にはデータセットが小さすぎるが、パイロット実行には適している。
  • TREC Collections - TRECは大半のIR・ウェブ検索アルゴリズムで使われるベンチマークデータセット。特定タスクのテスト用データセットからなる複数のトラックがある。トラックと推奨ユースケースは次のとおり:
    • Blog - ブログ圏における情報探索行動を調査する。
    • Chemical IR - 化学IR向けの大規模テストベッド構築における課題に取り組む。
    • Clinical Decision Support - 医療症例を患者ケアに関連する情報へ結び付ける技術を調査する。
    • Confusion - Known Item Searching問題を研究する。
    • Contextual Suggestion - 複雑な情報ニーズ(コンテキストとユーザーの興味に基づく)のための検索技術を調査する。
    • Crowdsourcing - 検索の実行・評価におけるクラウドソーシング手法を探る。
    • Enterprise - 組織データ上の検索を研究する。
    • Entity - ウェブデータ上でエンティティ関連の検索(エンティティとその属性の発見)を行う。
    • Filtering - 安定した情報ニーズに対し、新規流入文書の検索対象化を二値的に決定する。
    • Federated Web Search - さまざまな検索サービスからの結果を統合する性能を研究する。
    • Genomics - ゲノミクスデータおよび対応する文書の検索効率を研究する。
    • HARD - 検索者のコンテキストを活用して文書から高精度検索を得る。
    • Interactive Track - テキスト検索システムにおけるユーザー対話を研究する。
    • Knowledge base acceleration - 人間のKnowledge Baseの効率を改善するアルゴリズムを研究する。
    • Legal Track - 法務ユースケースで高い再現率を持つ検索システムを研究する。
    • Medical Track - 患者記録に対する非構造化検索の性能を探る。
    • Microblog Track - マイクロブログサイトにおけるリアルタイム情報ニーズの満足度を調べる。
    • Million Query Track - 大量のクエリ集合に対するアドホック検索を探る。
    • Novelty Track - 新規(非冗長)情報を見つけるシステムの能力を研究する。
    • Question Answering Track - 文書検索を超え、事実、リスト、定義型の質問への回答を検索するシステムをテストする。
    • Relevance Feedback Track - 関連性フィードバック過程を深く評価する。
    • Robust Track - 個別トピックの有効性を研究する。
    • Session Track - 情報ニーズが変動する複数クエリセッションの測定手法を開発する。
    • SPAM Track - スパムフィルタリング手法をベンチマークする。
    • Tasks Track - ユーザーがクエリに対して達成しようとしている可能性のあるタスクをシステムが推定できるかテストする。
    • Temporal Summarization Track - 時間の経過とともにイベントに関連する情報を効率的に監視できるシステムを開発する。
    • Terabyte Track - 大規模コレクションに対するIRシステムのスケーラビリティをテストする。
    • Web Track - 一般的なウェブ検索でよく見られる情報探索行動を探る。
  • GOV2 Test Collection - Charlie ClarkeとIan SoboroffがNISTのハードウェアとネットワークを用いて政府ウェブサイトをクロールして収集し、Nick Craswelが整形した、最大級のウェブ文書コレクションの一つ。
  • NTCIR Test Collection - アドホックコレクション、中国語IRコレクション、モバイルクリックストリームコレクション、医療コレクションまで、幅広いデータセットのコレクション。主に東アジア言語とクロスリンガル情報検索に焦点を置く。
    • CLIR Test Collections - CJKE(中国語・日本語・韓国語・英語)間のクロスリンガルIRに使えるデータセット。次のタスクに適する:
      • Multilingual CLIR
      • Bilingual CLIR
      • Single Language CLIR
    • Cross Language Q&A (CLQA) dataset collection - 次のバイリンガルおよびモノリンガルをサポートする:
      • Bi-lingua
        • 日本語から英語。
        • 中国語から英語。
        • 英語から日本語。
        • 英語から中国語。
      • Mono-lingua
        • 中国語から中国語。
        • 日本語から日本語。
        • 英語から英語。
    • Advanced Cross Linugal Information Retrieval and Question Answering (ACLIA) - このデータセットはクロスリンガル質問応答タスクに使用されるが、CLQAデータセットよりもタスクの複雑性が高い。
  • Conference and Labs of the Evaluation Forum (CLEF) dataset - 多言語文書コレクションを含む。テストスイートは次のとおり:
    • AdHoc - News Test suite.
    • Domain Specific Test Suite - On collections of scientific articles.
    • Question Answering Test Suite.
  • Reuters Corpora - コーパスは現在NISTを通じて利用可能。以下を含む:
    • RCV1 (Reuter’s Corpus Volume 1) - 英語のニュース記事のみで構成される。
    • RCV2 (Reuter’s Corpus Volume 2) - 13言語(オランダ語、フランス語、ドイツ語、中国語、日本語、ロシア語、ポルトガル語、スペイン語、ラテンアメリカのスペイン語、イタリア語、デンマーク語、ノルウェー語、スウェーデン語)の記事で構成される。記事は並列ではないことに注意。
    • TRC (Thomson Reuters Text Research Collection) - 2008-01-01 00:00:03から2009-02-28 23:54:14までの期間を対象とする1,800,370件のニュース記事からなる、比較的新しいコーパス。
  • 20 Newsgroup dataset - 20のニュースグループトピックから取得した20,000件のニュースグループメッセージで構成されるデータセット。
  • English Gigaword Fifth Edition - 見出し、日付行、記事を含む英語ニュースワイヤーテキストデータの包括的アーカイブ。
  • Document Understanding Conference (DUC) datasets - 過去のニュースワイヤー/論文データセット(DUC 2001 - DUC 2007)はリクエストにより利用可能。

外部キュレーションリンク

講演

技術講演

哲学的講演

会議

  • Web Search and Data Mining Conference - WSDM.
  • Special Interests Group on Information Retrieval - SIGIR.
  • Text REtrieval Conference - TREC.
  • European Conference on Information Retrieval - ECIR.
  • World Wide Web Conference - WWW.
  • Conference on Information and Knowledge Management - CIKM.
  • Forum for Information Retrieval Evaluation - FIRE.
  • Conference and Labs of the Evaluation Forum - CLEF.
  • NII Testsbeds and Community for Information access Research - NTCIR.

ブログ

注目の読み物

ライセンス

CC0

法律で可能な限り、Harshal Priyadarshiおよびすべてのコントリビューターは、この作品に関するすべての著作権および関連・近接権を放棄しています。