Key points are not available for this paper at this time.
オープンソース運動によって膨大な量のソースコードがオンラインで無償で利用可能となり、実証研究や潜在的な再利用のための極めて大規模なデータセットが提供されています。この可能性を最大限に活用する上での主な難点は、データが現在競合する複数のソースコードリポジトリに分散しており、そのいずれも実証的分析やプロジェクト横断的な比較のために構造化されていないことです。その結果、ソフトウェアの研究者や開発者は独自のデータセットを構築せざるを得ず、労力の重複や限定的な結果につながっています。この課題に対処するため、我々は静的解析および相互リンクされたオープンソースJavaプロジェクトの集約リポジトリであるSourcererDBを構築しました。SourcererDBには、Sourceforge、Apache、Java.netから取得した2,852件のJavaプロジェクトのローカルスナップショットが含まれています。これらのプロジェクトは静的解析されて豊富な構造情報が抽出され、リレーショナルデータベースに格納されます。16,058個の外部jar内のエンティティへの参照が解決・グループ化され、プロジェクト横断的な使用情報に容易にアクセスできるようになります。本論文では、(a) これらプロジェクト横断的な参照を解決およびグループ化するためのメカニズム、(b) SourcererDBリポジトリの構造およびメタモデル、(d) エンドユーザー向けデータセットアクセス機構について説明します。SourcererDB構築における我々の目標は、抽出されたデータの共有を促進し、実験の再利用性と再現性を奨励するための豊富なソースコードデータセットを提供することです。
Ossher et al. (Fri,) はこの問題を研究した。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: