Key points are not available for this paper at this time.
Die Analyseplattform bei Twitter hat in den letzten Jahren ein enormes Wachstum in Bezug auf Größe, Komplexität, Anzahl der Benutzer und Vielfalt der Anwendungsfälle erfahren. In diesem Papier diskutieren wir die Entwicklung unserer Infrastruktur und die Entwicklung von Fähigkeiten für das Data Mining auf "Big Data". Eine wichtige Lektion ist, dass erfolgreiches Big Data Mining in der Praxis viel mehr ist als das, was die meisten Akademiker als Data Mining betrachten würden: Das Leben "in den Schützengräben" ist mit viel Vorarbeit verbunden, die der Anwendung von Data Mining-Algorithmen vorausgeht und gefolgt wird von einem erheblichen Aufwand, um vorläufige Modelle in robuste Lösungen zu verwandeln. In diesem Zusammenhang diskutieren wir zwei Themen: Erstens spielen Schemata eine wichtige Rolle dabei, Datenwissenschaftlern zu helfen, petabyte-große Datenspeicher zu verstehen, aber sie sind unzureichend, um einen umfassenden "Überblick" über die verfügbaren Daten zu geben, um Erkenntnisse zu gewinnen. Zweitens beobachten wir, dass eine große Herausforderung beim Aufbau von Datenanalyseplattformen aus der Heterogenität der verschiedenen Komponenten resultiert, die in Produktionsabläufe integriert werden müssen - wir bezeichnen dies als "Plumbing". Dieses Papier hat zwei Ziele: Für Praktiker hoffen wir, unsere Erfahrungen zu teilen, um die Hindernisse auf dem Weg für diejenigen, die nach uns kommen, zu verringern. Für akademische Forscher hoffen wir, einen breiteren Kontext für Data Mining in Produktionsumgebungen bereitzustellen und Möglichkeiten für zukünftige Arbeiten aufzuzeigen.
Lin et al. (Di,) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: