Key points are not available for this paper at this time.
DNA結合タンパク質(DNABP)は、転写調節、組換え、複製、修復、及びDNA修飾などのさまざまな細胞プロセスにおいて重要です。これまで、タンパク質構造からDNA結合タンパク質を特定するためにさまざまなバイオインフォマティクスおよび機械学習技術が適用されてきました。タンパク質配列からDNA結合タンパク質を特定するための方法はわずかです。本研究では、タンパク質配列からDNA結合タンパク質を同定するためのランダムフォレスト法であるDNA-Protを報告します。146のDNA結合タンパク質と250の非DNA結合タンパク質を含むデータセットを使用してトレーニングを行いました。アルゴリズムは92のDNA結合タンパク質と100の非DNA結合タンパク質を含むデータセットでテストされました。トレーニングからは80.31%の精度、テストからは84.37%の精度を得ました。823のDNA結合タンパク質と823の非DNA結合タンパク質の独立したベンチマーク分析は、我々のアプローチが非DNA結合タンパク質からDNA結合タンパク質を80%以上の精度で区別できることを示しています。また、テストデータセットおよび2つの独立したデータセットでDNAbinder法と我々の方法を比較しました。テストデータセットでは両方法から同等の性能が観察されました。823のDNA結合タンパク質と823の非DNA結合タンパク質を含むベンチマークデータセットにおいて、DNA-Protは81.83%の精度で有意に優れた性能を示し、一方、DNAbinderはアミノ酸組成を使用して61.42%、PSSMプロファイルを使用して63.5%の精度を達成しました。同様に、DNA-Protは88のDNA結合タンパク質と233の非DNA結合タンパク質を含むベンチマークデータセットからより良い性能を達成しました。この結果は、DNA-Protが配列情報からDNA結合タンパク質を効率的に同定できることを示しています。データセットとDNA-Protソフトウェアのスタンドアロン版は、http://www3.ntu.edu.sg/home/EPNSugan/indexfiles/dnaprot.htm から入手できます。
Kumar et al. (Mon,) はこの問題を研究しました。