Datachemical LABはWebブラウザにてGoogle Cloudにデータセットを送信し、Google Cloud上のPythonプログラムを実行し、計算結果を受信しております。その際に大きくはクラウドエンジンの計算能力およびWebブラウザのデータ許容量の制限で各セクションのデータ処理量には上限があり、それを超える計算処理を実行しようとするとエラーが発生します。そこで下表にて各セクションのおよそのデータ処理量の目安を示しますので、実行の際にご参考下さい。また今後システム変更により処理量は変更される可能性があります。
データ処理量は、その他にも使用するデータセットや各セクションでの具体的なパラメータ設定の内容、通信状況などにより変化しますので、下記表は動作を保証するものではありません。あくまで一つの目安としてお考え下さい。下表は特に指定がなければ各種パラメータはデフォルト設定を想定しております。
逐次計算の可否について
Datachemical LABでは逐次計算が可能な機能(モデル最適化では各モデルの計算、その他はサンプル行の分割計算)ではクラウドエンジンにて小分けで計算を行い、最終的に計算結果をUI上で統合することで処理量の増大を図っております。一方データ全体を一度に処理する必要がある機能においては、より処理量の制限がかかってきます。逐次計算が可能なもの(記載〇)で下記表の容量を超えて計算したい場合は、比較モデルの範囲やCSVファイルでのサンプル行を分割して複数回計算を行うことで対応できます。一方逐次計算不可のもの(記載×)で大量のデータを処理したい場合は、弊社まで処理方法についてご相談ください。
検証条件
データ処理量の検証は、以下の実行環境およびデータを使用し、Webブラウザを介して実施しております。なお、Datachemical LAB(クラウド版)はクラウドサービスのため、ユーザPCのスペックがデータ処理量に大きく影響することはありません。
| セクション | 設定 | データセット・学習データ・主骨格データ | 予測データ・原料データ・側鎖データ | 逐次計算の可否 |
|---|---|---|---|---|
| 仮想サンプル生成 | BASIC | 特徴量50個以下-生成可能なサンプル数10万行 | ||
| 特徴量100個以下-生成可能なサンプル数5万行 | ||||
| 特徴量200個以下-生成可能なサンプル数3万行 | ○ | |||
| EXPERT | 特徴量50個以下-生成可能なサンプル数10万行 | |||
| 特徴量100個以下-生成可能なサンプル数2万行 | ||||
| 特徴量200個以下-生成可能なサンプル数1万行 | ○ | |||
| 実験計画 | 最適基準:D, I | |||
| 選択サンプル数:30 | 特徴量10個-サンプル数7万行 | |||
| 特徴量20個-サンプル数4万行 | ||||
| 特徴量50個-サンプル数1万行 | × | |||
| 欠損値補完 | 欠損値:10 | ■GMR | ||
| 特徴量10個以下-サンプル数8千行 | ||||
| 特徴量50個以下-サンプル数4千行 |
■VBGMR 特徴量50個以下-サンプル数5百行 | | × | | 特徴量変換 | 追加項:20(二乗項10, 交差項10) | 特徴量10個-サンプル数6万行 特徴量20個-サンプル数3万行 | | 〇 | | 特徴量選択 | 目的変数:1 -666:なし サンプル割合:あり, 0.99 高い相関:あり, 0.99 | ■トレーニングデータ選択あり, ランダム, Borutaなし 特徴量200個-サンプル数4千行
■トレーニングデータ選択あり, Kennard-Stone, Borutaなし 特徴量200個-サンプル数1千行
■トレーニングデータ選択なし, Borutaあり 特徴量200個-サンプル数4千行 | | × | | 混合物計算 | 計算手法:すべて | ①原料10種-サンプル数5万行 ②原料20種-サンプル数3万行 | ①原料10種-特徴量5個 ②原料20種-特徴量5個 | ○ | | データ可視化 | 箱ひげ図, 基礎統計量, 散布図行列 | 特徴量10個-サンプル数10万行 特徴量20個-サンプル数5万行 | | × | | | 相関係数 | 特徴量10個-サンプル数8万行 特徴量20個-サンプル数3万行 | | × | | | ヒストグラム, 3Dグラフ | 特徴量10個-サンプル数10万行 特徴量20個-サンプル数5万行 | | × | | | 散布図 | 特徴量10個-サンプル数8万行 特徴量20個-サンプル数4万行 | | × | | 低次元化 | PCA | 特徴量10個-サンプル数5万行 特徴量20個-サンプル数3万行 | | × | | | GTM | 特徴量20個-サンプル数1千行 | | × | | | tSNE | 特徴量10個-サンプル数2万行 特徴量20個-サンプル数1万行 | | × | | クラス分類-モデル最適化 | 目的変数:1 クラス数:3 | ■LR, LDA, NB, kNN, DT, LGB, XGB, GBDT 特徴量10個-サンプル数7万行 特徴量20個-サンプル数4万行
■LSVM, NSVM, RF, DNN 特徴量10個-サンプル数8千行 特徴量20個-サンプル数3千行 | | ○ | | クラス分類-予測 | 目的変数:1 クラス数:3 | ■LR, LDA, NB, kNN, DT, LGB, XGB, GBDT ①特徴量10個-サンプル数2万行 ②特徴量20個-サンプル数1万行
■LSVM, NSVM, RF, DNN ①特徴量10個-サンプル数1.5千行 | ■LR, LDA, NB, kNN, DT, LGB, XGB, GBDT ①特徴量10個-サンプル数10万行 ②特徴量20個-サンプル数5万行
■LSVM, NSVM, RF, DNN ①特徴量10個-サンプル数10万行 | ○ | | MI-モデル最適化 | 目的変数:1 | ■OLS, PLS, RR, LASSO, EN, DT, GBDT, XGB, LGB, GMR, VBGMR, DNN 特徴量10個-サンプル数7万行 特徴量20個-サンプル数4万行
■LSVR, NSVR, RF, LGPR, NGPR1~10 特徴量10個-サンプル数1万行 特徴量20個-サンプル数7千行 | | ○ | | MI-MI予測•回帰分析 | 目的変数:1 | ■OLS, PLS, RR, LASSO, EN, DT, GBDT, XGB, LGB, GMR, VBGMR, DNN ①特徴量10個-サンプル数2万行 ②特徴量20個-サンプル数1万行
■LSVR, NSVR, RF, LGPR, NGPR1~10 ①特徴量10個-サンプル数2千行 | ■OLS, PLS, RR, LASSO, EN, DT, GBDT, XGB, LGB, GMR, VBGMR, DNN ①特徴量10個-サンプル数10万行 ②特徴量20個-サンプル数5万行
■LSVR, NSVR, RF, LGPR, NGPR1~10 ①特徴量10個-サンプル数10万行 | ○ | | MI-MI予測•ベイズ最適化 | 目的変数:1 | ①特徴量10個-サンプル数2千行 ②特徴量20個-サンプル数1千行 | ①特徴量10個-サンプル数10万行 ②特徴量20個-サンプル数5万行 | ○ | | MI Expert-モデル最適化-複数Y同時 | 目的変数:2 | ■DT, GMR, VBGMR, DNN 特徴量10個-サンプル数5万行 特徴量20個-サンプル数2万行
■RF 特徴量10個-サンプル数2万行 特徴量20個-サンプル数1万行 | | ○ | | MI Expert-MI予測-複数Y同時回帰分析 | 目的変数:2 | ■DT, GMR, VBGMR, DNN ①特徴量10個-サンプル数1万行 ②特徴量20個-サンプル数5千行
■RF ①特徴量10個-サンプル数2千行 | ■DT, GMR, VBGMR, DNN ①特徴量10個-サンプル数4万行 ②特徴量20個-サンプル数2万行
■RF ①特徴量10個-サンプル数5万行 | ○ | | MI Expert-MI予測-直接的逆解析 | 目的変数:2 目標設定:10 | 特徴量10個-サンプル数1万行 特徴量20個-サンプル数9千行 | | ○ | | スペクトル-SG法による前処理 | 目的変数:0 | ■サンプルが多い場合 特徴量500個-サンプル数1千行
■特徴量が多い場合 特徴量1万個-サンプル数50行 | | ○ | | 記述子計算 | 単分子 | ■RDKit, MACCS Key, Avalon サンプル数1万個
■ECFP4, FCFP4, Topological(RDKit) サンプル数2千個 | | ○ | | | 共重合 | ■RDKit、MACCS Key、Avalon 成分数20-サンプル数1万行
■ECFP4、FCFP4、Topological(RDKit) 成分数20-サンプル数1千行 | | ○ | | 構造生成 | 化学構造生成 | サンプル数1万行
※ALL選択の場合は、サンプル数100行 | サンプル数1万行
※ALL選択の場合は、サンプル数100行 | ○ | | | フラグメント生成 | サンプル数1万行 | | ○ | | ソフトセンサー | 手法:MW ウィンドウサイズ:200 | ■OLS, PLS, RR, LASSO, EN, LSVR, NSVR, DT 特徴量5個-サンプル数10万行
■NGPR1-10, XGB, LGB 特徴量5個-サンプル数7万行
■LGPR, GBDT, LWPLS, DNN 特徴量5個-サンプル数2万行
■RF 特徴量5個-サンプル数8千行 | | ○ | | | 手法:JIT サンプルサイズ:150 | ■LASSO, EN, LSVR, NSVR, DT 特徴量5個-サンプル数8万行
■OLS, PLS, RR 特徴量5個-サンプル数7万行
■LWPLS, DNN 特徴量5個-サンプル数2万行
■LGPR, NGPR1-10, LGB 特徴量5個-サンプル数4千行 | | ○ | | 異常検知 | PCA, OCSVM, k-NN | ①特徴量5個 -サンプル数5万行 ②特徴量10個 -サンプル数1万行 | ①特徴量5個 -サンプル数5万行 ②特徴量10個 -サンプル数3万行 | × |