概要


セクション 設定 データセット・学習データ・主骨格データ 予測データ・原料データ・側鎖データ 逐次計算の可否
仮想サンプル生成 BASIC 特徴量50個以下-生成可能なサンプル数10万行
特徴量100個以下-生成可能なサンプル数5万行
特徴量200個以下-生成可能なサンプル数3万行
EXPERT 特徴量50個以下-生成可能なサンプル数10万行
特徴量100個以下-生成可能なサンプル数2万行
特徴量200個以下-生成可能なサンプル数1万行
実験計画 最適基準:D, I
選択サンプル数:30 特徴量10個-サンプル数7万行
特徴量20個-サンプル数4万行
特徴量50個-サンプル数1万行 ×
欠損値補完 欠損値:10 ■GMR
特徴量10個以下-サンプル数8千行
特徴量50個以下-サンプル数4千行

■VBGMR 特徴量50個以下-サンプル数5百行 | | × | | 特徴量変換 | 追加項:20(二乗項10, 交差項10) | 特徴量10個-サンプル数6万行 特徴量20個-サンプル数3万行 | | 〇 | | 特徴量選択 | 目的変数:1 -666:なし サンプル割合:あり, 0.99 高い相関:あり, 0.99 | ■トレーニングデータ選択あり, ランダム, Borutaなし 特徴量200個-サンプル数4千行

■トレーニングデータ選択あり, Kennard-Stone, Borutaなし 特徴量200個-サンプル数1千行

■トレーニングデータ選択なし, Borutaあり 特徴量200個-サンプル数4千行 | | × | | 混合物計算 | 計算手法:すべて | ①原料10種-サンプル数5万行 ②原料20種-サンプル数3万行 | ①原料10種-特徴量5個 ②原料20種-特徴量5個 | ○ | | データ可視化 | 箱ひげ図, 基礎統計量, 散布図行列 | 特徴量10個-サンプル数10万行 特徴量20個-サンプル数5万行 | | × | | | 相関係数 | 特徴量10個-サンプル数8万行 特徴量20個-サンプル数3万行 | | × | | | ヒストグラム, 3Dグラフ | 特徴量10個-サンプル数10万行 特徴量20個-サンプル数5万行 | | × | | | 散布図 | 特徴量10個-サンプル数8万行 特徴量20個-サンプル数4万行 | | × | | 低次元化 | PCA | 特徴量10個-サンプル数5万行 特徴量20個-サンプル数3万行 | | × | | | GTM | 特徴量20個-サンプル数1千行 | | × | | | tSNE | 特徴量10個-サンプル数2万行 特徴量20個-サンプル数1万行 | | × | | クラス分類-モデル最適化 | 目的変数:1 クラス数:3 | ■LR, LDA, NB, kNN, DT, LGB, XGB, GBDT 特徴量10個-サンプル数7万行 特徴量20個-サンプル数4万行

■LSVM, NSVM, RF, DNN 特徴量10個-サンプル数8千行 特徴量20個-サンプル数3千行 | | ○ | | クラス分類-予測 | 目的変数:1 クラス数:3 | ■LR, LDA, NB, kNN, DT, LGB, XGB, GBDT ①特徴量10個-サンプル数2万行 ②特徴量20個-サンプル数1万行

■LSVM, NSVM, RF, DNN ①特徴量10個-サンプル数1.5千行 | ■LR, LDA, NB, kNN, DT, LGB, XGB, GBDT ①特徴量10個-サンプル数10万行 ②特徴量20個-サンプル数5万行

■LSVM, NSVM, RF, DNN ①特徴量10個-サンプル数10万行 | ○ | | MI-モデル最適化 | 目的変数:1 | ■OLS, PLS, RR, LASSO, EN, DT, GBDT, XGB, LGB, GMR, VBGMR, DNN 特徴量10個-サンプル数7万行 特徴量20個-サンプル数4万行

■LSVR, NSVR, RF, LGPR, NGPR1~10 特徴量10個-サンプル数1万行 特徴量20個-サンプル数7千行 | | ○ | | MI-MI予測•回帰分析 | 目的変数:1 | ■OLS, PLS, RR, LASSO, EN, DT, GBDT, XGB, LGB, GMR, VBGMR, DNN ①特徴量10個-サンプル数2万行 ②特徴量20個-サンプル数1万行

■LSVR, NSVR, RF, LGPR, NGPR1~10 ①特徴量10個-サンプル数2千行 | ■OLS, PLS, RR, LASSO, EN, DT, GBDT, XGB, LGB, GMR, VBGMR, DNN ①特徴量10個-サンプル数10万行 ②特徴量20個-サンプル数5万行

■LSVR, NSVR, RF, LGPR, NGPR1~10 ①特徴量10個-サンプル数10万行 | ○ | | MI-MI予測•ベイズ最適化 | 目的変数:1 | ①特徴量10個-サンプル数2千行 ②特徴量20個-サンプル数1千行 | ①特徴量10個-サンプル数10万行 ②特徴量20個-サンプル数5万行 | ○ | | MI Expert-モデル最適化-複数Y同時 | 目的変数:2 | ■DT, GMR, VBGMR, DNN 特徴量10個-サンプル数5万行 特徴量20個-サンプル数2万行

■RF 特徴量10個-サンプル数2万行 特徴量20個-サンプル数1万行 | | ○ | | MI Expert-MI予測-複数Y同時回帰分析 | 目的変数:2 | ■DT, GMR, VBGMR, DNN ①特徴量10個-サンプル数1万行 ②特徴量20個-サンプル数5千行

■RF ①特徴量10個-サンプル数2千行 | ■DT, GMR, VBGMR, DNN ①特徴量10個-サンプル数4万行 ②特徴量20個-サンプル数2万行

■RF ①特徴量10個-サンプル数5万行 | ○ | | MI Expert-MI予測-直接的逆解析 | 目的変数:2 目標設定:10 | 特徴量10個-サンプル数1万行 特徴量20個-サンプル数9千行 | | ○ | | スペクトル-SG法による前処理 | 目的変数:0 | ■サンプルが多い場合 特徴量500個-サンプル数1千行

■特徴量が多い場合 特徴量1万個-サンプル数50行 | | ○ | | 記述子計算 | 単分子 | ■RDKit, MACCS Key, Avalon サンプル数1万個

■ECFP4, FCFP4, Topological(RDKit) サンプル数2千個 | | ○ | | | 共重合 | ■RDKit、MACCS Key、Avalon 成分数20-サンプル数1万行

■ECFP4、FCFP4、Topological(RDKit) 成分数20-サンプル数1千行 | | ○ | | 構造生成 | 化学構造生成 | サンプル数1万行

※ALL選択の場合は、サンプル数100行 | サンプル数1万行

※ALL選択の場合は、サンプル数100行 | ○ | | | フラグメント生成 | サンプル数1万行 | | ○ | | ソフトセンサー | 手法:MW ウィンドウサイズ:200 | ■OLS, PLS, RR, LASSO, EN, LSVR, NSVR, DT 特徴量5個-サンプル数10万行

■NGPR1-10, XGB, LGB 特徴量5個-サンプル数7万行

■LGPR, GBDT, LWPLS, DNN 特徴量5個-サンプル数2万行

■RF 特徴量5個-サンプル数8千行               | | ○ | | | 手法:JIT サンプルサイズ:150 | ■LASSO, EN, LSVR, NSVR, DT 特徴量5個-サンプル数8万行

■OLS, PLS, RR 特徴量5個-サンプル数7万行

■LWPLS, DNN 特徴量5個-サンプル数2万行

■LGPR, NGPR1-10, LGB 特徴量5個-サンプル数4千行 | | ○ | | 異常検知 | PCA, OCSVM, k-NN | ①特徴量5個 -サンプル数5万行 ②特徴量10個 -サンプル数1万行 | ①特徴量5個 -サンプル数5万行 ②特徴量10個 -サンプル数3万行 | × |