材料開発で機械学習を使うとき、アルゴリズムの選択以上に重要になるのが、材料をどのような数値で表すかです。材料名や組成式、顕微鏡画像、温度履歴をそのまま表計算ソフトへ並べても、モデルが材料科学的な意味を適切に理解するとは限りません。
材料開発の特徴量は、組成・構造・プロセス・測定条件の4層で整理し、「予測する時点で取得できる情報だけを使う」ことが基本です。高度な記述子を大量に生成することよりも、目的物性との関係、データ数、取得コスト、再現性を考えて表現を選ぶ方が重要です。
本記事では、組成・分子/結晶構造・製造条件を機械学習へ入力する方法と、少数データで起こりやすい失敗を、無機材料、触媒、高分子、電池材料の例とともに解説します。
この記事の要点
- 目的変数と予測時点を決めてから特徴量を設計する
- 組成だけでなく、構造・プロセス・測定条件まで検討する
- 少数データでは特徴量を増やしすぎず、単純な基準モデルから始める
- 特徴量重要度は「原因」を証明するものではない
- 特徴量生成や選択は交差検証の内側で行い、データリークを防ぐ
材料開発における特徴量設計とは
特徴量とは、機械学習モデルへ入力する数値やカテゴリ情報です。材料分野では「説明変数」「記述子(descriptor)」「フィンガープリント」などの言葉も使われます。
| 用語 | 主な意味 | 材料開発での例 |
|---|---|---|
| 特徴量 | モデルへ入力する変数の総称 | 組成比、焼成温度、粒径 |
| 記述子 | 材料や構造の性質を数値で表す量 | 電気陰性度の平均、配位数、分子量 |
| フィンガープリント | 構造の有無や局所パターンをベクトル化した表現 | Morgan fingerprint、結晶構造フィンガープリント |
| 埋め込み表現 | モデルがデータから学習した連続ベクトル | 分子グラフや材料文献の埋め込み |
マテリアルズ・インフォマティクス(MI)では、組成や構造、プロセスを数値表現へ変換し、物性や性能との関係を学習します。材料の表現方法は、モデル精度だけでなく、未知材料へ適用できる範囲や結果の解釈性にも影響します[1,2]。
MI全体の進め方は、マテリアルズ・インフォマティクスとは?進め方・活用例・失敗パターンで解説しています。
特徴量を作る前に決める3つのこと
1.何を予測するのか
最初に目的変数を明確にします。例えば、強度、導電率、触媒活性、容量維持率、良品・不良品では、必要な情報が異なります。同じ材料でも、初期性能を予測したい場合と長期耐久性を予測したい場合では、有効な特徴量は同じではありません。
2.いつ予測するのか
特徴量は、モデルを使う時点で取得できなければ実用になりません。
| 予測時点 | 利用できる情報の例 | 利用できない情報の例 |
|---|---|---|
| 材料設計前 | 候補組成、計算記述子、既知の原料情報 | 試作後の測定結果 |
| 試料作製後 | 組成、プロセス条件、外観、簡易測定 | 長期耐久試験の結果 |
| 製造工程中 | センサー値、装置条件、原料ロット | 出荷後に判明する性能 |
例えば、完成後にしか測れない分析値を設計段階の予測モデルへ入れると、検証時の精度は高くても、実際の材料探索では使えません。特徴量設計は、モデルを使う業務プロセスから逆算する必要があります。
3.何のためにモデルを使うのか
物性予測、材料探索、メカニズム理解、品質監視では、特徴量に求める性質が違います。探索では候補材料すべてに計算できること、メカニズム理解では材料科学的に説明できること、品質監視ではリアルタイムに取得できることが重要です。
材料の特徴量は4層で整理する
| 層 | 表現するもの | 代表例 |
|---|---|---|
| 組成 | 何からできているか | 元素比、原料比、添加量 |
| 構造 | どのように並んでいるか | 分子構造、結晶構造、微細構造 |
| プロセス | どのように作られたか | 温度、時間、圧力、工程順序 |
| 測定条件 | どのように評価されたか | 装置、測定温度、試料形状、測定方向 |
「組成が同じなら同じ材料」とは限りません。熱処理や成形条件が変われば構造が変わり、物性も変化します。また、同一試料でも測定条件によって観測値が変わります。したがって、材料―構造―プロセス―物性のつながりを意識して、どの層まで表現するかを決めます[1,3]。
組成を特徴量へ変換する方法
元素・原料の含有率をそのまま使う
最も分かりやすい方法は、各元素または各原料の比率を列として持つことです。候補成分が固定されている配合最適化や、探索範囲が限定された合金・電池材料では有効です。
一方、候補元素が増えると列数が多くなり、学習データに存在しない元素を扱いにくくなります。また、含有率の合計が100%になる組成データには変数間の制約があるため、通常の独立した数値変数と同じ感覚で扱うと解釈を誤る可能性があります。
元素物性の統計量で表す
各元素の原子量、電気陰性度、原子半径、融点、価電子数などを用い、組成比による加重平均、最大値、最小値、範囲、分散を計算します。組成だけから計算でき、新しい元素の組み合わせにも一定の一般化が期待できます。Wardらは、このような組成由来の属性を利用する汎用的な材料物性予測の枠組みを報告しています[2]。
- 加重平均:材料全体の平均的な性質
- 最大値・最小値:構成元素の極端な性質
- 範囲・分散:元素間の不均一性
- 化学量論特徴:元素数や組成の偏り
- 電子構造特徴:価電子数や軌道別の割合
組成データで区別すべき「0」と「欠損」
成分量0は「その成分を入れていない」という実験情報です。欠損値は「配合したか不明」「記録されていない」「測定していない」などを意味します。両者を同じ0で埋めると、モデルが誤った関係を学ぶため、欠損理由まで確認します。
構造を特徴量へ変換する方法
分子構造の表現
分子材料では、SMILESなどの文字列表現から、分子量、官能基数、極性表面積、環の数などの分子記述子を計算できます。局所部分構造をビット列で表すMorgan fingerprintも広く使われます。RDKitは、分子記述子やフィンガープリントを生成できるオープンソースのケモインフォマティクスツールです[4]。
| 表現 | 長所 | 注意点 |
|---|---|---|
| 分子記述子 | 解釈しやすい | 立体構造や材料状態を十分に表さない場合がある |
| フィンガープリント | 部分構造や類似性を扱いやすい | ビットの意味が直感的でない場合がある |
| 分子グラフ | 原子と結合を直接扱える | 一般に多くのデータと計算資源が必要 |
結晶構造の表現
無機結晶では、結晶系、空間群、格子定数、密度、配位数、原子間距離、局所環境などを特徴量にできます。SOAPのように、原子近傍環境を回転・並進・原子順序に対して不変な形で表現する記述子も提案されています[5]。
結晶構造が得られない初期探索では、組成特徴だけで基準モデルを作り、構造データが揃った段階で構造特徴を追加する進め方が現実的です。matminerには、組成、結晶構造、局所サイトなどから特徴量を生成する仕組みが用意されています[3]。
高分子構造の表現
高分子では、モノマー構造だけでは材料状態を十分に表せません。必要に応じて、分子量、分子量分布、共重合組成、分岐、結晶化度、架橋密度、立体規則性などを加えます。ただし、予測候補ごとに実測が必要な変数を入力すると、探索時に使えないモデルになるため注意が必要です。
画像・スペクトル・微細構造の表現
顕微鏡画像では、粒径、円形度、相分率、空孔率、配向度など、人が定義した特徴量を使う方法があります。画像をCNNへ直接入力する方法もありますが、データ数が少ない場合は、画像解析で得た少数の意味ある特徴量から始める方が検証しやすいことがあります。
スペクトルでは、ピーク位置、強度、半値幅、面積比などを使うほか、前処理後の波形をそのまま入力する方法があります。平滑化やベースライン補正の条件が違うと特徴量も変わるため、処理手順をメタデータとして残します。
プロセス条件を特徴量へ変換する方法
温度・時間・圧力を列にする
単一工程であれば、温度、保持時間、圧力、回転数、流量、雰囲気などを数値またはカテゴリとして入力します。単位を統一し、装置設定値と実測値を区別することが重要です。
履歴を要約する
材料特性は、最高温度だけでなく、そこへ至る履歴に左右されます。温度や圧力の時系列から、次のような特徴量を作れます。
- 昇温・冷却速度
- 特定温度以上に滞在した時間
- 時間積分値
- 最大値、最小値、平均値、標準偏差
- ピーク数、変化点、周期性
- 工程別の所要時間
ただし、要約しすぎると重要な局所変化を失います。まず材料知識に基づく要約特徴を作り、その後に時系列モデルとの比較を行うと、複雑化による改善効果を判断しやすくなります。
工程順序を表現する
同じ条件の集合でも、混合、乾燥、熱処理などの順番が違えば結果が変わる場合があります。このときは、工程ごとの変数を分ける、工程順序をカテゴリ化する、シーケンスとして扱うなどの方法があります。「処理温度」という1列に異なる工程の温度を混在させないことが重要です。
測定条件とメタデータも特徴量候補になる
材料データでは、測定装置、試料形状、測定方向、測定温度、前処理、解析方法などが目的値に影響します。これらを記録しなければ、材料差と測定差を分けられません。
- 測定装置と校正状態
- 測定規格・解析条件
- 試料形状、寸法、方向
- 測定温度・湿度
- 試料の保管時間と前処理
- 繰り返し測定か独立試料か
装置番号や測定日は、ばらつきを把握するうえでは有用ですが、モデルが特定装置や時期を答えの代理として使うこともあります。将来の装置や別拠点へ展開する場合は、装置・時期・バッチを分けた検証が必要です。
良い特徴量を判断する5つの基準
| 基準 | 確認する質問 |
|---|---|
| 利用可能性 | 予測を使う時点で取得できるか |
| 再現性 | 担当者や装置が変わっても同じ定義で得られるか |
| 材料科学的妥当性 | 目的物性と関係する理由を説明できるか |
| 識別性 | 材料やプロセスの違いを表現できるか |
| 展開可能性 | 新しい組成、構造、バッチでも計算・測定できるか |
予測精度だけで特徴量を選ぶと、高価な分析が必要で運用できないモデルや、既知材料しか扱えないモデルになりかねません。取得時間・費用と予測性能の改善量を一緒に評価します。
少数データで特徴量を増やしすぎる問題
材料開発では、数十~数百件のデータに対して、数百~数千個の記述子を生成できることがあります。しかし、特徴量が多いほど精度が高くなるとは限りません。
- 学習データだけに合う過学習が起きる
- 似た特徴量が多数入り、多重共線性が強くなる
- 偶然の相関を選びやすくなる
- 特徴量重要度が不安定になる
- 探索空間に対してデータが疎になる
材料開発の少数データで機械学習を使う方法で解説したように、少数データでは複雑なモデルよりも、データ分割と評価設計が重要です。まず少数の説明可能な特徴量で基準モデルを作り、追加特徴量が未知データでの性能を改善するか確認します。
特徴量を選択・削減する方法
| 方法 | 用途 | 注意点 |
|---|---|---|
| 材料知識による選択 | 候補を事前に絞る | 既知の考え方に偏る可能性 |
| 相関・分散の確認 | 定数列や重複情報を除く | 非線形関係を見落とす |
| Lasso/Elastic Net | 線形モデルで変数を絞る | 相関した変数間で選択が不安定 |
| Permutation Importance | 予測への寄与を評価する | 相関特徴があると重要度が分散 |
| 再帰的特徴量削減 | モデル性能を見ながら削減する | 計算量が増える |
| PCA | 高次元情報を少数軸へ圧縮する | 各軸の材料科学的解釈が難しい |
重要なのは、特徴量選択をデータ分割の前に行わないことです。全データを使って特徴量を選び、その後に交差検証すると、検証データの情報が選択へ混入します。スケーリング、欠損補完、特徴量選択は、原則として交差検証の各学習データ内で実行します。
特徴量重要度から材料メカニズムを断定してはいけない
SHAPやPermutation Importanceで重要度が高い特徴量は、モデルの予測に使われたことを示します。しかし、それだけで物性変化の原因だとは証明できません。
例えば、焼成温度が重要でも、実際には温度と一緒に変化した装置、時期、原料ロットを捉えている可能性があります。相関した特徴量が複数ある場合は、重要度が分散したり、モデルによって順位が変わったりします。
重要度は、追加実験や解析の仮説を作るための手掛かりとして使い、因果関係は条件を制御した実験や材料科学的検討で確認します。
材料別の特徴量設計例
無機・セラミックス材料
元素組成、結晶相、格子定数、粒径、成形圧力、焼成温度、保持時間、雰囲気、密度、空孔率などが候補です。設計段階では組成と計算可能な記述子、試作後の品質予測では構造・微細組織も利用するなど、予測時点で使い分けます。
触媒材料
活性元素、担体、担持量、前駆体、調製条件、焼成・還元条件、比表面積、細孔特性、反応温度、圧力、原料組成などを検討します。触媒そのものの特徴と反応条件を分けて持つと、どの触媒をどの条件で使ったかを整理しやすくなります。
高分子材料
モノマー構造、共重合組成、分子量、分子量分布、官能基、添加剤量、混合・成形条件、熱履歴などが候補です。モノマー由来の分子記述子だけでなく、高分子化後の状態やプロセスが物性を左右する点に注意します。
電池・電極材料
活物質組成、結晶構造、粒径、導電助剤やバインダーの比率、電極密度、塗工・乾燥条件、電解液、充放電レート、温度、サイクル数などがあります。材料特徴と評価プロトコルを分離して記録しないと、材料差と試験条件差を混同します。
実務での特徴量設計9ステップ
- 目的変数を定義する:何をどの単位で予測するかを決める。
- 予測時点を決める:設計前、試作後、工程中など、モデルを使う場面を明確にする。
- 4層で候補を洗い出す:組成・構造・プロセス・測定条件を整理する。
- 利用できない情報を除く:予測時点より後に得られる情報や目的値の代理変数を外す。
- 定義を統一する:単位、カテゴリ名、欠損の意味、計算式を揃える。
- 単純な基準モデルを作る:少数の特徴量と線形モデルなどから始める。
- 特徴量群を段階的に追加する:組成、構造、プロセスの追加効果を比較する。
- 適切に検証する:試料、材料系、バッチ、時期を考慮して分割する。
- 運用可能性を確認する:取得コスト、計算時間、将来データでの再現性を評価する。
テーマ自体の適性を評価する場合は、MIプロジェクトのテーマ選定方法|向いている課題・向かない課題も参考にしてください。
特徴量設計チェックリスト
- 目的変数と予測時点は明確か
- 予測時点で取得できない情報が入っていないか
- 組成・構造・プロセス・測定条件を検討したか
- 0、未実施、未記録を区別しているか
- 単位とカテゴリ表記が統一されているか
- 試料、バッチ、装置、時期の関係を確認したか
- 特徴量数はデータ数に対して過大でないか
- 特徴量生成・選択を交差検証の内側で行っているか
- 重要度を因果関係と解釈していないか
- 取得コストに見合う精度改善があるか
- 未知の材料候補にも同じ方法で計算できるか
- 特徴量の定義とバージョンを記録しているか
よくある質問
材料開発では特徴量を何個に絞るべきですか?
一律の正解はありません。データ数、ノイズ、特徴量間の相関、モデルによって異なります。まず材料知識で説明できる少数の特徴量から始め、交差検証で追加効果を確認する方法が安全です。
組成比をそのまま機械学習へ使えますか?
候補成分が固定された範囲では使えます。ただし、合計100%の制約、欠損と未配合の違い、学習データにない成分をどう扱うかに注意が必要です。広い材料空間へ展開する場合は、元素物性由来の記述子も検討します。
ディープラーニングなら特徴量設計は不要ですか?
モデルが表現を学習する範囲は広がりますが、目的変数、データ品質、予測時点、プロセスや測定条件の記録は依然として必要です。材料開発の少数データでは、手作業で設計した特徴量と単純なモデルが有力な比較対象になります。
特徴量重要度が高ければ、物性の原因と考えてよいですか?
いいえ。重要度はモデルが予測に利用した度合いであり、因果関係を直接示しません。交絡、相関した変数、データの偏りを確認し、必要に応じて追加実験で検証します。
まとめ
材料開発の特徴量設計では、材料を単なる数値表へ変換するのではなく、組成・構造・プロセス・測定条件の関係を、予測目的に合わせて表現することが重要です。
- 特徴量設計は目的変数と予測時点から逆算する
- 組成だけでなく、構造・プロセス・測定条件も候補にする
- 高度な記述子を大量に作る前に、単純な基準モデルを作る
- 少数データでは特徴量選択と検証を同じパイプライン内で行う
- 重要度は仮説形成に使い、因果関係は別途検証する
良い特徴量は、精度が高いだけでなく、将来の候補にも計算でき、現場で再現でき、取得コストが許容できる特徴量です。モデルの複雑さよりも、「何を、いつ、どの定義で記録するか」を丁寧に設計することが、MIを実際の材料開発へつなげます。
参考文献
- Butler, K. T. et al., “Machine learning for molecular and materials science,” Nature, 559, 547–555 (2018). https://doi.org/10.1038/s41586-018-0337-2
- Ward, L. et al., “A general-purpose machine learning framework for predicting properties of inorganic materials,” npj Computational Materials, 2, 16028 (2016). https://doi.org/10.1038/npjcompumats.2016.28
- Ward, L. et al., “Matminer: An open source toolkit for materials data mining,” Computational Materials Science, 152, 60–69 (2018). https://doi.org/10.1016/j.commatsci.2018.05.018
- RDKit, “RDKit: Open-Source Cheminformatics Software.” https://www.rdkit.org/(2026年10月4日閲覧)
- Bartók, A. P., Kondor, R. and Csányi, G., “On representing chemical environments,” Physical Review B, 87, 184115 (2013). https://doi.org/10.1103/PhysRevB.87.184115


