マテリアルズ・インフォマティクス(MI)や機械学習では、モデルの種類より前に確認すべきものがあります。それが材料データの品質です。
欠損値を平均値で埋め、外れ値を削除し、列名を整えれば「きれいなデータ」には見えます。しかし、試料の来歴、測定条件、単位、装置、データ処理方法が分からなければ、数値が正しくても再現や再利用は困難です。
材料データの品質を高める基本は、値を機械的に修正することではなく、「なぜその値になったか」を追跡できる状態にすることです。本記事では、欠損値、外れ値、測定条件、メタデータを中心に、削除・補完・再測定・保持をどう判断するかを解説します。
この記事の要点
- 欠損値は、未測定・測定失敗・検出限界以下・該当なしを区別する
- 外れ値は削除候補ではなく、原因を調べるべきデータとして扱う
- 測定値と測定条件をセットで保存する
- 原データを残し、修正・除外の履歴を記録する
- 成功実験だけでなく、失敗実験や低性能データも残す
材料データの品質とは
材料データの品質は、測定値の精度だけでは決まりません。目的に対して必要な情報が揃っているか、別の研究者が同じ意味で解釈できるか、将来の解析へ再利用できるかも重要です。材料データ品質は、データの取得、管理、利用という研究ライフサイクル全体で管理する必要があります[1,2]。
| 品質の観点 | 確認する内容 | 材料データの例 |
|---|---|---|
| 正確性 | 記録値が原データと一致するか | 転記・単位変換に誤りがない |
| 完全性 | 必要な項目が揃っているか | 組成だけでなく作製・測定条件がある |
| 一貫性 | 定義、単位、表記が統一されているか | MPaとGPa、℃とKが混在していない |
| 追跡可能性 | データの発生源をたどれるか | 試料、原料ロット、装置、生データを結べる |
| 代表性 | 対象空間を適切に含むか | 成功条件付近だけに偏っていない |
| 再利用性 | 別の目的でも理解できるか | 条件と処理方法がメタデータとして残る |
高精度な測定値でも、どの温度、試料形状、装置、解析条件で得た値か分からなければ、異なるデータとの比較は困難です。反対に、ばらつきを含むデータでも、その原因や条件が記録されていれば、測定モデルや不確かさ評価へ利用できます。
材料データで起こりやすい品質問題
- 未測定、測定失敗、検出限界以下がすべて空欄になっている
- 外れ値を理由なく削除している
- 原料名や材料名に表記揺れがある
- 単位や基準量が混在している
- 測定条件や試料形状が記録されていない
- 同じ試料の繰り返し測定を独立した試料として扱っている
- 装置、担当者、拠点、時期の違いを追跡できない
- 成功した実験だけがデータベースへ登録されている
- 前処理済みの数値だけが残り、生データが保存されていない
- データの修正者、修正日時、修正理由が分からない
こうした問題は解析段階で初めて生じるのではありません。実験計画、試料作製、測定、記録、データ統合の各段階で少しずつ蓄積します。
欠損値は「なぜ欠けたか」から判断する
材料実験の空欄には複数の意味があります。補完手法を選ぶ前に、欠損理由を分類します。
| 欠損の理由 | 意味 | 基本的な対応 |
|---|---|---|
| 未測定 | その項目を測定していない | 未測定として記録し、必要性を再検討 |
| 測定失敗 | 装置や試料の問題で値が得られなかった | 失敗理由を残し、可能なら再測定 |
| 検出限界以下 | 対象は存在するが定量できない | 0ではなく、検出限界とともに記録 |
| 該当なし | その試料には項目が適用されない | N/Aなど、未測定と異なる符号を使う |
| 記録漏れ | 測定した可能性はあるが値がない | 原記録を確認し、確認不能なら不明とする |
| 実験中断 | 試作や測定を完了できなかった | 中断理由を結果として保存する |
0と欠損値を区別する
成分量0は「その成分を入れていない」という観測情報です。空欄は「分からない」、検出限界以下は「測定上は定量できない」という意味です。この3つを同じ0に置き換えると、モデルは異なる状態を同一と学習します。
MCAR・MAR・MNARを実験の文脈で考える
統計学では、欠損はMCAR、MAR、MNARに分類されます[3]。
- MCAR:欠損が他の値と無関係に偶然発生する
- MAR:観測済みの条件によって欠損しやすさが変わる
- MNAR:値そのものや未観測要因が欠損に関係する
例えば、高温条件で試料が破損して測定できない場合、欠損は条件と関係しています。低濃度試料だけが検出限界以下になる場合、欠損は測りたい値そのものと関係します。材料データでは欠損が完全な偶然とは限らないため、平均値で埋める前に発生条件を可視化します。
欠損値を削除・補完する判断
| 状況 | 検討する対応 | 注意点 |
|---|---|---|
| 欠損が少なく偶発的 | 該当行の除外 | 少数データでは情報損失が大きい |
| 中心付近の数値が欠ける | 中央値、回帰、多重代入 | 補完値を実測値と区別する |
| 欠損自体に意味がある | 欠損フラグを追加 | 予測時にも同じ情報が得られるか確認 |
| 目的変数が欠損 | 教師あり学習からは通常除外 | 未測定候補として探索に利用できる場合がある |
| 検出限界以下 | 打ち切りデータとして扱う | 一律に0や検出限界の半分としない |
補完はデータを増やす操作ではありません。不確かな値を推定しているため、補完方法を記録し、交差検証の各学習データ内で実施します。
外れ値を自動的に削除してはいけない
外れ値は「間違った値」とは限りません。材料データでは、新しい相、特異な組織、高性能な候補、工程変化の兆候である可能性があります。
外れ値を4種類に分ける
- 入力・転記ミス:小数点、桁、単位、試料IDの誤り
- 測定異常:装置エラー、校正不良、試料破損
- 工程・群の違い:別バッチ、別相、別装置、条件変更
- 真正な希少値:再現可能な高性能または低性能のデータ
統計手法は「候補抽出」に使う
箱ひげ図、IQR、Zスコア、MAD、Isolation Forestなどは、確認すべき候補を抽出する方法です。ただし、統計的に離れているという理由だけで削除を決めることはできません。
外れ値候補を見つけたら、次の順番で確認します。
- 原データと転記内容を照合する
- 単位、試料ID、測定条件を確認する
- 装置ログと校正履歴を確認する
- 同一試料の繰り返し測定を確認する
- 別試料で再現するか確認する
- 残す場合と除外する場合の両方で感度分析する
判断の原則:削除する場合は、「外れ値だったから」ではなく、「転記ミス」「装置異常」「試料破損」など、材料・測定上の理由を記録します。原因不明なら、元データを消さず、解析対象フラグで管理します。
単位・名称・カテゴリ表記を統一する
材料データでは、同じ物理量が異なる単位や基準量で記録されます。
- Pa、MPa、GPa
- ℃、K
- wt%、mol%、vol%
- S/cm、S/m
- 時間、分、秒
- 試料全体当たり、質量当たり、面積当たり
単位変換後の値だけを保存せず、原値、原単位、変換式、変換後の値を分けて持つと追跡しやすくなります。材料名、原料名、工程名もマスタを作り、自由記述による表記揺れを減らします。
文献値は数値だけを転記しない
文献からデータを集める場合は、本文、表、図、補足資料のどこから値を取得したかを残します。2026年の固体電解質データを対象としたプレプリントでは、本文と図の不一致、軸表記の曖昧さ、単位の不一致、測定文脈の欠落が確認され、データベース間で100倍の伝導度差を生み得る例が報告されました[4]。
この事例が示すのは、異常に見える数値だけが危険なのではないという点です。単位変換ミスや文脈欠落による値は、数値として自然に見えるため、通常の外れ値検出では発見できない場合があります。
測定値と測定条件をセットで保存する
測定条件は補足情報ではなく、測定値を解釈するための一部です。最低限、次の情報を検討します。
| 分類 | 記録項目の例 |
|---|---|
| 試料 | 試料ID、形状、寸法、方向、前処理、保管条件 |
| 装置 | 装置名、装置番号、ソフトウェア、校正日 |
| 環境 | 温度、湿度、雰囲気、圧力 |
| 方法 | 測定規格、治具、負荷速度、周波数、測定範囲 |
| 繰り返し | 独立試料数、繰り返し測定数、集計方法 |
| 処理 | 平滑化、ベースライン補正、フィッティング条件 |
| 不確かさ | 標準偏差、信頼区間、検出限界、校正の不確かさ |
NISTは、材料データを共有・再利用する基盤で、分野固有のメタデータと測定不確かさを機械可読な形で表現する取り組みを進めています[5,6]。測定値だけでなく、不確かさと条件を残すことで、異なる装置や研究室のデータを比較しやすくなります。
繰り返し測定と独立試料を区別する
同じ試料を5回測定したデータと、独立に作製した5試料のデータは意味が異なります。前者は主に測定ばらつき、後者は試料作製を含む再現性を評価します。すべてを独立した5行として扱うと、実質的なデータ数を過大評価する可能性があります。
生データと処理済みデータを分ける
スペクトルや画像では、平滑化、ベースライン補正、閾値処理によって結果が変わります。生データを上書きせず、処理条件と処理済みファイルを別に保存します。
実験メタデータとは
メタデータは「データを説明するデータ」です。FAIR原則では、データをFindable、Accessible、Interoperable、Reusableにするため、識別子や来歴を含むメタデータが重視されています[7]。
| メタデータの分類 | 材料実験での例 |
|---|---|
| 試料情報 | 試料ID、材料名、組成、形状、作製日 |
| 原料情報 | 原料名、グレード、ロット、純度、保管条件 |
| プロセス情報 | 装置、温度、時間、雰囲気、工程順序 |
| 測定情報 | 測定法、装置、規格、環境、解析条件 |
| 来歴情報 | 作成者、更新日時、変更理由、出典、バージョン |
| 関係情報 | 親試料、分割試料、繰り返し、関連ファイル |
試料IDをデータの中心にする
一つの試料から画像、スペクトル、物性値、工程ログが得られる場合、ファイル名だけで管理すると対応関係が崩れやすくなります。重複しない試料IDを中心に、原料、作製、測定、生データ、解析結果を結び付けます。
自由記述だけに依存しない
自由記述は例外や観察事項を残すのに有効ですが、集計や検索が難しくなります。装置、工程、欠損理由、異常理由などは選択式の標準語彙を用意し、詳細だけを自由記述で補います。NISTの材料メタデータ研究でも、統制語彙とメタデータスキーマが材料データ発見の基盤として提案されています[8]。
失敗実験と低性能データを残す
研究では成功した条件が報告・共有されやすく、合成できなかった条件や低性能の結果は残りにくい傾向があります。しかし、MIにとって失敗は探索境界を示す重要な情報です。
Raccugliaらは、結晶化に成功しなかった反応を含む実験記録を機械学習へ利用し、新しい反応条件の選択に活用しました[9]。これは、失敗実験が単なる不要データではなく、「どの条件では目的状態にならないか」を学ぶ教師情報になることを示す代表例です。
ただし、「失敗」を一つのカテゴリにまとめてはいけません。
- 反応・合成が進まなかった
- 試料はできたが目的相ではなかった
- 試料作製中に破損した
- 測定だけが失敗した
- 性能は測れたが目標未達だった
失敗段階と理由を分けて記録すれば、探索モデル、工程改善、装置保全など異なる目的へ再利用できます。
公開事例から学ぶ材料データ品質
事例1:固体電解質の伝導度と測定文脈
問題:文献やデータベース間で、温度、軸、単位、測定条件の解釈が一致しない。
影響:もっともらしい数値のまま大きな誤差が混入し、学習用ラベルとして再利用される。
対応:出典箇所、原単位、測定温度、測定方法、変換手順を値とともに保存する[4]。
事例2:失敗した結晶化実験
問題:成功結果だけを残すと、探索空間の境界が見えない。
影響:モデルは成功条件付近だけを学び、失敗しやすい領域を判断できない。
対応:合成結果を成功・失敗だけでなく、生成物や観察結果を含めて構造化する[9]。
事例3:スペクトルの検出限界以下
問題:ピークが検出されない値を0として扱う。
影響:物質が存在しない状態と、装置では定量できない低濃度状態が混同される。
対応:検出限界、定量限界、装置条件を記録し、打ち切りデータとして扱う。
事例4:機械特性の研究室間比較
問題:同じ物性名でも、試験片形状、表面仕上げ、負荷方向、速度が異なる。
影響:材料差と試験条件差を区別できず、外れ値や装置差と誤認する。
対応:試験規格、試験片、境界条件、不確かさをメタデータに含める。NISTの材料データ基盤に関する報告でも、加工履歴、境界条件、校正、試験方法を含む来歴情報の重要性が指摘されています[10]。
事例5:計算材料データの再利用
問題:計算結果だけが残り、コード、バージョン、入力構造、収束条件が分からない。
影響:再計算や異なるデータベースとの比較ができない。
対応:計算ワークフローと入力・出力の関係をメタデータとして保存し、識別子とバージョンを付ける[7,8]。
複数の装置・実験者・拠点のデータを統合する
データを結合できることと、同じ母集団として解析できることは別です。統合前に次を確認します。
- 目的値の定義と単位が同じか
- 試料作製と前処理が同じか
- 測定規格と装置原理が同じか
- 検出限界と測定範囲が同じか
- データ処理方法が同じか
- 装置、拠点、担当、時期を識別できるか
統合後は、装置別・拠点別・時期別に分布を可視化します。差がある場合は、単純に平均を合わせるのではなく、原因を確認し、必要に応じて別モデル、階層モデル、校正試料による補正を検討します。
材料データ品質を高める10ステップ
- 利用目的を決める:再現、比較、機械学習、最適化などを明確にする。
- 試料IDを付ける:原料、工程、測定、ファイルを結び付ける。
- 必須項目を定義する:空欄を許容する条件も決める。
- 原データを保存する:処理済みデータで上書きしない。
- 単位と標準語彙を決める:原値と変換後を区別する。
- 欠損理由を分類する:未測定、失敗、検出限界以下、該当なしを分ける。
- 外れ値候補を調査する:統計、物理制約、装置ログ、再測定を組み合わせる。
- 測定条件と不確かさを残す:値だけを保存しない。
- 変更履歴を記録する:修正者、日時、理由、処理コードを残す。
- 利用後に見直す:モデルの誤差分析から必要なメタデータを追加する。
材料データ品質の100点評価表
| 評価軸 | 配点 | 確認内容 |
|---|---|---|
| 正確性・妥当性 | 20 | 原データ照合、物理制約、転記・単位確認 |
| 完全性・欠損管理 | 15 | 必須項目、欠損理由、検出限界 |
| 測定条件・不確かさ | 20 | 装置、方法、環境、繰り返し、誤差 |
| メタデータ・追跡可能性 | 20 | 試料ID、原料、工程、来歴、関連ファイル |
| 単位・表記の一貫性 | 15 | 単位、名称、カテゴリ、変換履歴 |
| 代表性・偏り | 10 | 探索範囲、失敗実験、バッチ・時期の偏り |
| 合計 | 100 |
- 85~100点:再利用・機械学習へ進みやすい
- 70~84点:目的を限定して利用可能
- 50~69点:追加確認と整備が必要
- 49点以下:モデル構築前にデータ生成・管理方法を見直す
点数はデータの絶対的な価値を決めるものではありません。どの項目を整備すれば、現在の利用目的へ近づくかを議論するために使います。
材料データ品質チェックリスト
- 目的変数と利用目的が明確か
- 試料ごとに一意のIDがあるか
- 原料ロットや親試料を追跡できるか
- 0、未測定、失敗、該当なしを区別しているか
- 検出限界と定量限界を記録しているか
- 外れ値を削除した理由が残っているか
- 原値、原単位、変換後の値を区別しているか
- 材料名・工程名に標準語彙があるか
- 測定装置と校正情報があるか
- 試料形状と測定方向が分かるか
- 独立試料と繰り返し測定を区別しているか
- 生データを上書きせず保存しているか
- 処理コードと条件を再現できるか
- 失敗実験と低性能データを残しているか
- データの修正履歴とバージョンがあるか
- 装置、拠点、時期による偏りを確認したか
- 文献値の出典箇所を追跡できるか
- 予測時に取得できない情報が混入していないか
よくある質問
欠損率が何%なら列を削除すべきですか?
一律の閾値はありません。利用目的、欠損理由、データ数、取得コストによって判断します。欠損率が高くても重要な物性であれば、列を削除するより追加測定の候補になります。
欠損値を平均値で補完してもよいですか?
欠損が少なく、分布や欠損理由を確認したうえで基準手法として使うことはあります。ただし、分散が小さくなり、変数間の関係が歪む可能性があります。補完は交差検証の学習データ内で行います。
外れ値は何σ以上なら削除できますか?
標準偏差からの距離だけでは削除できません。原データ、単位、装置、試料、再現性を確認し、材料・測定上の理由がある場合に除外します。
測定条件は機械学習の特徴量に入れるべきですか?
目的によります。測定値の条件依存性を予測するなら有用です。一方、材料設計時点で取得できない測定後の情報を入れると、実運用できないモデルやデータリークにつながります。
失敗実験も機械学習に使えますか?
使えます。失敗理由が整理されていれば、分類、探索範囲の推定、次の実験選択に活用できます。ただし、装置故障と材料現象による失敗を同じラベルにまとめないことが重要です。
まとめ
材料データの品質を高めるには、欠損値を補完し、外れ値を削除するだけでは不十分です。
- 欠損した理由を分類する
- 外れ値は原因を確認してから扱う
- 原値、単位、変換履歴を残す
- 測定値と測定条件をセットで管理する
- 試料IDを中心に原料・工程・測定・ファイルを結ぶ
- 成功だけでなく失敗実験も保存する
- 原データと処理済みデータを分ける
データ品質は、解析前に一度だけ行うクリーニング作業ではありません。実験計画から測定、データベース、モデル利用まで継続的に改善する仕組みです。
MI全体の進め方は、マテリアルズ・インフォマティクスとは?進め方・活用例・失敗パターンを参照してください。少数データでのモデル設計は材料開発の少数データで機械学習を使う方法、入力変数の設計は材料開発における特徴量設計とは?で解説しています。
参考文献
- “Towards a sustainable high-quality materials data ecosystem: frameworks and strategies,” (2026). https://pmc.ncbi.nlm.nih.gov/articles/PMC13105177/
- Wuest, T. et al., “Experimental Research Data Quality in Materials Science,” International Journal of Advanced Information Technology, 4(6) (2014). https://doi.org/10.5121/ijait.2014.4601
- Rubin, D. B., “Inference and missing data,” Biometrika, 63(3), 581–592 (1976). https://doi.org/10.1093/biomet/63.3.581
- Wang, Q. et al., “When Literature Data Mislead Artificial Intelligence in Materials Discovery,” arXiv:2609.01621 (2026, preprint). https://arxiv.org/abs/2609.01621
- NIST, “Data Models for Expression of Uncertainty in Materials Data.” https://www.nist.gov/programs-projects/data-models-expression-uncertainty-materials-data(2026年10月4日閲覧)
- NIST, “Materials Data Curation System.” https://materialsdata.nist.gov/(2026年10月4日閲覧)
- Wilkinson, M. D. et al., “The FAIR Guiding Principles for scientific data management and stewardship,” Scientific Data, 3, 160018 (2016). https://doi.org/10.1038/sdata.2016.18
- Medina-Smith, A. et al., “A Controlled Vocabulary and Metadata Schema for Materials Science Data Discovery,” Data Science Journal, 20, 18 (2021). https://doi.org/10.5334/dsj-2021-018
- Raccuglia, P. et al., “Machine-learning-assisted materials discovery using failed experiments,” Nature, 533, 73–76 (2016). https://doi.org/10.1038/nature17439
- NIST, “Building the Materials Innovation Infrastructure,” NISTIR 7898. https://www.nist.gov/document/nist-ir-7898pdf(2026年10月4日閲覧)


