この研究は、サウジアラビアの研究機関の研究論文です。
掲載誌:Separations
ライセンス: CC BY 対象: 公開論文 確認元: OpenAlex
研究の目的
マンゴーはビタミンCやビタミンA、食物繊維を豊富に含み、カリウムやマグネシウムなどのミネラル、ポリフェノールをはじめとする生体活性成分も多く含む果実として知られています。著者らによれば、サウジアラビアでは特に南西部の気候が栽培に適しており、農業経済の多様化や地方の発展にとって重要な作物でもあります。
こうした果実の品質を評価するには、含まれる化学成分を正確に把握する必要があります。ただし成分を化学分析で測るには果実を切り分けて試料を作る必要があり、時間も手間もかかります。そこで研究チームは、果実を壊さずに測定できる近赤外分光法(NIRS)と統計モデリングを組み合わせ、マンゴーの品質指標をリアルタイムに推定する手法の試作を目的に据えました。対象とした指標は、ビタミンC含量、可溶性固形分(SSC)、総酸度(TA)の三つです。論文の説明では、SSCはショ糖・ブドウ糖・果糖といった可溶性の糖の濃度を反映する指標、TAはクエン酸やリンゴ酸などの有機酸の濃度を測る指標にあたります。
何をどのように調べたか
近赤外分光法とは、目に見える光より波長の長い赤外線を試料に当て、どの波長がどれだけ吸収されるかを測る手法です。分子内の結合の種類によって吸収されやすい波長が異なるため、吸収の並び方(スペクトル)から中身の組成をうかがい知ることができます。著者らは成熟前の未熟果から老化に至るまでの成熟過程を含む186個のマンゴー試料について、1000〜2500ナノメートルの波長範囲で、果実を切らないままスペクトルを記録しました。試料はKweni、Cengkir、Palmer、Kentの4品種から集められています。並行して、ビタミンCと総酸度は滴定法、SSCは屈折計によって、標準的な実験手順で実測値(参照値)も得られました。データはドイツのゲッティンゲン大学で収集された公開データセットに基づきます。
この研究の中心にあるのは、スペクトルの扱い方です。従来の多変量解析では、スペクトルを波長ごとに区切った数値の並びとして扱うことが一般的でした。これに対し著者らが用いた関数データ解析(FDA)は、一本のスペクトルを「離れた点の集まり」ではなく「連続した一本の曲線」として丸ごと扱う統計の枠組みです。論文では、この方法が滑らかで互いに強く相関するスペクトルの性質に適しており、高次元の情報を扱うのに向いていると説明されています。実際、事前の多変量因子分析では、スペクトルを少数の代表的な成分に圧縮して三つの指標を十分に予測することはできないという結果が得られ、曲線全体の構造を活かす必要性が示されました。
著者らが検討したのは、相対誤差という考え方を取り入れた三つの頑健な関数回帰モデルです。関数最小二乗相対誤差回帰(FLSR)、関数最小絶対相対誤差回帰(FLAR)、関数最小絶対偏差回帰(FLAD)の三種です。相対誤差に着目する利点として、論文は、応答変数の値の大きさが試料間で大きくばらつく場合に、ずれを比率として測るため尺度に依存しない評価ができる点を挙げています。比較対象には、分光データの解析で広く使われてきた主成分回帰(PCR)と部分最小二乗回帰(PLSR)が据えられました。186試料は品種の構成比を保ちながら無作為に分割され、100試料を学習用、86試料を検証用として、未知の試料に対する予測精度が平均二乗誤差で評価されています。
報告された主な結果
著者らの報告では、三つの指標すべてについて、関数回帰モデルが従来型のPCR・PLSRを上回る予測精度を示しました。
ビタミンCでは、検証用試料での誤差がPCRで5.96、PLSRで6.58であったのに対し、FLSRが3.72、FLARが3.94、FLADが2.08でした。この指標ではFLADが最も精度が高く安定していたと報告されており、著者らはその理由として、FLADが絶対偏差を最小化する損失関数を用いるため、極端に大きな予測誤差の影響を受けにくいことを挙げています。ビタミンCの測定値には大きなばらつきが見られたため、この性質が有利に働いたという説明です。予測に用いた波長域としては1300〜1600ナノメートルが選ばれ、アスコルビン酸の水酸基(O–H)やC–H結合に関連する吸収がこの領域に現れることが根拠とされています。
SSCでは、PCRが1.07、PLSRが1.23の誤差であったのに対し、FLSRが0.45、FLARが0.21、FLADが0.63となり、この指標ではFLARが最も精度の高い予測を与えたと報告されています。用いられた波長域は1000〜1300ナノメートルで、糖に関わる炭素-水素結合の振動と、水に関わる水酸基の振動の情報が含まれる領域とされています。著者らは、多くのモデルに応答変数をやや低めに見積もる傾向が見られたことにも触れ、関数的手法による平滑化と相対誤差型の損失関数が、予測を控えめな方向へ働かせた可能性を指摘しています。
総酸度については1750〜2000ナノメートルの領域が用いられ、クエン酸やリンゴ酸といった主要な有機酸の分子構造を構成するO–H、C–H、C=Oといった官能基に対応する吸収がこの区間に現れることが根拠として示されています。
著者らは、4品種をあえて一つのデータセットにまとめたことにも意味を見いだしています。品種によって果皮の厚さ、果肉の色、糖度や酸度の水準は異なりますが、事前に品種を判別しなくてもこうした違いを吸収できる汎用的なモデルを目指したためです。前処理では、光の散乱の影響を抑える標準正規変量変換(SNV)とベースラインの傾きを補正するデトレンド処理を行い、その後Bスプラインによる平滑化を施しています。この関数的な手順は、比較対象とした非関数的な前処理(多重散乱補正とSavitzky–Golay平滑化)よりも良い予測性能を示し、かつ追加の平滑化や調整の手間が少ない簡潔な手続きであったと報告されています。
この研究が示すこと
この研究が伝えているのは、分光データを「点の集まり」ではなく「曲線」として扱うという統計的な視点の切り替えが、果実の品質評価の精度を実際に押し上げうるということです。著者らの報告では、同じスペクトルデータから出発しても、曲線全体の構造を保つ関数回帰のほうが、従来広く使われてきた手法より小さい誤差で三つの品質指標を予測できました。
また、相対誤差や絶対偏差にもとづく頑健な定式化が、ばらつきの大きい実測データや外れ値を含むデータのもとでも安定した性能を保った点は、実験室の理想的な条件から離れた現場のデータを扱ううえで意味を持ちます。品種をまとめたまま扱えたことも含め、果実を壊さずに中身を推定するという課題に対して、統計モデルの選び方そのものが一つの改善の余地であることを、この研究は具体的な数値とともに示しています。
著者:Mohammed B. Alamari(Department of Mathematics, College of Science, King Khalid University, Abha 62223, Saudi Arabia)、Fatimah A. Almulhim(Department of Mathematical Sciences, College of Science, Princess Nourah bint Abdulrahman University, P.O. Box 84428, Riyadh 11671, Saudi Arabia)、Ali Laksaci(Department of Mathematics, College of Science, King Khalid University, Abha 62223, Saudi Arabia)
※本記事は原著論文をもとに、日本語で要約・説明を加えた研究紹介です。 出典(原著論文):Mohammed B. Alamari, Fatimah A. Almulhim, Ali Laksaci. A Data-Driven Approach for Extracting and Characterizing Chemical Attributes of Mango Fruit. Separations 2026-09-25. DOI: 10.3390/separations13100272. 原著ライセンス:CC BY.