測定スコアと集団推定値の違い — そしてなぜ1つのアプリが両方を明確にラベル付けして表示し、決して混同しないのか。
アプリが表示できる年齢の数値には2種類あります。ほとんどの製品はどちらを表示しているか一切説明しません。
測定スコアは入力値に対する計算です。血液が入力され、決定論的な計算式が実行され、数値が出力されます。同じ入力には毎回同じ数値が出ます。手で検証できます。
集団推定値は、あなたの特性を持つ人物に対して統計モデルが予測する値です。他の数千人のデータに直線をあてはめることで構築されます。データが不完全な場合、モデルはコホート平均で欠損を補填します — そのため数値の動きは小さくなります。より多くの部分が他者のデータであり、あなた自身のデータは少ないからです。
DeltaのCorpus画面のDELTA ageは後者の種類であり、そのように表示されています。「Healthspan Copilot」論文(PLOS One)に由来します:血液検査値に加えてウエスト周囲径・体重・血圧・脈拍の10変数に対する通常最小二乗回帰で、CDCの248人のデータセットで訓練されたものです。適合した係数は、論文自身の訓練データで回帰を再実行することで復元されました。その適合が論文の計算例を公表値まで再現していることが、復元されたモデルが論文のモデルであることの証拠です。
そのモデルが出力する数値を信頼する前に知っておくべき性質が2つあります。
暦年齢の重みはほぼゼロです。回帰はバイオマーカーだけから生物学的年齢を予測することを学習しました — 同じマーカーを持つ30歳と60歳はほぼ同じ推定値を得ます。これは論文のデータセットによるものであり、実装上のバグではありません。そのため不完全なDELTA ageはデータがほとんど変わらなくても動きません:ほとんどの入力が欠損している場合、モデルはほぼ全員に同じ数値を返します。その数値の大部分はコホートそのものだからです。
また、このデータセットへの適合において直感に反する係数も存在します — hs-CRPが高いほど・体重が重いほど推定値が下がり、HDLが高いほど推定値が上がります。これらは論文の数値を忠実に実装したものです。また、小規模コホートのOLS適合は生理学ではなく推定値に過ぎないことを思い起こさせます。
正直に提示された推定値は有用だからです。Deltaはその出所を添えた形でのみDELTA ageを表示します:「推定値」というラベル(「測定済み」という言葉は使いません)、モデルのバージョン文字列、入力がコホート平均になるにつれて低下する信頼度表示、そして論文自身の免責事項。入力の半数以上が補完された場合、アプリは数値の表示を完全に停止します — 大半が訓練セットに関するものである数値を見る価値はなく、まして意思決定には使えません。
Adaptive Age — アプリの基軸となる決定論的な血液スコアPhenoAge — と共存しますが、決して混在しません。異なる画面、異なるラベル、異なる不確実性。どの数値を見ているか分からなくなった日が、製品があなたを失敗させた日です。
Deltaのすべてのスコアは純粋なバージョン管理された計算によって算出されます — デバイス上の言語モデルがバイオマーカーの計算を行うことは決してありません。すべての入力は出所が明記されるか補完済みとラベル付けされます。すべての数値はその方法を持ちます。推定値は推定値として提示され、測定値はその根拠を保持します。
そして、それが結局のところ、ツールと感覚の違いのすべてです。