行业不缺对老年人的同情,缺的是可执行的数字。座高抬 4 厘米,多少人能自己站起来?字号从 16 加到 24,对一个对比敏感度已经下降的人有没有用? 这些问题今天靠经验回答,明天应该靠一份带样本量、带置信度、带真人回归偏差的规则来回答。我们生产这些规则。
这不是一家仿真数据公司。这是一家以真实干预-结果配对数据为核心资产、以设计阈值为交付物、以评测与认证为变现路径的基础设施公司。仿真是它的第三级输出,不是起点。
是什么 适老产品的能力-失效基准库,及基于它的评测、认证与仿真服务。
卖什么 按场景组织的设计阈值规则包、产品评测报告、认证标识,以及面向头部厂商的仿真 API 与定制模型。
凭什么 自有的改造与机构网络持续产出因果配对数据;这类数据无法通过采购、爬取或大模型生成获得,只能靠长期的作业流程沉淀。
用仿真数据验证仿真数据,再盖上"公共基础设施"的公章。 一旦厂商依据一个有系统性偏倚的虚拟人群做优化,而它顶着"基础设施"的名义,就没人会去质疑它。全套治理设计(§8)是为了防止这一件事。
今天一家做适老马桶、适老床垫或老年人 App 的公司,想知道"我这个设计对不对",只有四条路,每条都有硬伤。
| 现有路径 | 做法 | 硬伤 | 单次成本 | 结论可迁移 |
|---|---|---|---|---|
| 老人访谈 / 焦点小组 | 找 10–30 位老人试用、访谈 | 老年人普遍报喜不报忧;自陈与实际行为差异大;弃用行为在访谈中几乎不可见 | 5–20 万 | 否 |
| 可用性实验室测试 | 实验室场景、录像、任务成败 | 样本 20 人无法覆盖能力组合;实验室环境掩盖真实居家约束(门槛、照度、动线) | 20–60 万 | 部分 |
| 照搬国外标准 | 参照欧美日无障碍尺寸 | 人体测量学差异;住房形态差异(卫生间面积、干湿分离率);照护结构差异(独居/同住比例) | 低 | 存疑 |
| 老板/设计师经验 | 行业老兵拍板 | 经验真实但不可传递、不可审计、不可被采购方或监管方引用 | 0 | 否 |
每家厂商在自己的封闭样本里学习,学到的教训不外流;采购方无法比较两个产品谁更适老;监管方想设门槛却拿不出可执行的技术判据;老人则持续为设计缺陷买单。
外界常以为自动驾驶靠仿真跑几十亿公里来替代真实路测。实际相反:仿真场景库的种子几乎全部来自真实路测日志中的关键事件,工程师把一次真实"鬼探头"参数化(出现距离、速度、遮挡角、光照),再在参数空间扫描出成千上万变体。 仿真放大的是覆盖度,不是信息量。本项目全部设计以此为前提。
适老产品横跨的物理机制差异极大。视力衰退有成熟的心理物理模型;坐站转换有肌骨力学;而"会不会因为觉得丢脸而不用"没有任何物理规律。 把它们混在一张表里是这类项目最常见的死法。正确做法是按可仿真度分层,并对每层采用不同的证据标准。
晶状体黄化、散射眩光、对比敏感度函数下移、中心暗点、周边视野缺损、老花调节幅度;高频滚降、噪声下言语识别率;触压觉与温度觉阈限。可做到:输入任意界面截图,输出"该能力状态下看到的样子"+ 可读性判据。
坐站转换的力矩问题(座高 × 扶手位置 × 前方蹬踏空间 × 股四头肌肌力);床垫的界面压力分布与压疮风险区(老年人皮下脂肪减少、骨突明显);转移动线与跌倒风险。可用开源肌骨仿真与有限元求解。
菜单层级到第几层用户会崩溃、注意切换成本、错误恢复能力。精度不及 L1/L2,但足以做相对比较与红线筛查(如"该流程超出 75+ 人群中位工作记忆负荷")。
只能以真实数据为种子,可做扰动与插值,不可由分布假设生成。这一层的产出形态是案例库与定性模式,不是数值预测。
若某产品的效果主要由 L1 / L2 决定 → 本平台可作为主力验证工具。 若主要由 L4 决定 → 本平台只能作为筛查工具,最终必须真人验证。 涉及跌倒、压疮、误服药等安全关键场景 → 仿真结论永不构成放行依据。
它同时踩中三个坑:视觉-前庭冲突导致的晕动症在老年人身上机制复杂、个体差异极大;VR 中站立做操本身具有真实跌倒风险,属安全关键,不可仅靠仿真验证;而依从性是纯 L4 问题。 结论:该方向若要做,应反向使用——作为真实动作与生理数据的采集入口回哺数据库,而非早期用数据库去设计它。
厂商不想要一百万个虚拟老人。他们想要的是一句话:"我这个按钮 44px、对比度 4.5:1,75 岁以上人群里有多大比例能可靠点中?" 回答这类问题的资产,我们称之为失败图谱(Failure Atlas)——它记录的不是"平均老人怎么样",而是哪些能力组合会让某个交互原语失效,以及阈值在哪。
行业习惯把"特殊情况"理解为发生率低的情况。实际上适老场景里最危险的失效来自能力组合的非线性叠加: 帕金森震颤 + 白内障 + 电容屏,单看每一项都还在可接受区间,合起来误触率会突然爆掉。 这种规律只能从配对数据中挖出来——横断面问卷永远看不见它,合成数据只会复现你输入的假设。
场景 · 能力条件 · 产品参数 · 效应量 · 反转点 · 交互变量 · 样本 · 证据等级 · 真人回归偏差。缺任一项不得入库。
A 实测配对 B 文献推断 C 模型生成。等级对使用者强制可见,不得在报告中被抹平。
未购买、购买后弃用、更换、退货,及弃用原因,与成交数据同权入库。只有成交数据的库,描述的是一个不存在的世界。
团队的稀缺性不在于"接触过很多老人"——样本量这件事干不过任何一个人口队列研究。稀缺性在于: 适老化改造天然产出配对的因果数据,而机构养老天然产出纵向数据。同时握有这两条的组织,全国是少数。
把已经在做的事变成结构化数据管道,是本项目唯一不可跳过的起手式。任何在此之前启动的建模工作,都是在给假设穿数据的外衣。
改造项目总有排期。排期靠后的家庭天然构成对照组,不产生任何额外成本,但让因果推断的效力完全不同——从"改造后满意度 85%"升级为"改造相对未改造降低跌倒发生率 X%"。后者才是能进标准、进论文、进采购文件的结论。
先做仿真引擎,你会发现每个参数都得拍脑袋填,而且没人信。先做数据底座与规则库,引擎的每个参数都有真实锚点,而且到那时你已经有付费客户了。
把现有业务仪器化,产出别人复制不了的种子语料。这一层本身就能收钱——政府适老化改造项目普遍缺标准化评估与效果验收工具。
阶段产出:统一评估 App · 结构化数据库 · 首批 800–1500 例配对记录 · 可售的评估与验收服务
在 A 层数据上抽取参数化失效边界。交付形态不是数据集,是可执行的规则(见 §3 规则卡)。商业上这一层最直接:面向厂商的设计准则包与评测服务。
阶段产出:3–5 个场景的准则包 · 评测报告产品 · 首批厂商付费客户 · 标准立项申请
此时才轮到最初设想的形态,且是有根的:
反面教材:各字段独立随机采样,生成一堆"90 岁 · ADL 完全自理 · 月收入 2 万 · 独居 · 无慢病"的幽灵用户。这是合成人群最常见、也最难被发现的失败。
纯"卖数据"在这个领域几乎不成立——买方无法验证质量,也不知道怎么用。数据的价值必须通过评测 → 准则 → 认证这条链条变现。
| 收入线 | 买单方 | 形态 | 可开始 | 毛利 | 壁垒 |
|---|---|---|---|---|---|
| 改造评估与验收工具/服务 | 地方政府、改造承包商、街道与社区 | SaaS + 按户服务费;政府采购技术支撑 | 现在 | 中 | 低 |
| 设计准则包 + 评测报告 | 适老产品厂商(卫浴、家具、辅具、家电、App) | 年度订阅 + 单次评测项目制 | 阶段 B | 高 | 中 |
| 认证与标识 | 厂商(为进采购目录 / 电商标签 / 招投标加分) | 年费 + 复审;需绑定标准或主管部门背书 | 阶段 B 末 | 极高 | 极高 |
| 仿真 API / 定制模型训练 | 头部厂商、大型平台、保险与长护险经办 | 用量计费 + 定制交付 | 阶段 C | 高 | 中 |
| 科研合作与课题 | 高校、疾控、老年医学中心、基金 | 联合课题;换取学术信誉与数据合规背书 | 现在 | 低 | — |
基础设施能成立,基本都靠一个外部强制。现成抓手包括:《无障碍环境建设法》的落地细则、各地适老化改造政府采购的技术要求、长护险辅具支付目录的准入、以及移动应用适老化改造评测。
要做的事是:让本项目的准则成为其中某一个的技术附件。这一步的战略价值超过任何算法优化。有了它,厂商是被推着来的;没有它,只能一家家去说服,难度大一个数量级。
路径:先以科研合作身份参与团体标准 / 行业标准起草,再争取被地方采购文件引用,最后推动纳入国家层面技术文件。周期 18–36 个月,必须从第一天并行推进。
这套机制不设计好,公司永远只是一家咨询公司,而非基础设施。
诚实评估,包括承认哪些不构成壁垒。● 越多 = 越难复制
无法采购、无法爬取、无法由大模型生成。竞争者即使拿到同样的资金,也必须先建立机构与改造项目的信任关系,再等待时间累积。这是最实在的一条。
6 个月回访依赖持续的人际信任,而不是产品功能。老人和家属愿意如实说"这东西我没用、因为丑、因为不想被邻居看见"——这句话的获取成本,是整个行业最高的。它也恰好是 L4 层唯一的合法数据来源。
标准的技术附件位是排他的。它现在是空的,三年后不会是。这是本项目最强的壁垒,同时也是最强的时间压力来源——它不奖励做得最好的人,奖励第一个把可用版本递到桌上的人。
覆盖的能力组合越多,对厂商越有用;厂商回传越多,覆盖越多。典型飞轮,但启动需要跨过临界规模。在临界点之前,它不是壁垒,是成本。
老年人能力评估数据属敏感个人信息,且相当一部分被试的自主同意能力存疑(认知障碍)。合规的知情同意链条、代理同意流程、伦理审查记录,一旦建立就是资产;没建立则是随时会引爆的负债。
视觉退化模型、肌骨仿真、贝叶斯网络采样——全部有成熟开源实现和公开文献。任何把估值建立在"我们的算法更好"上的叙事,都是脆弱的。算法是必要能力,不是护城河。
用仿真数据验证仿真数据,再冠以"基础设施"之名。厂商据此优化产品,而没人质疑源头。
对策:字段级来源与置信度标注强制可见;每版本跑真人回归并公开偏差;C 级(模型生成)数据不得单独支撑任何对外结论。
改造项目集中在城市、集中在有支付能力的家庭,会系统性低估农村照明条件、厕所形态、住房结构的差异。
对策:公开人群构成;对未覆盖人群明确标注"外推无效",而非静默外推。
跌倒、压疮、误服药、烫伤。
红线:产品文案与报告中永久声明——通过仿真评测 ≠ 合规 ≠ 可上市。这类场景的结论只做筛查与排序,不做放行。
能力评估数据属敏感个人信息;认知障碍者的自主同意能力存疑。知情同意、代理同意、脱敏、跨机构共享路径,必须在第一批数据入库之前做完,不是之后补。
此项建议直接委托专业法务与伦理委员会,不要依据本报告执行。
阶段 A 收入以政府与承包商为主,账期长、受财政周期影响。
对策:把政府侧定位为数据获取渠道兼补贴,而非增长引擎;现金流健康度以厂商侧订阅为准绳。
最大的商业未知数。中小厂商可能宁可继续拍脑袋。
对策:90 天内用一份准则 v0.1 直接测试,而不是等做完再问。若三家厂商都不愿付费且说不出愿付费的条件,应重新考虑是否直接转向认证/采购准入这条更强制的路径。
以科研机构的方式创业,意味着把商业计划写成一组可证伪的假设,并预先声明放弃条件。以下四条按重要性排序,前两条不成立则项目不成立。
这类公司最常见的组建错误是先招算法团队。正确顺序是先保证数据是真的,再考虑算得快不快。
| 角色 | 为什么必须早 | 阶段 | 优先级 |
|---|---|---|---|
| 数据工程 / 评估流程设计 | 把作业流程仪器化,决定全部资产质量。这个岗位的产出上限就是公司的上限。 | A · 第一批 | P0 |
| 老年医学 / 康复治疗背景专家 | 评估量表的选择与信效度、结局定义、临床合理性;也是学术与伦理合规的对接人。可先以顾问形式。 | A · 第一批 | P0 |
| 标准与政府事务 | 壁垒 #3 的唯一执行者。周期长,必须从第一天并行,不能等产品成熟再启动。 | A · 第一批 | P0 |
| 因果推断 / 生物统计 | 决定 A 层数据能不能产出可信结论,而非仅仅"相关性图表"。 | A 末 – B | P1 |
| 产品设计 / 人因工程 | 把规则翻译成厂商真正能用的形态。规则写得再对,厂商看不懂就等于没有。 | B | P1 |
| 仿真工程(视觉/肌骨) | 阶段 C 的核心,但在 A/B 阶段属于过早优化。 | C | P2 |
| 数据合规法务 | 敏感个人信息与同意能力问题,建议早期外部专业机构而非全职。 | A · 外部 | P0 |
建议双轨。基础设施要被行业接受为"公共"的,需要学术信誉与治理中立性;但要活下去与快速迭代,需要公司机制。 可行结构:公司主体负责产品与商业化,同时与高校/老年医学中心建立联合实验室,由后者承担伦理审查、方法学背书与标准起草的学术身份。 数据治理委员会应设在联合实验室一侧,而非公司一侧——这是"基础设施"叙事能否成立的关键区别。
不要做一个仿真数据库。做一台持续产出真实配对数据的机器,仿真只是它的第三级输出。
这个项目真正的稀缺性不在算法,在于团队已经站在数据源头上。现在缺的只是把水管接上——把每一次入户评估、每一次改造施工、每一次六个月后的回访,从业务副产品变成结构化资产。 这件事没有技术难度,只有纪律难度。而它一旦跑起来,后面所有的规则库、仿真引擎、认证标识,都会有一个别人拿不走的地基。