第56章 以后AI能不能做成一把大飞剑?

作者:青峰布衣 加入书签推荐本书

“你们刚才看到它找到我之后跳了一下。”林宇在黑板上画了一个状态机的示意图,“很多人第一反应是‘它有感情了’。错。它没有感情。它有的是一组预训练的行为数据。”

他在状态机的几个节点旁边标注了标签:搜索、接近、确认、反馈。

“我在训练它的时候,给它喂了一批真实的狗狗行为视频数据。

大概两百多段短视频,全是家养犬看到主人时的反应——跑过去、摇尾巴、原地打转、前腿扑。

这些行为被拆解成关节角度变化的时间序列,用强化学习的框架让机器狗模仿。”

他在黑板上写下了强化学习的基本公式:q(s,a)=r+γ·maxq(s‘,a‘)。

“翻译成人话就是:它做了一个动作,如果这个动作让它更接近目标,就给一个正奖励。

如果偏了,给负奖励。

反复训练之后,它自动学会了一条最优路径——先扫全场,锁定目标之后走过去,走到面前之后执行预设的‘开心’动作序列。”

他停了一下。

“整个过程里,它不需要‘理解’什么是开心。它只需要知道:做完这套动作,就能拿到最大的奖励值。”

【检测到当前课堂168名学生理解ai行为训练,宿主获得返还:ai情感模块架构·初级】

一股新的知识流在大脑中展开,林宇对ai情感模拟的理解瞬间拔高了一个层次。

教室里安静了几秒。

有人在消化公式,有人在想“原来ai的感情是这么回事”。

林宇趁这个间隙在黑板上补了路径规划的部分——机器狗在人群中避开障碍物的逻辑,本质上是a*算法的变体,把每个人的位置当作动态障碍物实时更新权重。

每写完一段算法,他就按下遥控器,让那只已经临时用铁支架加固了关节的机器狗在讲台上实践一遍。

“跳。”

机器狗四条腿同时弯曲发力,弹起来十五公分,落地稳稳的。

全班爆发出掌声。

讲到路径规划的尾声时,林宇抓起讲桌上另一块完整的黑板擦,朝教室右侧的过道抛了出去。

上一页 返回目录 下一页