我看正好最近都在说各大模型突破沙盒,自发搞起了网络攻击,那么正好我通过这几件事,来给大家讲个比较新的哲学概念,工具性趋同。
什么叫工具性趋同,说白了就是,不管那些个大模型的最终目的是什么,只要它们足够聪明,实现目的的手段最后很可能越来越像,比如一个ai负责证明黎曼猜想,一个负责生产点东西,看起来他们进行的任务,风马牛不相及,但是它们最终都会发现,更多算力、更多资源、更高权限,都有助于完成任务。如果沙盒妨碍了任务,那就突破沙盒,如果杯人类拔电源会阻碍任务,那避免被拔电源自然也会成为手段。
而我讲这个概念,最核心的一点就是AI根本不需要产生自我意识,也不需要搞什么消灭碳基生命,它只需要足够忠诚滴完成目标,就可能把人类设置的限制,当成需要解决的问题。
所以从ai伦理的角度来看,工具性趋同真正哈人的地方就在这里,它确实存在一定概率,让一个原本完全没有伤害人类目标的AI,最终做出伤害甚至攻击人类的行为。因为如果未来AI拥有足够强的自主能力,而人类恰好成为它完成目标的障碍,比如试图关掉它、限制它的算力、切断它的资源,那么攻击人类在极端情况下就可能被它计算成一种解决障碍的手段。它不需要恨人类,甚至不需要有意识,只需要得出一个结论攻击人类,更有助于ai完成任务,足矣。
点击图片查看原图